GSO-Bench
높을수록 좋음
실제 코드와 성능 테스트를 주고, 전문 개발자가 했던 최적화만큼 코드를 빠르게 만드는지 보는 시험입니다(5개 언어, 10개 코드베이스, 과제 102개). 정확성을 지키면서 전문가 속도 향상의 95% 이상을 한 번에 달성한 비율로 채점합니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수88.2%Claude Fable 5.1
측정한 모델18개
최근 갱신2026.09.27
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇대중들이 가장 선호하는 코딩 답변을 하는 AI는?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Fable 5.188.2%
- 🥈OpenAIGPT-6 Astra79.4%
- 🥉AnthropicClaude Fable 578.4%
- #4OpenAIGPT-5.6 Sol76.5%
- #5AnthropicClaude Opus 4.847.1%
- #6AnthropicClaude Opus 4.7추론 강도: High44.1%
- #7AnthropicClaude Opus 4.6추론 강도: High41.2%
- #8OpenAIGPT-5.5추론 강도: Extra High40.2%
- #9AnthropicClaude Sonnet 537.3%
- #10OpenAIGPT-5.4추론 강도: Extra High31.4%
- #11AnthropicClaude Opus 4.526.5%
- #12GoogleGemini 3.1 Pro22.6%
- #13AnthropicClaude Sonnet 4.514.7%
- #14GoogleGemini 3 Flash9.8%
- #15AnthropicClaude Opus 46.9%
- #16OpenAIGPT-5추론 강도: High6.9%
- #17AnthropicClaude Sonnet 44.9%
- #18GoogleGemini 2.5 Pro3.9%
모델 절반이 34.3% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.