GSO-Bench

높을수록 좋음

실제 코드와 성능 테스트를 주고, 전문 개발자가 했던 최적화만큼 코드를 빠르게 만드는지 보는 시험입니다(5개 언어, 10개 코드베이스, 과제 102개). 정확성을 지키면서 전문가 속도 향상의 95% 이상을 한 번에 달성한 비율로 채점합니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수88.2%Claude Fable 5.1
측정한 모델18개
최근 갱신2026.09.27
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Fable 5.188.2%
  2. 🥈OpenAIGPT-6 Astra79.4%
  3. 🥉AnthropicClaude Fable 578.4%
  4. #4OpenAIGPT-5.6 Sol76.5%
  5. #5AnthropicClaude Opus 4.847.1%
  6. #6AnthropicClaude Opus 4.7추론 강도: High44.1%
  7. #7AnthropicClaude Opus 4.6추론 강도: High41.2%
  8. #8OpenAIGPT-5.5추론 강도: Extra High40.2%
  9. #9AnthropicClaude Sonnet 537.3%
  10. #10OpenAIGPT-5.4추론 강도: Extra High31.4%
  11. #11AnthropicClaude Opus 4.526.5%
  12. #12GoogleGemini 3.1 Pro22.6%
  13. #13AnthropicClaude Sonnet 4.514.7%
  14. #14GoogleGemini 3 Flash9.8%
  15. #15AnthropicClaude Opus 46.9%
  16. #16OpenAIGPT-5추론 강도: High6.9%
  17. #17AnthropicClaude Sonnet 44.9%
  18. #18GoogleGemini 2.5 Pro3.9%
모델 절반이 34.3% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.