JobBench

인용 많음높을수록 좋음

35개 직업에서 가져온 실제 직장 업무에 가까운 과제 65개를 AI가 도구를 써서 해내는지, 결과 파일까지 살펴보는 채점 기준으로 평가하는 시험입니다. 운영팀은 모든 모델을 같은 OpenCode 환경에서 잽니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수65.7%Claude Opus 5
측정한 모델26개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Opus 565.7%
  2. 🥈MetaMuse Spark 1.364.9%
  3. 🥉XiaomiMiMo-V2.6-Pro62.0%
  4. #4TencentHy4 preview추론 강도: Max61.7%
  5. #5MetaMuse Spark 1.261.6%
  6. #6Z.aiGLM 5.361.4%
  7. #7XiaomiMiMo-V2.6-Flash61.2%
  8. #8StepfunStep-5추론 강도: High59.0%
  9. #9AnthropicClaude Fable 557.4%
  10. #10AlibabaQwen3.8 Flash55.7%
  11. #11MetaMuse Spark 1.154.7%
  12. #12Moonshot AIKimi K354.3%
  13. #13AnthropicClaude Opus 4.848.4%
  14. #14OpenAIGPT-5.6 Sol45.4%
  15. #15AnthropicClaude Opus 4.744.5%
  16. #16Z.aiGLM 5.243.4%
  17. #17OpenAIGPT-5.538.3%
  18. #18AnthropicClaude Sonnet 4.636.6%
  19. #19OpenAIGPT-5.432.2%
  20. #20GoogleGemini 3.5 Flash31.5%
  21. #21AlibabaQwen3.7 Plus27.6%
  22. #22NVIDIANemotron 3 Ultra27.2%
  23. #23XiaomiMiMo V2.5 Pro25.0%
  24. #24AnthropicClaude Sonnet 4.520.7%
  25. #25MetaMuse Spark17.0%
  26. #26GoogleGemini 3.1 Pro15.9%
모델 절반이 46.9% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.

제조사 발표값은 측정 조건이 제각각이라 참고용입니다.