JobBench
인용 많음높을수록 좋음
35개 직업에서 가져온 실제 직장 업무에 가까운 과제 65개를 AI가 도구를 써서 해내는지, 결과 파일까지 살펴보는 채점 기준으로 평가하는 시험입니다. 운영팀은 모든 모델을 같은 OpenCode 환경에서 잽니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수65.7%Claude Opus 5
측정한 모델26개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇표를 읽고 원하는 형태로 정리할 수 있을까?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Opus 565.7%
- 🥈MetaMuse Spark 1.364.9%
- 🥉XiaomiMiMo-V2.6-Pro62.0%
- #4TencentHy4 preview추론 강도: Max61.7%
- #5MetaMuse Spark 1.261.6%
- #6Z.aiGLM 5.361.4%
- #7XiaomiMiMo-V2.6-Flash61.2%
- #8StepfunStep-5추론 강도: High59.0%
- #9AnthropicClaude Fable 557.4%
- #10AlibabaQwen3.8 Flash55.7%
- #11MetaMuse Spark 1.154.7%
- #12Moonshot AIKimi K354.3%
- #13AnthropicClaude Opus 4.848.4%
- #14OpenAIGPT-5.6 Sol45.4%
- #15AnthropicClaude Opus 4.744.5%
- #16Z.aiGLM 5.243.4%
- #17OpenAIGPT-5.538.3%
- #18AnthropicClaude Sonnet 4.636.6%
- #19OpenAIGPT-5.432.2%
- #20GoogleGemini 3.5 Flash31.5%
- #21AlibabaQwen3.7 Plus27.6%
- #22NVIDIANemotron 3 Ultra27.2%
- #23XiaomiMiMo V2.5 Pro25.0%
- #24AnthropicClaude Sonnet 4.520.7%
- #25MetaMuse Spark17.0%
- #26GoogleGemini 3.1 Pro15.9%
모델 절반이 46.9% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.
제조사 발표값은 측정 조건이 제각각이라 참고용입니다.