OSWorld 2.0
자주 인용높을수록 좋음 · 이미지 입력 모델만
OSWorld의 2판으로, 숙련자도 과제당 평균 1.6시간쯤 걸리는 긴 실무(데스크톱과 웹 앱을 오가는 작업) 108개를 AI가 500번 이내의 동작으로 끝내야 합니다. 과제마다 약 27개 확인 항목을 모두 통과해야 성공입니다. 제작사 발표 수치는 이 공식 점수보다 훨씬 높게 나오는 경우가 많아 섞으면 안 됩니다. 점수는 0~100%입니다. 높을수록 좋습니다.
최고 점수44.3%Claude Opus 5
측정한 모델9개
최근 갱신2026.10.05
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
고객 응대 업무를 규정에 맞게 처리할 수 있을까?τ³-Banking
Grok 4.6🥇
Grok 4.6🥇컴퓨터를 직접 다뤄 전문가의 실무를 해낼 수 있을까?Agents' Last Exam
Gemini 4 Argon🥇
Gemini 4 Argon🥇작은 사업을 1년 동안 혼자 운영해 돈을 벌 수 있을까?Vending-Bench 2
GPT-6 Astra🥇
GPT-6 Astra🥇
- 🥇AnthropicClaude Opus 5추론 강도: Max44.3%
- 🥈OpenAIGPT-5.6 Sol추론 강도: Max27.3%
- 🥉AnthropicClaude Opus 4.8추론 강도: Max20.6%
- #4AnthropicClaude Opus 4.7추론 강도: Max18.2%
- #5OpenAIGPT-5.5추론 강도: Extra High13.0%
- #6AnthropicClaude Sonnet 4.6추론 강도: Medium9.3%
- #7Moonshot AIKimi K2.6추론 강도: Thinking4.6%
- #7MiniMaxMiniMax M3추론 강도: Thinking4.6%
- #9AlibabaQwen3.7 Plus추론 강도: Thinking2.8%
1위가 2위보다 17.0%p 앞섬 · 모델 절반이 13.0% 이하최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.