OSWorld 2.0

자주 인용높을수록 좋음 · 이미지 입력 모델만

OSWorld의 2판으로, 숙련자도 과제당 평균 1.6시간쯤 걸리는 긴 실무(데스크톱과 웹 앱을 오가는 작업) 108개를 AI가 500번 이내의 동작으로 끝내야 합니다. 과제마다 약 27개 확인 항목을 모두 통과해야 성공입니다. 제작사 발표 수치는 이 공식 점수보다 훨씬 높게 나오는 경우가 많아 섞으면 안 됩니다. 점수는 0~100%입니다. 높을수록 좋습니다.

최고 점수44.3%Claude Opus 5
측정한 모델9개
최근 갱신2026.10.05
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Opus 5추론 강도: Max44.3%
  2. 🥈OpenAIGPT-5.6 Sol추론 강도: Max27.3%
  3. 🥉AnthropicClaude Opus 4.8추론 강도: Max20.6%
  4. #4AnthropicClaude Opus 4.7추론 강도: Max18.2%
  5. #5OpenAIGPT-5.5추론 강도: Extra High13.0%
  6. #6AnthropicClaude Sonnet 4.6추론 강도: Medium9.3%
  7. #7Moonshot AIKimi K2.6추론 강도: Thinking4.6%
  8. #7MiniMaxMiniMax M3추론 강도: Thinking4.6%
  9. #9AlibabaQwen3.7 Plus추론 강도: Thinking2.8%
1위가 2위보다 17.0%p 앞섬 · 모델 절반이 13.0% 이하최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.