Humanity's Last Exam (with tools)

인용 많음높을수록 좋음

100개가 넘는 분야 전문가가 만든 문제 2,500개로 된 Humanity's Last Exam을, 검색·코드 실행 같은 도구를 쓰게 하고 푼 점수입니다. 도구 없이 잰 점수와는 다른 조건입니다. 점수는 0~100%입니다. 높을수록 좋습니다.

이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.

최고 점수67.7%Claude Opus 5.5
측정한 모델44개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇AnthropicClaude Opus 5.5추론 강도: Max67.7%
  2. 🥈AnthropicClaude Fable 5.1추론 강도: Max65.0%
  3. 🥉AnthropicClaude Opus 5추론 강도: Max64.7%
  4. #4DeepSeekDeepSeek V4.1 Flash추론 강도: Max63.9%
  5. #4AnthropicClaude Fable 563.9%
  6. #6Z.aiGLM 5.3추론 강도: Max62.5%
  7. #7MetaMuse Spark 1.1추론 강도: Extra High62.1%
  8. #8StepfunStep-5추론 강도: High59.4%
  9. #9OpenAIGPT-5.4 Pro추론 강도: Extra High58.7%
  10. #10AnthropicClaude Opus 4.8추론 강도: Max57.9%
  11. #11AnthropicClaude Sonnet 5추론 강도: Max57.4%
  12. #12OpenAIGPT-6 Astra57.2%
  13. #13Moonshot AIKimi K3추론 강도: Max56.0%
  14. #14Moonshot AIKimi K2.6추론 강도: Thinking55.5%
  15. #15TencentHy4 preview추론 강도: Max55.4%
  16. #16Z.aiGLM 5.3 Flash추론 강도: Max55.3%
  17. #17Z.aiGLM 5.254.7%
  18. #17AnthropicClaude Opus 4.7추론 강도: Max54.7%
  19. #19ByteDanceDola Seed 2.0 Pro54.2%
  20. #20AlibabaQwen3.7 Max53.5%
  21. #21AnthropicClaude Opus 4.6추론 강도: Max53.0%
  22. #22Z.aiGLM-5.152.3%
  23. #23OpenAIGPT-5.5추론 강도: Extra High52.2%
  24. #24OpenAIGPT-5.4추론 강도: Extra High52.1%
  25. #25Moonshot AIKimi K2.5추론 강도: Thinking51.8%
  26. #26GoogleGemini 3.1 Pro추론 강도: High51.4%
  27. #27AlibabaQwen3.6 Plus50.6%
  28. #28MetaMuse Spark추론 강도: Thinking50.4%
  29. #28Z.aiGLM-550.4%
  30. #30StepfunStep 3.7 Flash49.7%
  31. #31AnthropicClaude Sonnet 4.6추론 강도: Max49.0%
  32. #32DeepSeekDeepSeek V4 Pro추론 강도: Max48.2%
  33. #33XiaomiMiMo V2.5 Pro48.0%
  34. #34DeepSeekDeepSeek V4 Flash추론 강도: Max45.1%
  35. #35GoogleGemini 3 Flash추론 강도: Thinking43.5%
  36. #36AnthropicClaude Opus 4.5추론 강도: None43.2%
  37. #37OpenAIGPT-5.4 Mini추론 강도: Extra High41.5%
  38. #38DeepSeekDeepSeek V3.2추론 강도: Thinking40.8%
  39. #39OpenAIGPT-5.4 Nano추론 강도: Extra High37.7%
  40. #40NVIDIANemotron 3 Ultra37.4%
  41. #41AnthropicClaude Sonnet 4.533.6%
  42. #42GoogleGemma 4 31B26.5%
  43. #43NVIDIANemotron 3 Super22.8%
  44. #44OpenAIGPT OSS 120B추론 강도: High19.0%
모델 절반이 52.3% 이하측정: 제조사 발표최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.

제조사 발표값은 측정 조건이 제각각이라 참고용입니다.