Humanity's Last Exam (with tools)
인용 많음높을수록 좋음
100개가 넘는 분야 전문가가 만든 문제 2,500개로 된 Humanity's Last Exam을, 검색·코드 실행 같은 도구를 쓰게 하고 푼 점수입니다. 도구 없이 잰 점수와는 다른 조건입니다. 점수는 0~100%입니다. 높을수록 좋습니다.
이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.
최고 점수67.7%Claude Opus 5.5
측정한 모델44개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
대중들이 가장 선호하면서 틀린 말도 없는 답변을 하는 AI는?Arena Text Factuality
Gemini 4 Argon🥇
Gemini 4 Argon🥇검색 없이도 사실을 정확하게 알고 있을까?SimpleQA Verified
GPT-6 Astra🥇
GPT-6 Astra🥇여러 단계에 걸친 웹 조사를 해낼 수 있을까?Deep Research Bench
Claude Opus 4.6🥇
Claude Opus 4.6🥇
- 🥇AnthropicClaude Opus 5.5추론 강도: Max67.7%
- 🥈AnthropicClaude Fable 5.1추론 강도: Max65.0%
- 🥉AnthropicClaude Opus 5추론 강도: Max64.7%
- #4DeepSeekDeepSeek V4.1 Flash추론 강도: Max63.9%
- #4AnthropicClaude Fable 563.9%
- #6Z.aiGLM 5.3추론 강도: Max62.5%
- #7MetaMuse Spark 1.1추론 강도: Extra High62.1%
- #8StepfunStep-5추론 강도: High59.4%
- #9OpenAIGPT-5.4 Pro추론 강도: Extra High58.7%
- #10AnthropicClaude Opus 4.8추론 강도: Max57.9%
- #11AnthropicClaude Sonnet 5추론 강도: Max57.4%
- #12OpenAIGPT-6 Astra57.2%
- #13Moonshot AIKimi K3추론 강도: Max56.0%
- #14Moonshot AIKimi K2.6추론 강도: Thinking55.5%
- #15TencentHy4 preview추론 강도: Max55.4%
- #16Z.aiGLM 5.3 Flash추론 강도: Max55.3%
- #17Z.aiGLM 5.254.7%
- #17AnthropicClaude Opus 4.7추론 강도: Max54.7%
- #19ByteDanceDola Seed 2.0 Pro54.2%
- #20AlibabaQwen3.7 Max53.5%
- #21AnthropicClaude Opus 4.6추론 강도: Max53.0%
- #22Z.aiGLM-5.152.3%
- #23OpenAIGPT-5.5추론 강도: Extra High52.2%
- #24OpenAIGPT-5.4추론 강도: Extra High52.1%
- #25Moonshot AIKimi K2.5추론 강도: Thinking51.8%
- #26GoogleGemini 3.1 Pro추론 강도: High51.4%
- #27AlibabaQwen3.6 Plus50.6%
- #28MetaMuse Spark추론 강도: Thinking50.4%
- #28Z.aiGLM-550.4%
- #30StepfunStep 3.7 Flash49.7%
- #31AnthropicClaude Sonnet 4.6추론 강도: Max49.0%
- #32DeepSeekDeepSeek V4 Pro추론 강도: Max48.2%
- #33XiaomiMiMo V2.5 Pro48.0%
- #34DeepSeekDeepSeek V4 Flash추론 강도: Max45.1%
- #35GoogleGemini 3 Flash추론 강도: Thinking43.5%
- #36AnthropicClaude Opus 4.5추론 강도: None43.2%
- #37OpenAIGPT-5.4 Mini추론 강도: Extra High41.5%
- #38DeepSeekDeepSeek V3.2추론 강도: Thinking40.8%
- #39OpenAIGPT-5.4 Nano추론 강도: Extra High37.7%
- #40NVIDIANemotron 3 Ultra37.4%
- #41AnthropicClaude Sonnet 4.533.6%
- #42GoogleGemma 4 31B26.5%
- #43NVIDIANemotron 3 Super22.8%
- #44OpenAIGPT OSS 120B추론 강도: High19.0%
모델 절반이 52.3% 이하측정: 제조사 발표최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.
제조사 발표값은 측정 조건이 제각각이라 참고용입니다.