IMO-AnswerBench
인용 많음높을수록 좋음
구글 딥마인드가 만든 국제수학올림피아드 수준 문제 400개에 짧은 최종 답으로 답하는 시험입니다. 공개 순위표가 없어 제조사 발표값만 있습니다. 점수는 0~100%입니다. 높을수록 좋습니다.
이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.
최고 점수92.3%Nemotron 3 Ultra
측정한 모델20개
최근 갱신2026.08.07
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
여러 분야 전문가도 어려워하는 문제를 풀 수 있을까?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇연구 수준의 물리 문제를 풀 수 있을까?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇대중들이 가장 선호하는 수학 답변을 하는 AI는?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇NVIDIANemotron 3 Ultra92.3%
- 🥈Z.aiGLM 5.291.0%
- 🥉AlibabaQwen3.7 Max추론 강도: Extra High90.0%
- #4DeepSeekDeepSeek V4 Pro추론 강도: Max89.8%
- #5ByteDanceDola Seed 2.0 Pro89.3%
- #6DeepSeekDeepSeek V4 Flash추론 강도: Max88.4%
- #7AlibabaQwen3.7 Plus86.0%
- #7Moonshot AIKimi K2.6추론 강도: Thinking86.0%
- #9TencentHy384.3%
- #10AlibabaQwen3.6 Plus83.8%
- #10Z.aiGLM-5.183.8%
- #12Motif TechnologiesMotif 383.2%
- #13Z.aiGLM-582.5%
- #14Moonshot AIKimi K2.5추론 강도: Thinking81.8%
- #14MeituanLongCat 2.081.8%
- #16AlibabaQwen3.6 Flash78.9%
- #16AlibabaQwen3.6 35B A3B78.9%
- #18LG AI ResearchK-EXAONE 2.0추론 강도: Thinking78.6%
- #19DeepSeekDeepSeek V3.2추론 강도: Thinking78.3%
- #20LG AI ResearchK-EXAONE추론 강도: Thinking76.3%
모델 절반이 83.8% 이하측정: 제조사 발표최종 갱신 2026-10-07
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.
제조사 발표값은 측정 조건이 제각각이라 참고용입니다.