IMO-AnswerBench

인용 많음높을수록 좋음

구글 딥마인드가 만든 국제수학올림피아드 수준 문제 400개에 짧은 최종 답으로 답하는 시험입니다. 공개 순위표가 없어 제조사 발표값만 있습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.

최고 점수92.3%Nemotron 3 Ultra
측정한 모델20개
최근 갱신2026.08.07
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇NVIDIANemotron 3 Ultra92.3%
  2. 🥈Z.aiGLM 5.291.0%
  3. 🥉AlibabaQwen3.7 Max추론 강도: Extra High90.0%
  4. #4DeepSeekDeepSeek V4 Pro추론 강도: Max89.8%
  5. #5ByteDanceDola Seed 2.0 Pro89.3%
  6. #6DeepSeekDeepSeek V4 Flash추론 강도: Max88.4%
  7. #7AlibabaQwen3.7 Plus86.0%
  8. #7Moonshot AIKimi K2.6추론 강도: Thinking86.0%
  9. #9TencentHy384.3%
  10. #10AlibabaQwen3.6 Plus83.8%
  11. #10Z.aiGLM-5.183.8%
  12. #12Motif TechnologiesMotif 383.2%
  13. #13Z.aiGLM-582.5%
  14. #14Moonshot AIKimi K2.5추론 강도: Thinking81.8%
  15. #14MeituanLongCat 2.081.8%
  16. #16AlibabaQwen3.6 Flash78.9%
  17. #16AlibabaQwen3.6 35B A3B78.9%
  18. #18LG AI ResearchK-EXAONE 2.0추론 강도: Thinking78.6%
  19. #19DeepSeekDeepSeek V3.2추론 강도: Thinking78.3%
  20. #20LG AI ResearchK-EXAONE추론 강도: Thinking76.3%
모델 절반이 83.8% 이하측정: 제조사 발표최종 갱신 2026-10-07

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.

제조사 발표값은 측정 조건이 제각각이라 참고용입니다.