IMO-AnswerBench

引用多め高いほど良い

Google DeepMindが作った国際数学オリンピック級の問題400問に、短い最終解答で答える試験です。公開ランキングがないため、開発元の発表値だけがあります。スコアは0〜100%です。高いほど良い結果です。

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア92.3%Nemotron 3 Ultra
測定したモデル20件
最終更新2026.08.07
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇NVIDIANemotron 3 Ultra92.3%
  2. 🥈Z.aiGLM 5.291.0%
  3. 🥉AlibabaQwen3.7 Max推論強度: Extra High90.0%
  4. #4DeepSeekDeepSeek V4 Pro推論強度: Max89.8%
  5. #5ByteDanceDola Seed 2.0 Pro89.3%
  6. #6DeepSeekDeepSeek V4 Flash推論強度: Max88.4%
  7. #7AlibabaQwen3.7 Plus86.0%
  8. #7Moonshot AIKimi K2.6推論強度: Thinking86.0%
  9. #9TencentHy384.3%
  10. #10AlibabaQwen3.6 Plus83.8%
  11. #10Z.aiGLM-5.183.8%
  12. #12Motif TechnologiesMotif 383.2%
  13. #13Z.aiGLM-582.5%
  14. #14Moonshot AIKimi K2.5推論強度: Thinking81.8%
  15. #14MeituanLongCat 2.081.8%
  16. #16AlibabaQwen3.6 Flash78.9%
  17. #16AlibabaQwen3.6 35B A3B78.9%
  18. #18LG AI ResearchK-EXAONE 2.0推論強度: Thinking78.6%
  19. #19DeepSeekDeepSeek V3.2推論強度: Thinking78.3%
  20. #20LG AI ResearchK-EXAONE推論強度: Thinking76.3%
モデルの半数が83.8%以下測定: 開発元の発表最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。