AIME 2025

かんたんに言うと · 米国の高校数学コンテストの問題をどれだけ解けるか

何を測定しますか?
Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。米国の高校生数学オリンピック予選(AIME)の2025年の実際の問題を解かせます。公式を知っているかではなく、初見の問題を最後まで解き切る数学的思考を見ます。
誰がどのように評価しますか?
米国数学協会(MAA)が出題した2025年 AIME の30問すべてを使います。答えが0〜999の整数なので自動採点でき、Artificial Analysis が自ら実行します。
スコアの読み方
0〜100%。人間なら満点は非常に稀な試験ですが、最新の推論型AIは90%以上を出すことが多く、識別力が急速に落ちました。問題が30問のため1問の差が約3.3ポイントです。

順位

最高スコア97.0%Gemini 3 Flash
測定したモデル24件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 3 Flash推論強度: Thinking97.0%
  2. 🥈OpenAIGPT-5推論強度: High94.3%
  3. 🥈AmazonNova 2 Lite推論強度: High94.3%
  4. #4OpenAIGPT OSS 120B推論強度: High93.4%
  5. #5DeepSeekDeepSeek V3.2推論強度: Thinking92.0%
  6. #6AnthropicClaude Opus 4.5推論強度: Thinking91.3%
  7. #7NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking91.0%
  8. #8OpenAIGPT-5 Mini推論強度: High90.7%
  9. #9LG AI ResearchK-EXAONE推論強度: Thinking90.3%
  10. #10xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking89.3%
  11. #11AnthropicClaude Sonnet 4.5推論強度: Thinking88.0%
  12. #12GoogleGemini 2.5 Pro87.7%
  13. #13BaiduERNIE 5.0 Thinking85.0%
  14. #14AnthropicClaude Haiku 4.5推論強度: Thinking83.7%
  15. #14OpenAIGPT-5 Nano推論強度: High83.7%
  16. #16AnthropicClaude Opus 4.1推論強度: Thinking80.3%
  17. #17AnthropicClaude Sonnet 4推論強度: Thinking74.3%
  18. #18AnthropicClaude Opus 4推論強度: Thinking73.3%
  19. #18GoogleGemini 2.5 Flash推論強度: Thinking73.3%
  20. #20GoogleGemini 2.5 Flash Lite推論強度: Thinking68.7%
  21. #21OpenAIGPT-4.134.7%
  22. #22xAIGrok 4.1 Fast推論強度: None34.3%
  23. #23MetaLlama 4 Maverick19.3%
  24. #24MetaLlama 4 Scout14.0%
モデルの半数が86.3%以下

直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個

出典: Artificial Analysis データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。