AIME 2025
かんたんに言うと · 米国の高校数学コンテストの問題をどれだけ解けるか
- 何を測定しますか?
- Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。米国の高校生数学オリンピック予選(AIME)の2025年の実際の問題を解かせます。公式を知っているかではなく、初見の問題を最後まで解き切る数学的思考を見ます。
- 誰がどのように評価しますか?
- 米国数学協会(MAA)が出題した2025年 AIME の30問すべてを使います。答えが0〜999の整数なので自動採点でき、Artificial Analysis が自ら実行します。
- スコアの読み方
- 0〜100%。人間なら満点は非常に稀な試験ですが、最新の推論型AIは90%以上を出すことが多く、識別力が急速に落ちました。問題が30問のため1問の差が約3.3ポイントです。
順位
最高スコア97.0%Gemini 3 Flash
測定したモデル24件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇GoogleGemini 3 Flash推論強度: Thinking97.0%
- 🥈OpenAIGPT-5推論強度: High94.3%
- 🥈AmazonNova 2 Lite推論強度: High94.3%
- #4OpenAIGPT OSS 120B推論強度: High93.4%
- #5DeepSeekDeepSeek V3.2推論強度: Thinking92.0%
- #6AnthropicClaude Opus 4.5推論強度: Thinking91.3%
- #7NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking91.0%
- #8OpenAIGPT-5 Mini推論強度: High90.7%
- #9LG AI ResearchK-EXAONE推論強度: Thinking90.3%
- #10xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking89.3%
- #11AnthropicClaude Sonnet 4.5推論強度: Thinking88.0%
- #12GoogleGemini 2.5 Pro87.7%
- #13BaiduERNIE 5.0 Thinking85.0%
- #14AnthropicClaude Haiku 4.5推論強度: Thinking83.7%
- #14OpenAIGPT-5 Nano推論強度: High83.7%
- #16AnthropicClaude Opus 4.1推論強度: Thinking80.3%
- #17AnthropicClaude Sonnet 4推論強度: Thinking74.3%
- #18AnthropicClaude Opus 4推論強度: Thinking73.3%
- #18GoogleGemini 2.5 Flash推論強度: Thinking73.3%
- #20GoogleGemini 2.5 Flash Lite推論強度: Thinking68.7%
- #21OpenAIGPT-4.134.7%
- #22xAIGrok 4.1 Fast推論強度: None34.3%
- #23MetaLlama 4 Maverick19.3%
- #24MetaLlama 4 Scout14.0%
モデルの半数が86.3%以下
直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個
出典: Artificial Analysis データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。