LiveBench Math
かんたんに言うと · 毎月新しく出す数学問題をどれだけ正解するか
- 何を測定しますか?
- 競技レベルの数学問題と証明を扱う力です。初見の問題を最後まで解き切る能力を見ます。
- 誰がどのように評価しますか?
- Abacus.AI・ニューヨーク大学などの研究陣が作った LiveBench は、最近の大会問題・論文・ニュースから毎月新しい問題を出し、AIが学習中に問題を見た可能性(汚染)を減らします。答えが定まった問題だけを出してプログラムが自動採点し、別のAIは採点しません。この表は livebench.ai が公開した最新の月次結果表を取得しますが、最新の表にないAIは最後に掲載されたスコアを順位を付けずに表の下に別に表示します。 数学科目は最近の AMC・AIME 大会問題(文章と選択肢を変えて出題)、USAMO・IMO 証明の欠けた段階の補完、難しく作った計算問題(AMPS)で構成されます。
- スコアの読み方
- 0〜100点です。問題が難しく設計されており最上位AIでも70点を超えるのは難しく、毎月問題が変わるため時点の異なる点数の直接比較は避けてください。 答えが定まった問題なので、解説の親切さは点数に影響しません。
最終更新: 2026-06-25
順位
最高スコア97.0Claude Fable 5.1
測定したモデル50件
最終更新2026.06.25
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Fable 5.197.0
- 🥈OpenAIGPT-6 Astra96.8
- 🥉AnthropicClaude Opus 5.596.8
- #4AnthropicClaude Sonnet 5.596.7
- #5OpenAIGPT-6.1 Sol96.5
- #6OpenAIGPT-6 Sol96.4
- #7OpenAIGPT-5.6 Sol96.2
- #8AnthropicClaude Fable 596.0
- #9MetaMuse Spark 1.396.0
- #10OpenAIGPT-5.595.9
- #11AnthropicClaude Opus 595.7
- #12xAIGrok 4.795.7
- #13OpenAIGPT-5.6 Terra94.9
- #14AnthropicClaude Opus 4.894.3
- #15OpenAIGPT-5.494.2
- #16GoogleGemini 3.7 Flash93.5
- #17DeepSeekDeepSeek V4.1 Flash93.3
- #18AnthropicClaude Sonnet 592.9
- #19AnthropicClaude Opus 4.792.8
- #20xAIGrok 4.692.6
- #21GoogleGemini 3.8 Flash91.6
- #22MetaMuse Spark 1.291.2
- #23GoogleGemini 3.1 Pro91.0
- #24OpenAIGPT-5.4 Nano91.0
- #25xAIGrok 4.590.8
- #26DeepSeekDeepSeek V4 Pro90.7
- #27AnthropicClaude Opus 4.590.4
- #28Z.aiGLM 5.289.8
- #29AnthropicClaude Opus 4.689.3
- #30OpenAIGPT-6 Luna89.1
- #31NVIDIANemotron 3 Ultra88.7
- #32GoogleGemini 3.5 Flash88.2
- #33Z.aiGLM 5.387.9
- #34OpenAIGPT-5.6 Luna87.2
- #35MetaMuse Spark 1.187.1
- #36AnthropicClaude Sonnet 4.687.0
- #37GoogleGemini 3.6 Flash86.4
- #38AlibabaQwen3.8 Flash85.8
- #39AlibabaQwen3.7 Max85.3
- #40Moonshot AIKimi K384.4
- #41xAIGrok 4.384.3
- #42Moonshot AIKimi K2.684.3
- #43AlibabaQwen3.6 Plus83.7
- #44Z.aiGLM 5.3 Flash81.2
- #45DeepSeekDeepSeek V4 Flash79.7
- #46Moonshot AIKimi K2.7 Code79.6
- #47OpenAIGPT-5.4 Mini78.5
- #48xAIGrok Build 0.178.4
- #49MiniMaxMiniMax M377.0
- #50GoogleGemini 3.5 Flash-Lite73.7
モデルの半数が90.8以下最終更新 2026-06-25
以前の版のスコア
最新ランキング(2026.06.25)に反映されていないスコアです。出典から外れたか、まだ更新されていないモデルで、最後に取得したスコアを参考として表示し、順位は付けません。
- —2026.07.22$0.9795.8
- —2026.03.31$2.1987.1
- —2025.08.07$7.8186.2
- —2026.04.07$3.6584.9
- —2026.01.27$2.2784.9
- —2025.09.15$0.4283.7
- —2026.02.11$2.4083.5
- —2026.03.18$0.9780.5
- —2026.04.27$0.8978.9
- —2026.02.12$0.9777.4
- —2026.03.18$2.5077.0

- —2025.08.07$1.5674.4
- —2026.04.02$0.3473.9

- —2026.03.03$1.1973.6

- —2025.08.05$6073.2
- —2025.05.22$1270.5
- —2026.04.01$3.3070.4
- —2025.08.05$0.4068.9
- —2025.06.17$1.9568.8

- —2025.06.17$7.8168.3

- —2025.12.17$2.3868.1

- —2025.08.07$0.3164.7
- —2025.12.01$0.8364.0
- —2025.09.29$1262.6
- —2025.09.25$0.3361.0

- —2025.10.15$458.0
- —2026.03.09$2.1945.5
- —2026.04.01$0.6644.9
- —2025.11.19$0.4238.9
- —2026.03.11$0.3436.4
直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個
出典: LiveBench データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。