MMLU-Pro
かんたんに言うと · 14分野の大学レベルの選択問題をどれだけ正解するか
- 何を測定しますか?
- Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。大学の教養科目を集めた MMLU の強化版です。法律・医学・工学・歴史など幅広い分野の知識と推論を併せて見ます。
- 誰がどのように評価しますか?
- ウォータールー大学などの研究陣が、もともと4択だった MMLU を10択に増やし、易しすぎる問題や誤った問題を除いて14分野・約12,000問に再構成しました。正答率で採点し、Artificial Analysis が自ら実行します。
- スコアの読み方
- 0〜100%。10択なので当てずっぽうなら10%です。元の MMLU より16〜33ポイント低く出るよう設計されているため、他所の MMLU スコアと直接比較してはいけません。
順位
最高スコア89.5%Claude Opus 4.5
測定したモデル28件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
複数の試験を合わせた総合力はどのくらい?AA Intelligence Index
Claude Opus 5.5🥇
Claude Opus 5.5🥇多くの人に最も好まれる回答をするAIは?Arena Text
Gemini 4 Argon🥇
Gemini 4 Argon🥇覚えた答えではなく、初めて見る問題も解ける?LiveBench Overall
Claude Fable 5.1🥇
Claude Fable 5.1🥇
- 🥇AnthropicClaude Opus 4.5推論強度: Thinking89.5%
- 🥈GoogleGemini 3 Flash推論強度: Thinking89.0%
- 🥉AnthropicClaude Opus 4.1推論強度: Thinking88.0%
- #4AnthropicClaude Sonnet 4.5推論強度: Thinking87.5%
- #5AnthropicClaude Opus 4推論強度: Thinking87.3%
- #6OpenAIGPT-5推論強度: High87.1%
- #7DeepSeekDeepSeek V3.2推論強度: Thinking86.2%
- #7GoogleGemini 2.5 Pro86.2%
- #7UpstageSolar Pro 486.2%
- #10xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking85.4%
- #11AnthropicClaude Sonnet 4推論強度: Thinking84.2%
- #12LG AI ResearchK-EXAONE推論強度: Thinking83.8%
- #13OpenAIGPT-5 Mini推論強度: High83.7%
- #14LG AI ResearchK-EXAONE 2.083.5%
- #15GoogleGemini 2.5 Flash推論強度: Thinking83.2%
- #16BaiduERNIE 5.0 Thinking83.0%
- #17AmazonNova 2 Lite推論強度: High81.8%
- #18MetaLlama 4 Maverick80.9%
- #19GoogleGemini 2.5 Flash Lite推論強度: Thinking80.8%
- #19OpenAIGPT OSS 120B推論強度: High80.8%
- #21OpenAIGPT-4.180.6%
- #22AnthropicClaude Haiku 4.5推論強度: None80.0%
- #23NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking79.4%
- #24OpenAIGPT-5 Nano推論強度: High78.0%
- #25MetaLlama 4 Scout75.2%
- #26xAIGrok 4.1 Fast推論強度: None74.3%
- #27PerplexitySonar68.9%
- #28Mistral AIMistral Small 441.9%
モデルの半数が83.3%以下
直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個
出典: Artificial Analysis データの出典・掲載停止のご依頼関連ニュース
このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。