MMLU-Pro

かんたんに言うと · 14分野の大学レベルの選択問題をどれだけ正解するか

何を測定しますか?
Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。大学の教養科目を集めた MMLU の強化版です。法律・医学・工学・歴史など幅広い分野の知識と推論を併せて見ます。
誰がどのように評価しますか?
ウォータールー大学などの研究陣が、もともと4択だった MMLU を10択に増やし、易しすぎる問題や誤った問題を除いて14分野・約12,000問に再構成しました。正答率で採点し、Artificial Analysis が自ら実行します。
スコアの読み方
0〜100%。10択なので当てずっぽうなら10%です。元の MMLU より16〜33ポイント低く出るよう設計されているため、他所の MMLU スコアと直接比較してはいけません。

順位

最高スコア89.5%Claude Opus 4.5
測定したモデル28件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇AnthropicClaude Opus 4.5推論強度: Thinking89.5%
  2. 🥈GoogleGemini 3 Flash推論強度: Thinking89.0%
  3. 🥉AnthropicClaude Opus 4.1推論強度: Thinking88.0%
  4. #4AnthropicClaude Sonnet 4.5推論強度: Thinking87.5%
  5. #5AnthropicClaude Opus 4推論強度: Thinking87.3%
  6. #6OpenAIGPT-5推論強度: High87.1%
  7. #7DeepSeekDeepSeek V3.2推論強度: Thinking86.2%
  8. #7GoogleGemini 2.5 Pro86.2%
  9. #7UpstageSolar Pro 486.2%
  10. #10xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking85.4%
  11. #11AnthropicClaude Sonnet 4推論強度: Thinking84.2%
  12. #12LG AI ResearchK-EXAONE推論強度: Thinking83.8%
  13. #13OpenAIGPT-5 Mini推論強度: High83.7%
  14. #14LG AI ResearchK-EXAONE 2.083.5%
  15. #15GoogleGemini 2.5 Flash推論強度: Thinking83.2%
  16. #16BaiduERNIE 5.0 Thinking83.0%
  17. #17AmazonNova 2 Lite推論強度: High81.8%
  18. #18MetaLlama 4 Maverick80.9%
  19. #19GoogleGemini 2.5 Flash Lite推論強度: Thinking80.8%
  20. #19OpenAIGPT OSS 120B推論強度: High80.8%
  21. #21OpenAIGPT-4.180.6%
  22. #22AnthropicClaude Haiku 4.5推論強度: None80.0%
  23. #23NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking79.4%
  24. #24OpenAIGPT-5 Nano推論強度: High78.0%
  25. #25MetaLlama 4 Scout75.2%
  26. #26xAIGrok 4.1 Fast推論強度: None74.3%
  27. #27PerplexitySonar68.9%
  28. #28Mistral AIMistral Small 441.9%
モデルの半数が83.3%以下

直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個

出典: Artificial Analysis データの出典・掲載停止のご依頼

関連ニュース

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。