MMMU-Pro

よく引用高いほど良い · 画像入力モデルのみ

大学レベルの30科目で、図・表・グラフを含む問題を解くMMMUを難しくした版です。文章だけで解ける問題を除き、選択肢を10個に増やし、問題全体を1枚の画像で渡す方式も加えました。公式ランキングもありますが、大半は開発元の発表を集めたもので、データの利用条件が確認できないため、ここには開発元の発表原文からツールなしで測った値だけを載せています。スコアは0〜100%です。高いほど良い結果です。

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア83.6%Gemini 3.5 Flash
測定したモデル37件
最終更新2026.09.20
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 3.5 Flash83.6%
  2. 🥈OpenAIGPT-5.6 Sol83.0%
  3. 🥉Moonshot AIKimi K3推論強度: Max81.6%
  4. #4GoogleGemini 3 Flash推論強度: Thinking81.2%
  5. #4OpenAIGPT-5.5推論強度: Extra High81.2%
  6. #4OpenAIGPT-5.4推論強度: Extra High81.2%
  7. #7OpenAIGPT-5.6 Terra80.7%
  8. #8GoogleGemini 3.1 Pro推論強度: High80.5%
  9. #9MetaMuse Spark推論強度: Thinking80.4%
  10. #10Moonshot AIKimi K2.6推論強度: Thinking79.4%
  11. #11AlibabaQwen3.7 Plus79.0%
  12. #11AlibabaQwen3.5 397B A17B推論強度: Thinking79.0%
  13. #13AlibabaQwen3.6 Plus78.8%
  14. #14Moonshot AIKimi K2.5推論強度: Thinking78.5%
  15. #15OpenAIGPT-5.6 Luna78.4%
  16. #16ByteDanceDola Seed 2.0 Pro78.2%
  17. #17MiniMaxMiniMax M378.1%
  18. #18XiaomiMiMo V2.577.9%
  19. #19GoogleGemma 4 31B76.9%
  20. #20GoogleGemini 3.1 Flash Lite推論強度: High76.8%
  21. #21OpenAIGPT-5.4 Mini推論強度: Extra High76.6%
  22. #22StepfunStep-5推論強度: High76.0%
  23. #22ByteDanceDola Seed 2.0 Lite76.0%
  24. #24AlibabaQwen3.6 Flash75.3%
  25. #24AlibabaQwen3.6 35B A3B75.3%
  26. #26AnthropicClaude Sonnet 4.6推論強度: Max74.5%
  27. #27AnthropicClaude Opus 4.6推論強度: Max73.9%
  28. #28ByteDanceDola Seed 2.0 mini71.4%
  29. #29AnthropicClaude Opus 4.5推論強度: Max70.6%
  30. #30BaiduERNIE 5.0 Thinking68.6%
  31. #31GoogleGemini 2.5 Pro推論強度: Thinking68.0%
  32. #32OpenAIGPT-5 Mini推論強度: High67.5%
  33. #32AnthropicClaude Sonnet 4.5推論強度: Max67.5%
  34. #34GoogleGemini 2.5 Flash推論強度: Thinking66.7%
  35. #35OpenAIGPT-5.4 Nano推論強度: Extra High66.1%
  36. #36AmazonNova 2 Lite61.8%
  37. #37GoogleGemini 2.5 Flash Lite推論強度: Thinking51.0%
モデルの半数が76.9%以下測定: 開発元の発表最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。