MATH-500

かんたんに言うと · コンテストレベルの数学問題500問をどれだけ解けるか

何を測定しますか?
Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。高校の競技レベルの数学問題500問で、計算・代数・幾何・確率の力を見ます。AIME より易しく、範囲は広めです。
誰がどのように評価しますか?
UC バークレーの研究陣による MATH データセット(12,500問)から、OpenAI が2023年の研究で代表標本として抽出した500問です。答えが定まっているため自動採点で、Artificial Analysis が自ら実行します。
スコアの読み方
0〜100%。最新のAIの多くが95%を超え、事実上満点争いのため、この点数だけでは優劣がつけにくいです。

順位

最高スコア99.4%GPT-5
測定したモデル10件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2025.08.07
    99.4%
  2. 2
    Anthropic2025.05.22
    99.1%
  3. 3
    Anthropic2025.05.22
    98.2%
  4. 4
    Google2025.06.17
    98.1%
  5. 5
    Google2025.06.17
    96.7%
  6. 6
    OpenAI2025.04.14
    91.3%
  7. 7
    Meta2025.04.05
    88.9%
  8. 8
    Meta2025.04.05
    84.4%
  9. 9
    Perplexity2025.01.28
    81.7%
  10. 10
    Mistral AI2026.03.16
    56.2%

直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個

出典: Artificial Analysis データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。