MATH-500
かんたんに言うと · コンテストレベルの数学問題500問をどれだけ解けるか
- 何を測定しますか?
- Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。高校の競技レベルの数学問題500問で、計算・代数・幾何・確率の力を見ます。AIME より易しく、範囲は広めです。
- 誰がどのように評価しますか?
- UC バークレーの研究陣による MATH データセット(12,500問)から、OpenAI が2023年の研究で代表標本として抽出した500問です。答えが定まっているため自動採点で、Artificial Analysis が自ら実行します。
- スコアの読み方
- 0〜100%。最新のAIの多くが95%を超え、事実上満点争いのため、この点数だけでは優劣がつけにくいです。
順位
最高スコア99.4%GPT-5
測定したモデル10件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデルリリース日価格/1Mスコア
- 12025.08.07$7.8199.4%
- 22025.05.22$1299.1%
- 32025.05.22$6098.2%
- 42025.06.17$1.9598.1%

- 52025.06.17$7.8196.7%

- 62025.04.14$6.5091.3%
- 72025.04.05$0.7088.9%
- 82025.04.05$0.3784.4%
- 92025.01.28$181.7%
- 102026.03.16$0.4956.2%
直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個
出典: Artificial Analysis データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。