FrontierMath Tier 4 (2025-07)
旧バージョン高いほど良い
Epoch AIのFrontierMathのうち最も難しい研究レベルの数学問題群(第4段階)の旧第1版(非公開48問)です。AIはPythonを使い、正確な答えを出す必要があります。2026年6月に第2版に置き換えられて更新されておらず、第2版のスコアとは比較できません。スコアは0〜100%です。高いほど良い結果です。
新しいバージョンがあります: FrontierMath Tier 4 v2
最高スコア31.3%Claude Opus 4.8
測定したモデル29件
最終更新2026.06.08
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1max2026.05.27$2031.3%
- 2xhigh2026.03.05$1227.1%
- 3xhigh2026.04.16$2022.9%
- 4max2026.02.04$2022.9%
- 52026.02.19$9.5016.7%

- 62026.04.08—14.6%
- 7high2026.05.19$7.1314.6%

- 82026.04.20$2.8114.6%
- 9high2025.08.07$7.8112.5%
- 92026.04.07$3.6512.5%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。