FrontierMath Tiers 1-3 (2025-02)

旧バージョン高いほど良い

数学者が新たに作った大学上級から初期研究レベルまでの数学問題群FrontierMath第1〜3段階の旧第1版(非公開290問)です。2026年6月に誤りを直した第2版に置き換えられ、第2版のスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。

新しいバージョンがあります: FrontierMath Tiers 1-3 v2

最高スコア50.0%GPT-5.4 Pro
測定したモデル32件
最終更新2026.06.08
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    OpenAI2026.03.05 · xhigh
    50.0%
  2. 2
    OpenAI2026.03.05 · xhigh
    47.6%
  3. 3
    Anthropic2026.05.27 · max
    47.2%
  4. 4
    Anthropic2026.04.16 · xhigh
    43.8%
  5. 5
    Anthropic2026.02.04 · max
    40.7%
  6. 6
    Meta2026.04.08
    39.0%
  7. 7
    Google2026.05.19 · high
    39.0%
  8. 7
    Moonshot AI2026.04.20
    39.0%
  9. 9
    Google2026.02.19
    36.9%
  10. 10
    Google2025.12.17
    35.6%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。