FrontierMath Tier 4 (2025-07)

旧バージョン高いほど良い

Epoch AIのFrontierMathのうち最も難しい研究レベルの数学問題群(第4段階)の旧第1版(非公開48問)です。AIはPythonを使い、正確な答えを出す必要があります。2026年6月に第2版に置き換えられて更新されておらず、第2版のスコアとは比較できません。スコアは0〜100%です。高いほど良い結果です。

新しいバージョンがあります: FrontierMath Tier 4 v2

最高スコア31.3%Claude Opus 4.8
測定したモデル29件
最終更新2026.06.08
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.05.27 · max
    31.3%
  2. 2
    OpenAI2026.03.05 · xhigh
    27.1%
  3. 3
    Anthropic2026.04.16 · xhigh
    22.9%
  4. 4
    Anthropic2026.02.04 · max
    22.9%
  5. 5
    Google2026.02.19
    16.7%
  6. 6
    Meta2026.04.08
    14.6%
  7. 7
    Google2026.05.19 · high
    14.6%
  8. 8
    Moonshot AI2026.04.20
    14.6%
  9. 9
    OpenAI2025.08.07 · high
    12.5%
  10. 9
    Z.ai2026.04.07
    12.5%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。