Bench to the Future 3

低いほど良い

FutureSearchが作った予測の試験で、すでに結果が出た実際の質問を、過去の時点で固定したウェブのコピーだけを見て予測させ、答えを先に調べられないようにしています。はい・いいえの質問と数値の質問が混ざり、予測誤差(ブライアースコア)で採点します。スコアは予測誤差(Brier)です。低いほど良い結果です。

最高スコア0.120Claude Opus 5
測定したモデル10件
モデルのリリース時期(右が最新)
その時点の最高記録低い値ほど良い試験のため軸を反転しています — 上ほど良い
  1. 1
    Anthropic2026.07.24 · FutureSearch agent · xhigh
    0.120
  2. 2
    Anthropic2026.06.09 · FutureSearch agent · high
    0.130
  3. 3
    Anthropic2026.05.27 · FutureSearch agent · xhigh
    0.132
  4. 4
    OpenAI2026.04.23 · Vendor agent SDK · high
    0.134
  5. 5
    OpenAI2026.09.04 · FutureSearch agent · low
    0.135
  6. 5
    OpenAI2026.07.09 · FutureSearch agent · high
    0.135
  7. 7
    Meta2026.09.02 · FutureSearch agent · xhigh
    0.141
  8. 8
    Anthropic2026.06.30 · FutureSearch agent · xhigh
    0.142
  9. 9
    Z.ai2026.08.18 · FutureSearch agent
    0.149
  10. 9
    Z.ai2026.08.26 · FutureSearch agent
    0.149

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。