Bench to the Future 3
低いほど良い
FutureSearchが作った予測の試験で、すでに結果が出た実際の質問を、過去の時点で固定したウェブのコピーだけを見て予測させ、答えを先に調べられないようにしています。はい・いいえの質問と数値の質問が混ざり、予測誤差(ブライアースコア)で採点します。スコアは予測誤差(Brier)です。低いほど良い結果です。
最高スコア0.120Claude Opus 5
測定したモデル10件
モデルのリリース時期(右が最新)
その時点の最高記録低い値ほど良い試験のため軸を反転しています — 上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1FutureSearch agent · xhigh2026.07.24$200.120
- 2FutureSearch agent · high2026.06.09$400.130
- 3FutureSearch agent · xhigh2026.05.27$200.132
- 4Vendor agent SDK · high2026.04.23$240.134
- 5FutureSearch agent · low2026.09.04$400.135
- 5FutureSearch agent · high2026.07.09$160.135
- 7FutureSearch agent · xhigh2026.09.02$3.500.141
- 8FutureSearch agent · xhigh2026.06.30$80.142
- 9FutureSearch agent2026.08.18$3.600.149
- 9FutureSearch agent2026.08.26$0.410.149
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。