ForecastBench Brier Index

かんたんに言うと · まだ起きていない出来事をどれだけ正確に予測するか

何を測定しますか?
この表のAIの点数は多くの場合、人々の集団予測値も与えられた条件の値です(モデルによっては単独条件の場合があります)。まだ起きていないことをどれだけ当てられるかです。「来月失業率は上がるか」「この地域の紛争は増えるか」といった質問に確率で答えさせ、実際の結果が出た後に採点します。知識ではなく判断力を見ます。
誰がどのように評価しますか?
予測研究所(Forecasting Research Institute)が2週間ごとに1,000問を出します。予測市場(Metaculus・Polymarket など)の問題と、公式統計(経済指標・紛争データ・株価など)から作った問題を混ぜ、7日から10年までの複数の期限で問います。結果が確定すると Brier スコア(予測確率と実際の結果の差)で採点し、この表はそのうち「データセット」問題の点数を0〜100の指数に変換した値を使います。 リーダーボードには同じAIの変種(単独/集団予測値付き)が複数あり、集団予測値(予測市場の確率)を与えた変種を優先し、なければ別の変種を選びます。自動でひも付けたモデルは収集のたびにこの選択をやり直し、特定の変種に固定したモデルはその変種がリーダーボードから外れた場合にのみ代表の変種に切り替わります。
スコアの読み方
0〜100、高いほど良い。50は「常に50%」と答える無情報の基準なので、50未満は当てずっぽう以下です。人間の比較群(2024年調査)では、専門予測者が一般大衆と最上位AIの両方を上回りました。結果確定に時間がかかるため、最新のAIは点数が遅れて出ます。 集団予測値を参照した条件の点数は、AI単独の判断力より高く出ることがあります。

順位

最高スコア62.6Grok 4.20 (Reasoning)
測定したモデル27件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 162.6
  2. 2
    xAI2026.03.09
    61.7
  3. 3
    OpenAI2025.08.07
    61.3
  4. 4
    Anthropic2025.05.22
    60.6
  5. 5
    OpenAI2025.08.07
    60.4
  6. 6
    Anthropic2025.11.24
    60.2
  7. 7
    Z.ai2026.02.11
    60.2
  8. 860.2
  9. 9
    Anthropic2025.08.05
    60.1
  10. 10
    Anthropic2025.09.29
    60.1

直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個

出典: ForecastBench データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。