Bench to the Future 3

낮을수록 좋음

FutureSearch가 만든 예측 시험으로, 이미 결과가 나온 실제 질문을 과거 시점에 고정한 웹 사본만 보고 예측하게 해 답을 미리 찾아볼 수 없게 했습니다. 예·아니요 질문과 수치 질문이 섞여 있고, 예측 오차(브라이어 점수)로 채점합니다. 점수는 예측 오차(Brier)입니다. 낮을수록 좋습니다.

최고 점수0.120Claude Opus 5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록낮은 값이 좋은 시험이라 축을 뒤집었습니다 — 위로 갈수록 좋음
  1. 1
    Anthropic2026.07.24 · FutureSearch agent · xhigh
    0.120
  2. 2
    Anthropic2026.06.09 · FutureSearch agent · high
    0.130
  3. 3
    Anthropic2026.05.27 · FutureSearch agent · xhigh
    0.132
  4. 4
    OpenAI2026.04.23 · Vendor agent SDK · high
    0.134
  5. 5
    OpenAI2026.09.04 · FutureSearch agent · low
    0.135
  6. 5
    OpenAI2026.07.09 · FutureSearch agent · high
    0.135
  7. 7
    Meta2026.09.02 · FutureSearch agent · xhigh
    0.141
  8. 8
    Anthropic2026.06.30 · FutureSearch agent · xhigh
    0.142
  9. 9
    Z.ai2026.08.18 · FutureSearch agent
    0.149
  10. 9
    Z.ai2026.08.26 · FutureSearch agent
    0.149

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.