Bench to the Future 3
낮을수록 좋음
FutureSearch가 만든 예측 시험으로, 이미 결과가 나온 실제 질문을 과거 시점에 고정한 웹 사본만 보고 예측하게 해 답을 미리 찾아볼 수 없게 했습니다. 예·아니요 질문과 수치 질문이 섞여 있고, 예측 오차(브라이어 점수)로 채점합니다. 점수는 예측 오차(Brier)입니다. 낮을수록 좋습니다.
최고 점수0.120Claude Opus 5
측정한 모델10개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록낮은 값이 좋은 시험이라 축을 뒤집었습니다 — 위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1FutureSearch agent · xhigh2026.07.24$200.120
- 2FutureSearch agent · high2026.06.09$400.130
- 3FutureSearch agent · xhigh2026.05.27$200.132
- 4Vendor agent SDK · high2026.04.23$240.134
- 5FutureSearch agent · low2026.09.04$400.135
- 5FutureSearch agent · high2026.07.09$160.135
- 7FutureSearch agent · xhigh2026.09.02$3.500.141
- 8FutureSearch agent · xhigh2026.06.30$80.142
- 9FutureSearch agent2026.08.18$3.600.149
- 9FutureSearch agent2026.08.26$0.410.149
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.