Arena Search
引用多め高いほど良い
ユーザーが質問すると、ウェブ検索を使う2つのAIが出典付きで答え、ユーザーが良い方に投票します。引用の表示方法は、モデルが見分けられないよう統一されています。スコアは人による対戦投票から算出したEloスコアです。高いほど良い結果です。
最高スコア1257GPT-5.6 Sol
測定したモデル7件
最終更新2026.08.24
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に好まれ、しかも間違いのない回答をするAIは?Arena Text Factuality
Gemini 4 Argon🥇
Gemini 4 Argon🥇検索しなくても、事実を正確に知っている?SimpleQA Verified
GPT-6 Astra🥇
GPT-6 Astra🥇何段階にもわたるWeb調査をこなせる?Deep Research Bench
Claude Opus 4.6🥇
Claude Opus 4.6🥇
- 🥇OpenAIGPT-5.6 Sol1257
- 🥈AnthropicClaude Opus 4.71233
- 🥉AnthropicClaude Fable 51230
- #4xAIGrok 4.51213
- #5AnthropicClaude Opus 4.81204
- #6xAIGrok 4.201189
- #7xAIGrok 4.31165
モデルの半数が1213以下最終更新 2026-10-07