Arena Document
高いほど良い
ユーザーがPDFをアップロードして質問・要約・情報抽出を頼むと、名前を伏せた2つのモデルが答え、ユーザーが良い方に投票します。実際のユーザー文書で長い文書を読み分析する能力を見ます。スコアは人による対戦投票から算出したEloスコアです。高いほど良い結果です。
最高スコア1516Claude Opus 5
測定したモデル34件
最終更新2026.09.13
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
複数の長い文書に散らばった情報を、まとめて答えられる?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇表を読んで、求める形に整理できる?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇多くの人に最も好まれるビジネスの回答をするAIは?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Opus 5推論強度: High1516
- 🥈AnthropicClaude Fable 5.11513
- 🥉AnthropicClaude Opus 4.6推論強度: High1507
- #4AnthropicClaude Fable 51496
- #5AnthropicClaude Opus 4.71495
- #6OpenAIGPT-5.51486
- #7OpenAIGPT-5.6 Sol1483
- #8AnthropicClaude Sonnet 4.61482
- #9AnthropicClaude Opus 4.8推論強度: High1475
- #10OpenAIGPT-5.6 Terra1472
- #11OpenAIGPT-5.41471
- #12MetaMuse Spark 1.31471
- #13OpenAIGPT-6 Astra1468
- #14AnthropicClaude Sonnet 51466
- #15MetaMuse Spark 1.11465
- #16GoogleGemini 3.5 Flash1463
- #17AnthropicClaude Opus 4.51462
- #18OpenAIGPT-5.6 Luna1457
- #19GoogleGemini 3.6 Flash1456
- #20xAIGrok 4.61452
- #21xAIGrok 4.51452
- #22Moonshot AIKimi K2.61451
- #23AnthropicClaude Sonnet 4.51450
- #24MetaMuse Spark1444
- #25AlibabaQwen3.7 Plus1444
- #26GoogleGemini 3.1 Pro1444
- #27MiniMaxMiniMax M31435
- #28Moonshot AIKimi K2.51430
- #29GoogleGemma 4 31B1425
- #30GoogleGemini 2.5 Pro1421
- #31AnthropicClaude Haiku 4.51420
- #32xAIGrok 4.20 (Reasoning)1416
- #33Z.aiGLM 5V Turbo1416
- #34GoogleGemini 3 Flash1413
上位3件は誤差の範囲内 · 事実上の同率1位 · モデルの半数が1460以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。