Arena Document

高いほど良い

ユーザーがPDFをアップロードして質問・要約・情報抽出を頼むと、名前を伏せた2つのモデルが答え、ユーザーが良い方に投票します。実際のユーザー文書で長い文書を読み分析する能力を見ます。スコアは人による対戦投票から算出したEloスコアです。高いほど良い結果です。

最高スコア1516Claude Opus 5
測定したモデル34件
最終更新2026.09.13
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇AnthropicClaude Opus 5推論強度: High1516
  2. 🥈AnthropicClaude Fable 5.11513
  3. 🥉AnthropicClaude Opus 4.6推論強度: High1507
  4. #4AnthropicClaude Fable 51496
  5. #5AnthropicClaude Opus 4.71495
  6. #6OpenAIGPT-5.51486
  7. #7OpenAIGPT-5.6 Sol1483
  8. #8AnthropicClaude Sonnet 4.61482
  9. #9AnthropicClaude Opus 4.8推論強度: High1475
  10. #10OpenAIGPT-5.6 Terra1472
  11. #11OpenAIGPT-5.41471
  12. #12MetaMuse Spark 1.31471
  13. #13OpenAIGPT-6 Astra1468
  14. #14AnthropicClaude Sonnet 51466
  15. #15MetaMuse Spark 1.11465
  16. #16GoogleGemini 3.5 Flash1463
  17. #17AnthropicClaude Opus 4.51462
  18. #18OpenAIGPT-5.6 Luna1457
  19. #19GoogleGemini 3.6 Flash1456
  20. #20xAIGrok 4.61452
  21. #21xAIGrok 4.51452
  22. #22Moonshot AIKimi K2.61451
  23. #23AnthropicClaude Sonnet 4.51450
  24. #24MetaMuse Spark1444
  25. #25AlibabaQwen3.7 Plus1444
  26. #26GoogleGemini 3.1 Pro1444
  27. #27MiniMaxMiniMax M31435
  28. #28Moonshot AIKimi K2.51430
  29. #29GoogleGemma 4 31B1425
  30. #30GoogleGemini 2.5 Pro1421
  31. #31AnthropicClaude Haiku 4.51420
  32. #32xAIGrok 4.20 (Reasoning)1416
  33. #33Z.aiGLM 5V Turbo1416
  34. #34GoogleGemini 3 Flash1413
上位3件は誤差の範囲内 · 事実上の同率1位 · モデルの半数が1460以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。