CharXiv (Reasoning)

引用多め高いほど良い · 画像入力モデルのみ

arXiv論文に載っている実際のグラフを見て、何段階かの推論をしないと答えられない質問に答える試験です(検証セット1,000問)。画像を扱えるモデルだけが参加します。スコアは0〜100%です。高いほど良い結果です。

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア91.3%Kimi K3
測定したモデル31件
最終更新2026.09.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇Moonshot AIKimi K3推論強度: Max91.3%
  2. 🥈AnthropicClaude Opus 4.7推論強度: Max91.0%
  3. 🥉AlibabaQwen3.8 Flash90.6%
  4. #4AnthropicClaude Opus 4.8推論強度: Max89.9%
  5. #5GoogleGemini 3.6 Flash89.4%
  6. #5Z.aiGLM 5.3 Flash推論強度: Max89.4%
  7. #7MetaMuse Spark88.9%
  8. #8GoogleGemini 3.7 Flash88.7%
  9. #9MetaMuse Spark 1.1推論強度: Extra High88.4%
  10. #10AnthropicClaude Sonnet 5推論強度: Max88.3%
  11. #11Moonshot AIKimi K2.6推論強度: Thinking86.7%
  12. #12GoogleGemini 3.8 Flash86.2%
  13. #13AlibabaQwen3.7 Plus85.9%
  14. #14GoogleGemini 3.5 Flash84.9%
  15. #15GoogleGemini 3.1 Pro83.3%
  16. #16AlibabaQwen3.6 Plus81.5%
  17. #17OpenAIGPT-5推論強度: High81.1%
  18. #18XiaomiMiMo V2.581.0%
  19. #19ByteDanceDola Seed 2.0 Pro80.5%
  20. #20GoogleGemini 3 Flash推論強度: Thinking80.3%
  21. #21Moonshot AIKimi K2.578.7%
  22. #22AlibabaQwen3.6 Flash78.0%
  23. #22AlibabaQwen3.6 35B A3B78.0%
  24. #24AnthropicClaude Opus 4.6推論強度: Max77.4%
  25. #24AnthropicClaude Sonnet 4.6推論強度: Max77.4%
  26. #26GoogleGemini 3.5 Flash-Lite推論強度: High76.5%
  27. #27GoogleGemini 3.1 Flash Lite75.6%
  28. #28OpenAIGPT-5 Mini推論強度: High75.5%
  29. #29GoogleGemini 2.5 Pro推論強度: Thinking69.6%
  30. #30AnthropicClaude Opus 4.5推論強度: Max68.7%
  31. #31BaiduERNIE 5.0 Thinking67.1%
上位6件が91.3%付近 · 最上位は見分けにくい · モデルの半数が81.5%以下測定: 開発元の発表最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。