BrowseComp
引用多め高いほど良い
OpenAIが作ったウェブ閲覧の試験で、何度も調べて手がかりをつなぎ合わせないと答えが出ない難問1,266問に答えます。答えは短く確認しやすい一方、見つけるのは難しく作られています。スコアは0〜100%です。高いほど良い結果です。
このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。
最高スコア92.2%GPT-5.6 Sol
測定したモデル40件
最終更新2026.09.20
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
多くの人に好まれ、しかも間違いのない回答をするAIは?Arena Text Factuality
Gemini 4 Argon🥇
Gemini 4 Argon🥇検索しなくても、事実を正確に知っている?SimpleQA Verified
GPT-6 Astra🥇
GPT-6 Astra🥇何段階にもわたるWeb調査をこなせる?Deep Research Bench
Claude Opus 4.6🥇
Claude Opus 4.6🥇
- 🥇OpenAIGPT-5.6 Sol推論強度: Max92.2%
- 🥈OpenAIGPT-6 Astra91.5%
- 🥉Moonshot AIKimi K3推論強度: Max91.2%
- #4AnthropicClaude Opus 5推論強度: Max90.8%
- #5OpenAIGPT-5.4 Pro推論強度: Extra High89.3%
- #6StepfunStep-5推論強度: High88.7%
- #7AnthropicClaude Opus 4.8推論強度: Max88.5%
- #8OpenAIGPT-5.6 Terra87.5%
- #9AnthropicClaude Fable 587.4%
- #10AnthropicClaude Sonnet 5推論強度: Max86.6%
- #11AnthropicClaude Opus 4.6推論強度: Max86.6%
- #12Moonshot AIKimi K2.6推論強度: Thinking86.3%
- #13GoogleGemini 3.1 Pro推論強度: High85.9%
- #14OpenAIGPT-5.5推論強度: Extra High84.4%
- #15MiniMaxMiniMax M383.5%
- #16DeepSeekDeepSeek V4 Pro推論強度: Max83.4%
- #17OpenAIGPT-5.6 Luna83.3%
- #18OpenAIGPT-5.4推論強度: Extra High82.7%
- #19AnthropicClaude Sonnet 4.6推論強度: Max82.1%
- #20MeituanLongCat 2.079.9%
- #21AnthropicClaude Opus 4.779.8%
- #22Moonshot AIKimi K2.5推論強度: Thinking78.4%
- #23ByteDanceDola Seed 2.0 Pro77.3%
- #24MiniMaxMiniMax M2.776.3%
- #24MiniMaxMiniMax M2.576.3%
- #26StepfunStep 3.7 Flash75.8%
- #27DeepSeekDeepSeek V4 Flash推論強度: Max73.2%
- #28Z.aiGLM-5.168.0%
- #29AnthropicClaude Opus 4.5推論強度: Max (no thinking)67.8%
- #30TencentHy367.1%
- #31Z.aiGLM-562.0%
- #32DeepSeekDeepSeek V3.2推論強度: Thinking51.4%
- #33UpstageSolar Pro 449.2%
- #34Mistral AIMistral Medium 3.5推論強度: Max48.6%
- #35NVIDIANemotron 3 Ultra44.4%
- #36AnthropicClaude Sonnet 4.543.9%
- #37LG AI ResearchK-EXAONE推論強度: None31.4%
- #38NVIDIANemotron 3 Super31.3%
- #39Mistral AIMistral Small 421.3%
- #40SK TelecomA.X K2推論強度: Thinking9.3%
モデルの半数が79.8%以下測定: 開発元の発表最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。
メーカー発表値は測定条件がまちまちなので参考値です。