SWE-Bench Pro
よく引用高いほど良い
Scale AIが作った試験で、実際のオープンソースリポジトリの長いソフトウェア課題をAIが直し、隠しテストを通せるかを見ます(公開セット731件)。開発元ごとに使った課題セットやツールが違うため、条件もあわせて見る必要があります。スコアは0〜100%です。高いほど良い結果です。
このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。
最高スコア89.9%Claude Opus 5.5
測定したモデル52件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
数時間かかる開発の仕事も、コンピューターを自分で操作して最後までやり遂げられる?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇多くの人に最も好まれるコーディングの回答をするAIは?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇コードを実行しながら直して、課題を終えられる?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Opus 5.5推論強度: Max89.9%
- 🥈AnthropicClaude Fable 5.1推論強度: Max81.2%
- 🥉AnthropicClaude Fable 5推論強度: Max80.0%
- #4AnthropicClaude Opus 5推論強度: Max79.2%
- #5AnthropicClaude Opus 4.8推論強度: Max69.2%
- #6TencentHy4 preview推論強度: Max65.7%
- #7xAIGrok 4.5推論強度: High64.7%
- #8OpenAIGPT-5.6 Sol64.6%
- #9AnthropicClaude Opus 4.7推論強度: Max64.3%
- #10OpenAIGPT-5.6 Terra63.4%
- #11AnthropicClaude Sonnet 5推論強度: Max63.2%
- #12OpenAIGPT-5.6 Luna62.7%
- #13AlibabaQwen3.8 Flash62.5%
- #14Z.aiGLM 5.262.1%
- #15MetaMuse Spark 1.1推論強度: Extra High61.5%
- #16AlibabaQwen3.7 Max60.6%
- #17MeituanLongCat 2.059.5%
- #18MiniMaxMiniMax M359.0%
- #19GoogleGemini 3.6 Flash58.7%
- #20OpenAIGPT-5.5推論強度: Extra High58.6%
- #20Moonshot AIKimi K2.6推論強度: Thinking58.6%
- #22Z.aiGLM-5.158.4%
- #23AnthropicClaude Sonnet 4.658.1%
- #24OpenAIGPT-5.4推論強度: Extra High57.7%
- #25AlibabaQwen3.7 Plus57.6%
- #26AlibabaQwen3.6 Max57.3%
- #27XiaomiMiMo V2.5 Pro57.2%
- #28AlibabaQwen3.6 Plus56.6%
- #29StepfunStep 3.7 Flash56.3%
- #30MiniMaxMiniMax M2.756.2%
- #31XiaomiMiMo V2.556.1%
- #32MiniMaxMiniMax M2.555.4%
- #32DeepSeekDeepSeek V4 Pro推論強度: Max55.4%
- #34GoogleGemini 3.5 Flash55.1%
- #34Z.aiGLM-555.1%
- #36XiaomiMiMo V2 Pro55.0%
- #36MetaMuse Spark55.0%
- #38OpenAIGPT-5.4 Mini推論強度: Extra High54.4%
- #39GoogleGemini 3.5 Flash-Lite推論強度: High54.2%
- #39GoogleGemini 3.1 Pro推論強度: High54.2%
- #41AnthropicClaude Opus 4.653.4%
- #42DeepSeekDeepSeek V4 Flash推論強度: Max52.6%
- #43OpenAIGPT-5.4 Nano推論強度: Extra High52.4%
- #44AnthropicClaude Opus 4.5推論強度: None52.0%
- #45Moonshot AIKimi K2.550.7%
- #46GoogleGemini 3 Flash49.6%
- #47AlibabaQwen3.6 Flash49.5%
- #47AlibabaQwen3.6 35B A3B49.5%
- #49PoolsideLaguna M.149.2%
- #50ByteDanceDola Seed 2.0 Pro46.9%
- #51CohereNorth Mini Code40.2%
- #52GoogleGemini 3.1 Flash Lite38.3%
モデルの半数が57.3%以下測定: 開発元の発表最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。
メーカー発表値は測定条件がまちまちなので参考値です。