FrontierCode
よく引用高いほど良い
Cognitionが作った試験で、実際のオープンソースリポジトリの難しい課題150件に対し、そのまま取り込めるレベルの修正を出す必要があります。動作、既存機能の維持、ビルド、プロジェクトの慣例まで採点し、最も難しい100件で5回試した平均をスコアとします。スコアは0〜100%です。高いほど良い結果です。
最高スコア54.6%Claude Opus 5.5
測定したモデル36件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
数時間かかる開発の仕事も、コンピューターを自分で操作して最後までやり遂げられる?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇多くの人に最も好まれるコーディングの回答をするAIは?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇コードを実行しながら直して、課題を終えられる?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇AnthropicClaude Opus 5.5推論強度: Medium54.6%
- 🥈AnthropicClaude Fable 553.5%
- 🥉AnthropicClaude Opus 5推論強度: Max53.4%
- #4OpenAIGPT-6 Astra推論強度: Max53.3%
- #5AnthropicClaude Sonnet 5.5推論強度: Extra High52.1%
- #6AnthropicClaude Fable 5.1推論強度: Medium50.9%
- #7OpenAIGPT-6.1 Sol推論強度: Medium50.2%
- #8OpenAIGPT-6 Sol推論強度: Max49.3%
- #9xAIGrok 4.648.0%
- #10xAIGrok 4.747.6%
- #11OpenAIGPT-5.6 Sol47.5%
- #12AnthropicClaude Opus 4.846.5%
- #13Moonshot AIKimi K344.2%
- #14GoogleGemini 3.7 Flash43.6%
- #15OpenAIGPT-5.543.0%
- #16AnthropicClaude Sonnet 542.7%
- #17xAIGrok 4.542.4%
- #18OpenAIGPT-6 Luna推論強度: Max42.4%
- #19OpenAIGPT-5.6 Terra41.3%
- #20GoogleGemini 3.8 Flash推論強度: Medium41.2%
- #21Z.aiGLM 5.3推論強度: Max40.1%
- #22OpenAIGPT-5.6 Luna39.8%
- #23AnthropicClaude Opus 4.738.5%
- #24GoogleGemini 3.6 Flash34.4%
- #25Z.aiGLM 5.3 Flash推論強度: Max31.8%
- #26Moonshot AIKimi K2.7 Code30.1%
- #27DeepSeekDeepSeek V4 Pro推論強度: High28.5%
- #28OpenAIGPT-5.4 Mini27.0%
- #29AnthropicClaude Opus 4.626.6%
- #30Z.aiGLM 5.2推論強度: None24.5%
- #31AnthropicClaude Sonnet 4.624.3%
- #32DeepSeekDeepSeek V4 Flash18.8%
- #33MiniMaxMiniMax M314.7%
- #34NVIDIANemotron 3 Ultra13.6%
- #35AlibabaQwen3.7 Plus10.2%
- #36Mistral AIMistral Medium 3.58.0%
モデルの半数が41.9%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。