ALE-Bench
高いほど良い
Sakana AIとAtCoderが作った試験で、過去のAtCoderヒューリスティックコンテストの最適化問題40問(経路・スケジュールなど唯一の正解がない問題)を、決められた時間内にプログラムを改良しながら解きます。結果をそのコンテスト参加者の中での順位に換算してレーティングを付けます。スコアはコンテスト成績を換算したレーティングです。高いほど良い結果です。
最高スコア2951GPT-6 Astra
測定したモデル74件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
数時間かかる開発の仕事も、コンピューターを自分で操作して最後までやり遂げられる?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇多くの人に最も好まれるコーディングの回答をするAIは?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇コードを実行しながら直して、課題を終えられる?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇OpenAIGPT-6 Astra推論強度: Max2951
- 🥈OpenAIGPT-6 Sol推論強度: Max2462
- 🥉OpenAIGPT-5.6 Sol推論強度: Max2177
- #4AnthropicClaude Opus 5推論強度: High2165
- #5AnthropicClaude Opus 5.5推論強度: High2147
- #6AnthropicClaude Fable 5.1推論強度: High2143
- #7AnthropicClaude Fable 5推論強度: High2041
- #8OpenAIGPT-5.6 Terra推論強度: Max1951
- #9OpenAIGPT-5.5推論強度: Extra High1943
- #10AnthropicClaude Sonnet 5.5推論強度: High1819
- #11OpenAIGPT-5.6 Luna推論強度: Max1667
- #12OpenAIGPT-5.4推論強度: High1607
- #13OpenAIGPT-6 Luna推論強度: Extra High1577
- #14AnthropicClaude Opus 4.8推論強度: High1564
- #15Moonshot AIKimi K3推論強度: Max1524
- #16xAIGrok 4.6推論強度: Extra High1508
- #17AnthropicClaude Sonnet 5推論強度: High1463
- #18DeepSeekDeepSeek V4 Pro推論強度: Max1403
- #19GoogleGemini 3 Flash1367
- #20AnthropicClaude Sonnet 4.6推論強度: Medium1327
- #21AnthropicClaude Opus 4.71323
- #22Z.aiGLM 5.3推論強度: High1317
- #23xAIGrok 4.5推論強度: High1309
- #24DeepSeekDeepSeek V4 Flash推論強度: Max1306
- #25GoogleGemini 3.8 Flash推論強度: High1270
- #26AlibabaQwen3.7 Max1189
- #27OpenAIGPT-5.4 Mini推論強度: High1189
- #28OpenAIGPT-5推論強度: High1162
- #29GoogleGemini 3.1 Pro1161
- #30XiaomiMiMo-V2.6-Pro1158
- #31Moonshot AIKimi K2.61093
- #32DeepSeekDeepSeek V4.1 Flash推論強度: Max1092
- #33Z.aiGLM 5.2推論強度: High1047
- #34AnthropicClaude Opus 4.5推論強度: Budget 16K1025
- #35OpenAIGPT-5.4 Nano推論強度: High1005
- #36AnthropicClaude Opus 4.6997
- #37xAIGrok 4.3944
- #38GoogleGemma 4 31B926
- #39GoogleGemini 3.5 Flash推論強度: High911
- #40GoogleGemini 3.7 Flash推論強度: High904
- #41XiaomiMiMo V2.5 Pro900
- #42Z.aiGLM-5.1887
- #43Moonshot AIKimi K2.7 Code886
- #44Moonshot AIKimi K2.5822
- #45OpenAIGPT-5 Mini推論強度: High800
- #46GoogleGemini 3.1 Flash Lite798
- #47AnthropicClaude Sonnet 4.5推論強度: Budget 32K796
- #48GoogleGemini 2.5 Pro推論強度: Budget 32K786
- #49XiaomiMiMo V2 Pro785
- #50Z.aiGLM-5766
- #51GoogleGemini 3.5 Flash-Lite推論強度: High765
- #52Mistral AIMistral Medium 3.5764
- #53OpenAIGPT-5 Nano推論強度: High719
- #54GoogleGemini 3.6 Flash推論強度: High716
- #55StepfunStep 3.7 Flash694
- #56AnthropicClaude Opus 4.1推論強度: Budget 16K675
- #57AlibabaQwen3.6 Plus670
- #58GoogleGemini 2.5 Flash662
- #59AnthropicClaude Sonnet 4推論強度: Budget 32K655
- #60AnthropicClaude Haiku 4.5推論強度: Budget 32K653
- #61MiniMaxMiniMax M3640
- #62MiniMaxMiniMax M2.5618
- #63MiniMaxMiniMax M2.7599
- #64OpenAIGPT OSS 120B576
- #65OpenAIGPT-4.1558
- #66XiaomiMiMo V2.5514
- #67Mistral AIMistral Small 4498
- #68Ring AIRing-2.6-1T433
- #69xAIGrok 4.1 Fast (Reasoning)395
- #70AlibabaQwen3.6 Flash326
- #71Z.aiGLM 5.3 Flash推論強度: High304
- #72AmazonNova 2 Lite236
- #73NVIDIANemotron 3 Super214
- #74MetaLlama 4 Maverick173
モデルの半数が935以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。