ALE-Bench
Higher is better
Made by Sakana AI and AtCoder: 40 optimization problems from past AtCoder Heuristic Contests (routing, scheduling, and other problems without a single right answer), which the model tackles by refining programs within a time budget. Results are converted into a rating based on where they would rank among that contest's human entrants. Scores are ratings converted from contest results. Higher is better.
Top score2951GPT-6 Astra
Models tested74
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it operate a computer itself to finish hours-long development jobs?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇Which AI gives the coding answers people prefer most?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇Can it run and fix code until the task is done?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇OpenAIGPT-6 AstraReasoning effort: Max2951
- 🥈OpenAIGPT-6 SolReasoning effort: Max2462
- 🥉OpenAIGPT-5.6 SolReasoning effort: Max2177
- #4AnthropicClaude Opus 5Reasoning effort: High2165
- #5AnthropicClaude Opus 5.5Reasoning effort: High2147
- #6AnthropicClaude Fable 5.1Reasoning effort: High2143
- #7AnthropicClaude Fable 5Reasoning effort: High2041
- #8OpenAIGPT-5.6 TerraReasoning effort: Max1951
- #9OpenAIGPT-5.5Reasoning effort: Extra High1943
- #10AnthropicClaude Sonnet 5.5Reasoning effort: High1819
- #11OpenAIGPT-5.6 LunaReasoning effort: Max1667
- #12OpenAIGPT-5.4Reasoning effort: High1607
- #13OpenAIGPT-6 LunaReasoning effort: Extra High1577
- #14AnthropicClaude Opus 4.8Reasoning effort: High1564
- #15Moonshot AIKimi K3Reasoning effort: Max1524
- #16xAIGrok 4.6Reasoning effort: Extra High1508
- #17AnthropicClaude Sonnet 5Reasoning effort: High1463
- #18DeepSeekDeepSeek V4 ProReasoning effort: Max1403
- #19GoogleGemini 3 Flash1367
- #20AnthropicClaude Sonnet 4.6Reasoning effort: Medium1327
- #21AnthropicClaude Opus 4.71323
- #22Z.aiGLM 5.3Reasoning effort: High1317
- #23xAIGrok 4.5Reasoning effort: High1309
- #24DeepSeekDeepSeek V4 FlashReasoning effort: Max1306
- #25GoogleGemini 3.8 FlashReasoning effort: High1270
- #26AlibabaQwen3.7 Max1189
- #27OpenAIGPT-5.4 MiniReasoning effort: High1189
- #28OpenAIGPT-5Reasoning effort: High1162
- #29GoogleGemini 3.1 Pro1161
- #30XiaomiMiMo-V2.6-Pro1158
- #31Moonshot AIKimi K2.61093
- #32DeepSeekDeepSeek V4.1 FlashReasoning effort: Max1092
- #33Z.aiGLM 5.2Reasoning effort: High1047
- #34AnthropicClaude Opus 4.5Reasoning effort: Budget 16K1025
- #35OpenAIGPT-5.4 NanoReasoning effort: High1005
- #36AnthropicClaude Opus 4.6997
- #37xAIGrok 4.3944
- #38GoogleGemma 4 31B926
- #39GoogleGemini 3.5 FlashReasoning effort: High911
- #40GoogleGemini 3.7 FlashReasoning effort: High904
- #41XiaomiMiMo V2.5 Pro900
- #42Z.aiGLM-5.1887
- #43Moonshot AIKimi K2.7 Code886
- #44Moonshot AIKimi K2.5822
- #45OpenAIGPT-5 MiniReasoning effort: High800
- #46GoogleGemini 3.1 Flash Lite798
- #47AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K796
- #48GoogleGemini 2.5 ProReasoning effort: Budget 32K786
- #49XiaomiMiMo V2 Pro785
- #50Z.aiGLM-5766
- #51GoogleGemini 3.5 Flash-LiteReasoning effort: High765
- #52Mistral AIMistral Medium 3.5764
- #53OpenAIGPT-5 NanoReasoning effort: High719
- #54GoogleGemini 3.6 FlashReasoning effort: High716
- #55StepfunStep 3.7 Flash694
- #56AnthropicClaude Opus 4.1Reasoning effort: Budget 16K675
- #57AlibabaQwen3.6 Plus670
- #58GoogleGemini 2.5 Flash662
- #59AnthropicClaude Sonnet 4Reasoning effort: Budget 32K655
- #60AnthropicClaude Haiku 4.5Reasoning effort: Budget 32K653
- #61MiniMaxMiniMax M3640
- #62MiniMaxMiniMax M2.5618
- #63MiniMaxMiniMax M2.7599
- #64OpenAIGPT OSS 120B576
- #65OpenAIGPT-4.1558
- #66XiaomiMiMo V2.5514
- #67Mistral AIMistral Small 4498
- #68Ring AIRing-2.6-1T433
- #69xAIGrok 4.1 Fast (Reasoning)395
- #70AlibabaQwen3.6 Flash326
- #71Z.aiGLM 5.3 FlashReasoning effort: High304
- #72AmazonNova 2 Lite236
- #73NVIDIANemotron 3 Super214
- #74MetaLlama 4 Maverick173
Half of models ≤ 935Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.