ALE-Bench

Higher is better

Made by Sakana AI and AtCoder: 40 optimization problems from past AtCoder Heuristic Contests (routing, scheduling, and other problems without a single right answer), which the model tackles by refining programs within a time budget. Results are converted into a rating based on where they would rank among that contest's human entrants. Scores are ratings converted from contest results. Higher is better.

Top score2951GPT-6 Astra
Models tested74
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇OpenAIGPT-6 AstraReasoning effort: Max2951
  2. 🥈OpenAIGPT-6 SolReasoning effort: Max2462
  3. 🥉OpenAIGPT-5.6 SolReasoning effort: Max2177
  4. #4AnthropicClaude Opus 5Reasoning effort: High2165
  5. #5AnthropicClaude Opus 5.5Reasoning effort: High2147
  6. #6AnthropicClaude Fable 5.1Reasoning effort: High2143
  7. #7AnthropicClaude Fable 5Reasoning effort: High2041
  8. #8OpenAIGPT-5.6 TerraReasoning effort: Max1951
  9. #9OpenAIGPT-5.5Reasoning effort: Extra High1943
  10. #10AnthropicClaude Sonnet 5.5Reasoning effort: High1819
  11. #11OpenAIGPT-5.6 LunaReasoning effort: Max1667
  12. #12OpenAIGPT-5.4Reasoning effort: High1607
  13. #13OpenAIGPT-6 LunaReasoning effort: Extra High1577
  14. #14AnthropicClaude Opus 4.8Reasoning effort: High1564
  15. #15Moonshot AIKimi K3Reasoning effort: Max1524
  16. #16xAIGrok 4.6Reasoning effort: Extra High1508
  17. #17AnthropicClaude Sonnet 5Reasoning effort: High1463
  18. #18DeepSeekDeepSeek V4 ProReasoning effort: Max1403
  19. #19GoogleGemini 3 Flash1367
  20. #20AnthropicClaude Sonnet 4.6Reasoning effort: Medium1327
  21. #21AnthropicClaude Opus 4.71323
  22. #22Z.aiGLM 5.3Reasoning effort: High1317
  23. #23xAIGrok 4.5Reasoning effort: High1309
  24. #24DeepSeekDeepSeek V4 FlashReasoning effort: Max1306
  25. #25GoogleGemini 3.8 FlashReasoning effort: High1270
  26. #26AlibabaQwen3.7 Max1189
  27. #27OpenAIGPT-5.4 MiniReasoning effort: High1189
  28. #28OpenAIGPT-5Reasoning effort: High1162
  29. #29GoogleGemini 3.1 Pro1161
  30. #30XiaomiMiMo-V2.6-Pro1158
  31. #31Moonshot AIKimi K2.61093
  32. #32DeepSeekDeepSeek V4.1 FlashReasoning effort: Max1092
  33. #33Z.aiGLM 5.2Reasoning effort: High1047
  34. #34AnthropicClaude Opus 4.5Reasoning effort: Budget 16K1025
  35. #35OpenAIGPT-5.4 NanoReasoning effort: High1005
  36. #36AnthropicClaude Opus 4.6997
  37. #37xAIGrok 4.3944
  38. #38GoogleGemma 4 31B926
  39. #39GoogleGemini 3.5 FlashReasoning effort: High911
  40. #40GoogleGemini 3.7 FlashReasoning effort: High904
  41. #41XiaomiMiMo V2.5 Pro900
  42. #42Z.aiGLM-5.1887
  43. #43Moonshot AIKimi K2.7 Code886
  44. #44Moonshot AIKimi K2.5822
  45. #45OpenAIGPT-5 MiniReasoning effort: High800
  46. #46GoogleGemini 3.1 Flash Lite798
  47. #47AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K796
  48. #48GoogleGemini 2.5 ProReasoning effort: Budget 32K786
  49. #49XiaomiMiMo V2 Pro785
  50. #50Z.aiGLM-5766
  51. #51GoogleGemini 3.5 Flash-LiteReasoning effort: High765
  52. #52Mistral AIMistral Medium 3.5764
  53. #53OpenAIGPT-5 NanoReasoning effort: High719
  54. #54GoogleGemini 3.6 FlashReasoning effort: High716
  55. #55StepfunStep 3.7 Flash694
  56. #56AnthropicClaude Opus 4.1Reasoning effort: Budget 16K675
  57. #57AlibabaQwen3.6 Plus670
  58. #58GoogleGemini 2.5 Flash662
  59. #59AnthropicClaude Sonnet 4Reasoning effort: Budget 32K655
  60. #60AnthropicClaude Haiku 4.5Reasoning effort: Budget 32K653
  61. #61MiniMaxMiniMax M3640
  62. #62MiniMaxMiniMax M2.5618
  63. #63MiniMaxMiniMax M2.7599
  64. #64OpenAIGPT OSS 120B576
  65. #65OpenAIGPT-4.1558
  66. #66XiaomiMiMo V2.5514
  67. #67Mistral AIMistral Small 4498
  68. #68Ring AIRing-2.6-1T433
  69. #69xAIGrok 4.1 Fast (Reasoning)395
  70. #70AlibabaQwen3.6 Flash326
  71. #71Z.aiGLM 5.3 FlashReasoning effort: High304
  72. #72AmazonNova 2 Lite236
  73. #73NVIDIANemotron 3 Super214
  74. #74MetaLlama 4 Maverick173
Half of models ≤ 935Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.