ALE-Bench

高いほど良い

Sakana AIとAtCoderが作った試験で、過去のAtCoderヒューリスティックコンテストの最適化問題40問(経路・スケジュールなど唯一の正解がない問題)を、決められた時間内にプログラムを改良しながら解きます。結果をそのコンテスト参加者の中での順位に換算してレーティングを付けます。スコアはコンテスト成績を換算したレーティングです。高いほど良い結果です。

最高スコア2951GPT-6 Astra
測定したモデル74件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra推論強度: Max2951
  2. 🥈OpenAIGPT-6 Sol推論強度: Max2462
  3. 🥉OpenAIGPT-5.6 Sol推論強度: Max2177
  4. #4AnthropicClaude Opus 5推論強度: High2165
  5. #5AnthropicClaude Opus 5.5推論強度: High2147
  6. #6AnthropicClaude Fable 5.1推論強度: High2143
  7. #7AnthropicClaude Fable 5推論強度: High2041
  8. #8OpenAIGPT-5.6 Terra推論強度: Max1951
  9. #9OpenAIGPT-5.5推論強度: Extra High1943
  10. #10AnthropicClaude Sonnet 5.5推論強度: High1819
  11. #11OpenAIGPT-5.6 Luna推論強度: Max1667
  12. #12OpenAIGPT-5.4推論強度: High1607
  13. #13OpenAIGPT-6 Luna推論強度: Extra High1577
  14. #14AnthropicClaude Opus 4.8推論強度: High1564
  15. #15Moonshot AIKimi K3推論強度: Max1524
  16. #16xAIGrok 4.6推論強度: Extra High1508
  17. #17AnthropicClaude Sonnet 5推論強度: High1463
  18. #18DeepSeekDeepSeek V4 Pro推論強度: Max1403
  19. #19GoogleGemini 3 Flash1367
  20. #20AnthropicClaude Sonnet 4.6推論強度: Medium1327
  21. #21AnthropicClaude Opus 4.71323
  22. #22Z.aiGLM 5.3推論強度: High1317
  23. #23xAIGrok 4.5推論強度: High1309
  24. #24DeepSeekDeepSeek V4 Flash推論強度: Max1306
  25. #25GoogleGemini 3.8 Flash推論強度: High1270
  26. #26AlibabaQwen3.7 Max1189
  27. #27OpenAIGPT-5.4 Mini推論強度: High1189
  28. #28OpenAIGPT-5推論強度: High1162
  29. #29GoogleGemini 3.1 Pro1161
  30. #30XiaomiMiMo-V2.6-Pro1158
  31. #31Moonshot AIKimi K2.61093
  32. #32DeepSeekDeepSeek V4.1 Flash推論強度: Max1092
  33. #33Z.aiGLM 5.2推論強度: High1047
  34. #34AnthropicClaude Opus 4.5推論強度: Budget 16K1025
  35. #35OpenAIGPT-5.4 Nano推論強度: High1005
  36. #36AnthropicClaude Opus 4.6997
  37. #37xAIGrok 4.3944
  38. #38GoogleGemma 4 31B926
  39. #39GoogleGemini 3.5 Flash推論強度: High911
  40. #40GoogleGemini 3.7 Flash推論強度: High904
  41. #41XiaomiMiMo V2.5 Pro900
  42. #42Z.aiGLM-5.1887
  43. #43Moonshot AIKimi K2.7 Code886
  44. #44Moonshot AIKimi K2.5822
  45. #45OpenAIGPT-5 Mini推論強度: High800
  46. #46GoogleGemini 3.1 Flash Lite798
  47. #47AnthropicClaude Sonnet 4.5推論強度: Budget 32K796
  48. #48GoogleGemini 2.5 Pro推論強度: Budget 32K786
  49. #49XiaomiMiMo V2 Pro785
  50. #50Z.aiGLM-5766
  51. #51GoogleGemini 3.5 Flash-Lite推論強度: High765
  52. #52Mistral AIMistral Medium 3.5764
  53. #53OpenAIGPT-5 Nano推論強度: High719
  54. #54GoogleGemini 3.6 Flash推論強度: High716
  55. #55StepfunStep 3.7 Flash694
  56. #56AnthropicClaude Opus 4.1推論強度: Budget 16K675
  57. #57AlibabaQwen3.6 Plus670
  58. #58GoogleGemini 2.5 Flash662
  59. #59AnthropicClaude Sonnet 4推論強度: Budget 32K655
  60. #60AnthropicClaude Haiku 4.5推論強度: Budget 32K653
  61. #61MiniMaxMiniMax M3640
  62. #62MiniMaxMiniMax M2.5618
  63. #63MiniMaxMiniMax M2.7599
  64. #64OpenAIGPT OSS 120B576
  65. #65OpenAIGPT-4.1558
  66. #66XiaomiMiMo V2.5514
  67. #67Mistral AIMistral Small 4498
  68. #68Ring AIRing-2.6-1T433
  69. #69xAIGrok 4.1 Fast (Reasoning)395
  70. #70AlibabaQwen3.6 Flash326
  71. #71Z.aiGLM 5.3 Flash推論強度: High304
  72. #72AmazonNova 2 Lite236
  73. #73NVIDIANemotron 3 Super214
  74. #74MetaLlama 4 Maverick173
モデルの半数が935以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。