WeirdML

高いほど良い

図形認識、変わった数字の分類、チェスの勝敗予測など珍しい機械学習の課題を、AIがPyTorchのコードで解き、実行結果を見ながら最大5回修正します。ここでの値は課題19件の第2版基準で、課題11件に変わった現在の第3版とは比較できません。スコアは0〜100%です。高いほど良い結果です。

最高スコア93.3%GPT-6 Astra
測定したモデル57件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6 Astra推論強度: Max93.3%
  2. 🥈AnthropicClaude Fable 5.1推論強度: Max92.9%
  3. 🥉AnthropicClaude Fable 5推論強度: Max91.9%
  4. #4AnthropicClaude Opus 5推論強度: Max91.8%
  5. #5OpenAIGPT-5.6 Sol推論強度: Max89.4%
  6. #6OpenAIGPT-5.5推論強度: Extra High84.9%
  7. #7GoogleGemini 3.8 Flash推論強度: High84.8%
  8. #8AnthropicClaude Opus 4.8推論強度: Extra High82.9%
  9. #9Moonshot AIKimi K3推論強度: Max82.6%
  10. #10OpenAIGPT-5.6 Terra推論強度: High78.3%
  11. #11AnthropicClaude Opus 4.6推論強度: High78.0%
  12. #12OpenAIGPT-5.4推論強度: Extra High77.7%
  13. #13AnthropicClaude Opus 4.7推論強度: High76.4%
  14. #14Z.aiGLM 5.3推論強度: Max75.4%
  15. #15GoogleGemini 3.1 Pro72.1%
  16. #16Z.aiGLM 5.2推論強度: Max70.1%
  17. #17AnthropicClaude Sonnet 5推論強度: High68.8%
  18. #18xAIGrok 4.6推論強度: High67.3%
  19. #19DeepSeekDeepSeek V4 Pro推論強度: Max66.2%
  20. #20AnthropicClaude Sonnet 4.6推論強度: Medium66.1%
  21. #21AnthropicClaude Opus 4.5推論強度: Budget 16K63.7%
  22. #22DeepSeekDeepSeek V4 Flash推論強度: Max63.0%
  23. #23GoogleGemini 3.5 Flash推論強度: High62.6%
  24. #24GoogleGemini 3 Flash61.6%
  25. #25OpenAIGPT-5.6 Luna推論強度: High60.9%
  26. #26OpenAIGPT-5推論強度: High60.7%
  27. #27MetaMuse Spark 1.2推論強度: Extra High60.3%
  28. #27OpenAIGPT-5.4 Mini推論強度: High60.3%
  29. #29OpenAIGPT-5.4 Pro推論強度: None57.4%
  30. #30Z.aiGLM-5.157.1%
  31. #31GoogleGemini 3.6 Flash推論強度: High56.1%
  32. #32Moonshot AIKimi K2.655.9%
  33. #33Moonshot AIKimi K2.7 Code54.1%
  34. #34GoogleGemini 2.5 Pro推論強度: Budget 16K54.0%
  35. #35OpenAIGPT-5 Mini推論強度: High52.7%
  36. #36GoogleGemma 4 31B52.3%
  37. #37GoogleGemini 3.1 Flash Lite52.2%
  38. #38xAIGrok 4.349.9%
  39. #39OpenAIGPT-5.4 Nano推論強度: High49.2%
  40. #40OpenAIGPT OSS 120B推論強度: High48.2%
  41. #40Z.aiGLM-548.2%
  42. #42AnthropicClaude Sonnet 4.5推論強度: Budget 16K47.7%
  43. #43xAIGrok 4.546.4%
  44. #44AnthropicClaude Sonnet 4推論強度: Budget 16K46.1%
  45. #45AnthropicClaude Opus 4.1推論強度: Budget 16K45.9%
  46. #46Moonshot AIKimi K2.545.6%
  47. #47AnthropicClaude Haiku 4.545.4%
  48. #48AnthropicClaude Opus 4推論強度: Budget 16K43.7%
  49. #49Mistral AIMistral Medium 3.543.7%
  50. #50NVIDIANemotron 3 Ultra43.5%
  51. #51OpenAIGPT-4.139.0%
  52. #52GoogleGemini 3.5 Flash-Lite推論強度: High39.0%
  53. #53OpenAIGPT-5 Nano推論強度: High38.1%
  54. #54NVIDIANemotron 3 Super38.0%
  55. #55MiniMaxMiniMax M2.737.0%
  56. #56AlibabaQwen3.6 35B A3B34.5%
  57. #57MetaLlama 4 Maverick24.5%
モデルの半数が57.4%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。