WeirdML
高いほど良い
図形認識、変わった数字の分類、チェスの勝敗予測など珍しい機械学習の課題を、AIがPyTorchのコードで解き、実行結果を見ながら最大5回修正します。ここでの値は課題19件の第2版基準で、課題11件に変わった現在の第3版とは比較できません。スコアは0〜100%です。高いほど良い結果です。
最高スコア93.3%GPT-6 Astra
測定したモデル57件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
数時間かかる開発の仕事も、コンピューターを自分で操作して最後までやり遂げられる?Terminal-Bench 4.0
Claude Sonnet 5.5🥇
Claude Sonnet 5.5🥇多くの人に最も好まれるコーディングの回答をするAIは?Arena Coding
Gemini 4 Argon🥇
Gemini 4 Argon🥇コードを実行しながら直して、課題を終えられる?LiveBench Agentic Coding
DeepSeek V4.1 Flash🥇
DeepSeek V4.1 Flash🥇
- 🥇OpenAIGPT-6 Astra推論強度: Max93.3%
- 🥈AnthropicClaude Fable 5.1推論強度: Max92.9%
- 🥉AnthropicClaude Fable 5推論強度: Max91.9%
- #4AnthropicClaude Opus 5推論強度: Max91.8%
- #5OpenAIGPT-5.6 Sol推論強度: Max89.4%
- #6OpenAIGPT-5.5推論強度: Extra High84.9%
- #7GoogleGemini 3.8 Flash推論強度: High84.8%
- #8AnthropicClaude Opus 4.8推論強度: Extra High82.9%
- #9Moonshot AIKimi K3推論強度: Max82.6%
- #10OpenAIGPT-5.6 Terra推論強度: High78.3%
- #11AnthropicClaude Opus 4.6推論強度: High78.0%
- #12OpenAIGPT-5.4推論強度: Extra High77.7%
- #13AnthropicClaude Opus 4.7推論強度: High76.4%
- #14Z.aiGLM 5.3推論強度: Max75.4%
- #15GoogleGemini 3.1 Pro72.1%
- #16Z.aiGLM 5.2推論強度: Max70.1%
- #17AnthropicClaude Sonnet 5推論強度: High68.8%
- #18xAIGrok 4.6推論強度: High67.3%
- #19DeepSeekDeepSeek V4 Pro推論強度: Max66.2%
- #20AnthropicClaude Sonnet 4.6推論強度: Medium66.1%
- #21AnthropicClaude Opus 4.5推論強度: Budget 16K63.7%
- #22DeepSeekDeepSeek V4 Flash推論強度: Max63.0%
- #23GoogleGemini 3.5 Flash推論強度: High62.6%
- #24GoogleGemini 3 Flash61.6%
- #25OpenAIGPT-5.6 Luna推論強度: High60.9%
- #26OpenAIGPT-5推論強度: High60.7%
- #27MetaMuse Spark 1.2推論強度: Extra High60.3%
- #27OpenAIGPT-5.4 Mini推論強度: High60.3%
- #29OpenAIGPT-5.4 Pro推論強度: None57.4%
- #30Z.aiGLM-5.157.1%
- #31GoogleGemini 3.6 Flash推論強度: High56.1%
- #32Moonshot AIKimi K2.655.9%
- #33Moonshot AIKimi K2.7 Code54.1%
- #34GoogleGemini 2.5 Pro推論強度: Budget 16K54.0%
- #35OpenAIGPT-5 Mini推論強度: High52.7%
- #36GoogleGemma 4 31B52.3%
- #37GoogleGemini 3.1 Flash Lite52.2%
- #38xAIGrok 4.349.9%
- #39OpenAIGPT-5.4 Nano推論強度: High49.2%
- #40OpenAIGPT OSS 120B推論強度: High48.2%
- #40Z.aiGLM-548.2%
- #42AnthropicClaude Sonnet 4.5推論強度: Budget 16K47.7%
- #43xAIGrok 4.546.4%
- #44AnthropicClaude Sonnet 4推論強度: Budget 16K46.1%
- #45AnthropicClaude Opus 4.1推論強度: Budget 16K45.9%
- #46Moonshot AIKimi K2.545.6%
- #47AnthropicClaude Haiku 4.545.4%
- #48AnthropicClaude Opus 4推論強度: Budget 16K43.7%
- #49Mistral AIMistral Medium 3.543.7%
- #50NVIDIANemotron 3 Ultra43.5%
- #51OpenAIGPT-4.139.0%
- #52GoogleGemini 3.5 Flash-Lite推論強度: High39.0%
- #53OpenAIGPT-5 Nano推論強度: High38.1%
- #54NVIDIANemotron 3 Super38.0%
- #55MiniMaxMiniMax M2.737.0%
- #56AlibabaQwen3.6 35B A3B34.5%
- #57MetaLlama 4 Maverick24.5%
モデルの半数が57.4%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。