ProofBench (Vals)
高いほど良い
Vals AIが作った形式証明の試験で、大学院・大学上級レベルの定理(解析学、代数、確率、整数論など)100件についてLean 4の証明を書き、機械による検証を通過する必要があります。部分点はありません。Google DeepMindの同名の試験とは別物です。スコアは0〜100%です。高いほど良い結果です。
最高スコア100.0%Claude Fable 5.1
測定したモデル65件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇AnthropicClaude Fable 5.1推論強度: Max100.0%
- 🥇AnthropicClaude Opus 5.5推論強度: Max100.0%
- 🥇AnthropicClaude Sonnet 5.5推論強度: Max100.0%
- #4GoogleGemini 4 Argon99.0%
- #4OpenAIGPT-6.1 Sol99.0%
- #4AnthropicClaude Opus 5推論強度: Max99.0%
- #4OpenAIGPT-6 Astra99.0%
- #8AnthropicClaude Fable 5推論強度: Max95.0%
- #9Moonshot AIKimi K387.0%
- #10OpenAIGPT-6 Sol83.0%
- #10OpenAIGPT-5.6 Sol推論強度: Max83.0%
- #12AnthropicClaude Sonnet 5推論強度: Max77.0%
- #13TencentHy4 preview75.0%
- #14OpenAIGPT-5.6 Terra推論強度: Extra High74.0%
- #15XiaomiMiMo-V2.6-Pro70.0%
- #16AnthropicClaude Opus 4.8推論強度: Max69.0%
- #17OpenAIGPT-6 Luna64.0%
- #18XiaomiMiMo-V2.6-Flash63.0%
- #19OpenAIGPT-5.6 Luna推論強度: Max60.0%
- #20MetaMuse Spark 1.3推論強度: Max58.0%
- #20GoogleGemini 3.7 Flash58.0%
- #22DeepSeekDeepSeek V4 Flash56.0%
- #22OpenAIGPT-5.4推論強度: Extra High56.0%
- #24DeepSeekDeepSeek V4.1 Flash54.0%
- #24AnthropicClaude Opus 4.7推論強度: Max54.0%
- #26xAIGrok 4.651.0%
- #27AnthropicClaude Opus 4.6推論強度: Max50.0%
- #27OpenAIGPT-5.5推論強度: Extra High50.0%
- #27DeepSeekDeepSeek V4 Pro50.0%
- #30Z.aiGLM 5.3推論強度: Max49.0%
- #31GoogleGemini 3.8 Flash48.0%
- #32AnthropicClaude Sonnet 4.6推論強度: Max45.0%
- #33MetaMuse Spark 1.243.0%
- #34MetaMuse Spark 1.139.0%
- #35AnthropicClaude Opus 4.536.0%
- #35GoogleGemini 3.6 Flash36.0%
- #37Z.aiGLM 5.2推論強度: Max35.0%
- #38xAIGrok 4.734.0%
- #39GoogleGemini 3.5 Flash推論強度: High31.0%
- #39xAIGrok 4.5推論強度: High31.0%
- #41GoogleGemini 3.1 Pro26.0%
- #41AlibabaQwen3.7 Max26.0%
- #43Z.aiGLM-5.122.2%
- #44XiaomiMiMo V2.5 Pro22.0%
- #45Z.aiGLM 5.3 Flash推論強度: Max21.0%
- #45OpenAIGPT-5.4 Mini推論強度: Extra High21.0%
- #47AnthropicClaude Sonnet 4.519.0%
- #48OpenAIGPT-5推論強度: High18.0%
- #48MiniMaxMiniMax M318.0%
- #50MetaMuse Spark17.0%
- #51XiaomiMiMo V2.516.0%
- #51Moonshot AIKimi K2.616.0%
- #53GoogleGemini 3 Flash15.0%
- #54xAIGrok 4.20 (Reasoning)14.0%
- #55GoogleGemini 3.5 Flash-Lite13.0%
- #56OpenAIGPT-5 Nano推論強度: High12.0%
- #57xAIGrok 4.3推論強度: High11.0%
- #58OpenAIGPT-5 Mini推論強度: High9.0%
- #58Mistral AIMistral Medium 3.59.0%
- #60OpenAIGPT-5.4 Nano推論強度: High5.0%
- #61MiniMaxMiniMax M2.54.0%
- #61xAIGrok 4.1 Fast (Reasoning)4.0%
- #63MiniMaxMiniMax M2.73.0%
- #64NVIDIANemotron 3 Ultra2.0%
- #65PoolsideLaguna M.10.0%
上位7件が100.0%付近 · 最上位は見分けにくい · モデルの半数が43.0%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。