FrontierMath Tier 4 v2
よく引用高いほど良い
Epoch AIのFrontierMathのうち最も難しい研究レベルの数学問題群(第4段階)の第2版です(2026年6月、12問修正・7問削除、43問)。AIはPythonを使い、正確な答えを出す必要があります。スコアは0〜100%です。高いほど良い結果です。
最高スコア100.0%GPT-6.1 Sol
測定したモデル50件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6.1 Sol推論強度: Max100.0%
- 🥈OpenAIGPT-6 Astra推論強度: Max97.6%
- 🥉AnthropicClaude Opus 5.5推論強度: Max95.0%
- #4AnthropicClaude Fable 5推論強度: Max90.2%
- #5OpenAIGPT-6 Sol推論強度: Max90.0%
- #6AnthropicClaude Fable 5.1推論強度: Max87.8%
- #7OpenAIGPT-5.6 Sol推論強度: Max82.9%
- #8AnthropicClaude Sonnet 5.5推論強度: Max80.5%
- #9AnthropicClaude Opus 5推論強度: Max73.2%
- #10OpenAIGPT-5.5推論強度: Extra High72.5%
- #11OpenAIGPT-5.6 Terra推論強度: Max70.7%
- #12OpenAIGPT-5.6 Luna推論強度: Max61.0%
- #13OpenAIGPT-5.4 Pro推論強度: Extra High58.5%
- #14OpenAIGPT-6 Luna推論強度: Max56.1%
- #14AnthropicClaude Opus 4.8推論強度: Max56.1%
- #16OpenAIGPT-5.4推論強度: Extra High49.0%
- #17MetaMuse Spark 1.3推論強度: Max46.3%
- #18Moonshot AIKimi K3推論強度: Max39.0%
- #19GoogleGemini 3.7 Flash推論強度: High36.6%
- #20AlibabaQwen3.7 Max34.1%
- #21xAIGrok 4.6推論強度: Extra High31.7%
- #21AnthropicClaude Opus 4.7推論強度: Max31.7%
- #23Z.aiGLM 5.3推論強度: Max29.3%
- #23AnthropicClaude Sonnet 5推論強度: Max29.3%
- #23Z.aiGLM 5.2推論強度: Max29.3%
- #26AnthropicClaude Opus 4.6推論強度: Max26.8%
- #26GoogleGemini 3.5 Flash推論強度: High26.8%
- #26GoogleGemini 3.1 Pro26.8%
- #26DeepSeekDeepSeek V4 Pro推論強度: Max26.8%
- #30Moonshot AIKimi K2.625.6%
- #31xAIGrok 4.5推論強度: High24.4%
- #31DeepSeekDeepSeek V4 Flash推論強度: Max24.4%
- #33OpenAIGPT-5推論強度: High22.0%
- #33GoogleGemini 3.8 Flash推論強度: High22.0%
- #33GoogleGemini 3.6 Flash推論強度: High22.0%
- #36GoogleGemini 3 Flash17.1%
- #36xAIGrok 4.7推論強度: Extra High17.1%
- #36Z.aiGLM 5.3 Flash推論強度: Max17.1%
- #36xAIGrok 4.20 (Reasoning)17.1%
- #40xAIGrok 4.3推論強度: High14.6%
- #41OpenAIGPT-5.4 Nano推論強度: High12.2%
- #41OpenAIGPT-5 Mini推論強度: High12.2%
- #41Moonshot AIKimi K2.7 Code12.2%
- #44OpenAIGPT-5.4 Mini推論強度: Extra High9.8%
- #45AnthropicClaude Opus 4.5推論強度: Budget 32K4.9%
- #46AnthropicClaude Opus 4.1推論強度: Budget 32K2.4%
- #46AnthropicClaude Sonnet 4.5推論強度: Budget 32K2.4%
- #46OpenAIGPT-5 Nano推論強度: High2.4%
- #49GoogleGemini 3.5 Flash-Lite推論強度: High0.0%
- #49GoogleGemini 2.5 Pro0.0%
モデルの半数が28.0%以下最終更新 2026-10-07
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。