FrontierMath Tier 4 v2
Widely citedHigher is better
Version 2 of Tier 4, the hardest research-level set in Epoch AI's FrontierMath (June 2026: 12 problems corrected and 7 removed, leaving 43). The AI can use Python and must give an exact answer. Scores run from 0 to 100%. Higher is better.
Top score100.0%GPT-6.1 Sol
Models tested50
Last updated2026.09.29
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it solve problems that stump experts across fields?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇Can it solve research-level physics problems?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇Which AI gives the math answers people prefer most?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6.1 SolReasoning effort: Max100.0%
- 🥈OpenAIGPT-6 AstraReasoning effort: Max97.6%
- 🥉AnthropicClaude Opus 5.5Reasoning effort: Max95.0%
- #4AnthropicClaude Fable 5Reasoning effort: Max90.2%
- #5OpenAIGPT-6 SolReasoning effort: Max90.0%
- #6AnthropicClaude Fable 5.1Reasoning effort: Max87.8%
- #7OpenAIGPT-5.6 SolReasoning effort: Max82.9%
- #8AnthropicClaude Sonnet 5.5Reasoning effort: Max80.5%
- #9AnthropicClaude Opus 5Reasoning effort: Max73.2%
- #10OpenAIGPT-5.5Reasoning effort: Extra High72.5%
- #11OpenAIGPT-5.6 TerraReasoning effort: Max70.7%
- #12OpenAIGPT-5.6 LunaReasoning effort: Max61.0%
- #13OpenAIGPT-5.4 ProReasoning effort: Extra High58.5%
- #14OpenAIGPT-6 LunaReasoning effort: Max56.1%
- #14AnthropicClaude Opus 4.8Reasoning effort: Max56.1%
- #16OpenAIGPT-5.4Reasoning effort: Extra High49.0%
- #17MetaMuse Spark 1.3Reasoning effort: Max46.3%
- #18Moonshot AIKimi K3Reasoning effort: Max39.0%
- #19GoogleGemini 3.7 FlashReasoning effort: High36.6%
- #20AlibabaQwen3.7 Max34.1%
- #21xAIGrok 4.6Reasoning effort: Extra High31.7%
- #21AnthropicClaude Opus 4.7Reasoning effort: Max31.7%
- #23Z.aiGLM 5.3Reasoning effort: Max29.3%
- #23AnthropicClaude Sonnet 5Reasoning effort: Max29.3%
- #23Z.aiGLM 5.2Reasoning effort: Max29.3%
- #26AnthropicClaude Opus 4.6Reasoning effort: Max26.8%
- #26GoogleGemini 3.5 FlashReasoning effort: High26.8%
- #26GoogleGemini 3.1 Pro26.8%
- #26DeepSeekDeepSeek V4 ProReasoning effort: Max26.8%
- #30Moonshot AIKimi K2.625.6%
- #31xAIGrok 4.5Reasoning effort: High24.4%
- #31DeepSeekDeepSeek V4 FlashReasoning effort: Max24.4%
- #33OpenAIGPT-5Reasoning effort: High22.0%
- #33GoogleGemini 3.8 FlashReasoning effort: High22.0%
- #33GoogleGemini 3.6 FlashReasoning effort: High22.0%
- #36GoogleGemini 3 Flash17.1%
- #36xAIGrok 4.7Reasoning effort: Extra High17.1%
- #36Z.aiGLM 5.3 FlashReasoning effort: Max17.1%
- #36xAIGrok 4.20 (Reasoning)17.1%
- #40xAIGrok 4.3Reasoning effort: High14.6%
- #41OpenAIGPT-5.4 NanoReasoning effort: High12.2%
- #41OpenAIGPT-5 MiniReasoning effort: High12.2%
- #41Moonshot AIKimi K2.7 Code12.2%
- #44OpenAIGPT-5.4 MiniReasoning effort: Extra High9.8%
- #45AnthropicClaude Opus 4.5Reasoning effort: Budget 32K4.9%
- #46AnthropicClaude Opus 4.1Reasoning effort: Budget 32K2.4%
- #46AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K2.4%
- #46OpenAIGPT-5 NanoReasoning effort: High2.4%
- #49GoogleGemini 3.5 Flash-LiteReasoning effort: High0.0%
- #49GoogleGemini 2.5 Pro0.0%
Half of models ≤ 28.0%Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.