FrontierMath Tiers 1-3 v2
Widely citedHigher is better
Version 2 of FrontierMath Tiers 1-3, original math problems written by mathematicians from advanced undergraduate to early research level (June 2026: 123 problems corrected and 5 removed, leaving 295). The AI can use Python and must give an exact answer. Scores run from 0 to 100%. Higher is better.
Top score93.7%GPT-6.1 Sol
Models tested58
Last updated2026.09.29
Model release date (newest on the right)
Best score so farHigher on the chart is better
Can it solve problems that stump experts across fields?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇Can it solve research-level physics problems?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇Which AI gives the math answers people prefer most?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6.1 SolReasoning effort: Max93.7%
- 🥇OpenAIGPT-6 AstraReasoning effort: Max93.7%
- 🥉AnthropicClaude Opus 5.5Reasoning effort: Max91.2%
- #4AnthropicClaude Fable 5.1Reasoning effort: Max90.2%
- #5OpenAIGPT-6 SolReasoning effort: Max89.8%
- #6OpenAIGPT-5.6 SolReasoning effort: Max89.1%
- #7AnthropicClaude Sonnet 5.5Reasoning effort: Max88.8%
- #8AnthropicClaude Fable 5Reasoning effort: Max87.0%
- #9OpenAIGPT-5.6 TerraReasoning effort: Max86.0%
- #10AnthropicClaude Opus 5Reasoning effort: Max85.6%
- #11OpenAIGPT-5.5Reasoning effort: Extra High85.3%
- #12OpenAIGPT-5.4 ProReasoning effort: Extra High82.5%
- #13OpenAIGPT-5.6 LunaReasoning effort: Max82.1%
- #14AnthropicClaude Opus 4.8Reasoning effort: Max80.0%
- #15OpenAIGPT-6 LunaReasoning effort: Max78.9%
- #16OpenAIGPT-5.4Reasoning effort: Extra High78.6%
- #17MetaMuse Spark 1.3Reasoning effort: Extra High74.4%
- #18Moonshot AIKimi K3Reasoning effort: Max72.2%
- #19GoogleGemini 3.7 FlashReasoning effort: High71.6%
- #20AnthropicClaude Opus 4.7Reasoning effort: Max70.2%
- #21Z.aiGLM 5.3Reasoning effort: Max68.8%
- #22GoogleGemini 3.8 FlashReasoning effort: High68.4%
- #23AnthropicClaude Opus 4.6Reasoning effort: Max66.0%
- #23xAIGrok 4.6Reasoning effort: Extra High66.0%
- #25AnthropicClaude Sonnet 5Reasoning effort: Max65.6%
- #26AlibabaQwen3.7 Max64.6%
- #26DeepSeekDeepSeek V4 ProReasoning effort: Max64.6%
- #28GoogleGemini 3.5 FlashReasoning effort: High62.8%
- #29GoogleGemini 3.1 Pro59.6%
- #30Z.aiGLM 5.2Reasoning effort: Max59.2%
- #31GoogleGemini 3.6 FlashReasoning effort: High58.9%
- #32DeepSeekDeepSeek V4 FlashReasoning effort: Max57.5%
- #33Moonshot AIKimi K2.657.2%
- #33xAIGrok 4.5Reasoning effort: High57.2%
- #35Z.aiGLM 5.3 FlashReasoning effort: Max55.8%
- #36OpenAIGPT-5Reasoning effort: High55.4%
- #37Moonshot AIKimi K2.7 Code54.0%
- #38xAIGrok 4.7Reasoning effort: Extra High53.0%
- #39GoogleGemini 3 Flash51.2%
- #39OpenAIGPT-5.4 MiniReasoning effort: Extra High51.2%
- #41OpenAIGPT-5 MiniReasoning effort: High46.7%
- #42OpenAIGPT-5.4 NanoReasoning effort: High44.9%
- #42xAIGrok 4.20 (Reasoning)44.9%
- #44xAIGrok 4.3Reasoning effort: High42.8%
- #45AlibabaQwen3.6 Plus38.2%
- #46Z.aiGLM-5.136.8%
- #47AlibabaQwen3.7 PlusReasoning effort: None34.4%
- #47AnthropicClaude Opus 4.5Reasoning effort: Budget 32K34.4%
- #49AlibabaQwen3.5 397B A17BReasoning effort: None31.2%
- #50GoogleGemini 3.1 Flash LiteReasoning effort: High27.7%
- #51GoogleGemini 3.5 Flash-LiteReasoning effort: High26.0%
- #52GoogleGemini 2.5 Pro24.6%
- #53AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K23.9%
- #54AlibabaQwen3.6 FlashReasoning effort: None22.5%
- #55AlibabaQwen3.6 35B A3BReasoning effort: None20.4%
- #56OpenAIGPT-5 NanoReasoning effort: High20.0%
- #57AnthropicClaude Opus 4.1Reasoning effort: Budget 32K12.6%
- #58OpenAIGPT-4.16.0%
Half of models ≤ 59.4%Last updated 2026-10-07
The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.