FrontierMath Tier 4 v2

Widely citedHigher is better

Version 2 of Tier 4, the hardest research-level set in Epoch AI's FrontierMath (June 2026: 12 problems corrected and 7 removed, leaving 43). The AI can use Python and must give an exact answer. Scores run from 0 to 100%. Higher is better.

Top score100.0%GPT-6.1 Sol
Models tested50
Last updated2026.09.29
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇OpenAIGPT-6.1 SolReasoning effort: Max100.0%
  2. 🥈OpenAIGPT-6 AstraReasoning effort: Max97.6%
  3. 🥉AnthropicClaude Opus 5.5Reasoning effort: Max95.0%
  4. #4AnthropicClaude Fable 5Reasoning effort: Max90.2%
  5. #5OpenAIGPT-6 SolReasoning effort: Max90.0%
  6. #6AnthropicClaude Fable 5.1Reasoning effort: Max87.8%
  7. #7OpenAIGPT-5.6 SolReasoning effort: Max82.9%
  8. #8AnthropicClaude Sonnet 5.5Reasoning effort: Max80.5%
  9. #9AnthropicClaude Opus 5Reasoning effort: Max73.2%
  10. #10OpenAIGPT-5.5Reasoning effort: Extra High72.5%
  11. #11OpenAIGPT-5.6 TerraReasoning effort: Max70.7%
  12. #12OpenAIGPT-5.6 LunaReasoning effort: Max61.0%
  13. #13OpenAIGPT-5.4 ProReasoning effort: Extra High58.5%
  14. #14OpenAIGPT-6 LunaReasoning effort: Max56.1%
  15. #14AnthropicClaude Opus 4.8Reasoning effort: Max56.1%
  16. #16OpenAIGPT-5.4Reasoning effort: Extra High49.0%
  17. #17MetaMuse Spark 1.3Reasoning effort: Max46.3%
  18. #18Moonshot AIKimi K3Reasoning effort: Max39.0%
  19. #19GoogleGemini 3.7 FlashReasoning effort: High36.6%
  20. #20AlibabaQwen3.7 Max34.1%
  21. #21xAIGrok 4.6Reasoning effort: Extra High31.7%
  22. #21AnthropicClaude Opus 4.7Reasoning effort: Max31.7%
  23. #23Z.aiGLM 5.3Reasoning effort: Max29.3%
  24. #23AnthropicClaude Sonnet 5Reasoning effort: Max29.3%
  25. #23Z.aiGLM 5.2Reasoning effort: Max29.3%
  26. #26AnthropicClaude Opus 4.6Reasoning effort: Max26.8%
  27. #26GoogleGemini 3.5 FlashReasoning effort: High26.8%
  28. #26GoogleGemini 3.1 Pro26.8%
  29. #26DeepSeekDeepSeek V4 ProReasoning effort: Max26.8%
  30. #30Moonshot AIKimi K2.625.6%
  31. #31xAIGrok 4.5Reasoning effort: High24.4%
  32. #31DeepSeekDeepSeek V4 FlashReasoning effort: Max24.4%
  33. #33OpenAIGPT-5Reasoning effort: High22.0%
  34. #33GoogleGemini 3.8 FlashReasoning effort: High22.0%
  35. #33GoogleGemini 3.6 FlashReasoning effort: High22.0%
  36. #36GoogleGemini 3 Flash17.1%
  37. #36xAIGrok 4.7Reasoning effort: Extra High17.1%
  38. #36Z.aiGLM 5.3 FlashReasoning effort: Max17.1%
  39. #36xAIGrok 4.20 (Reasoning)17.1%
  40. #40xAIGrok 4.3Reasoning effort: High14.6%
  41. #41OpenAIGPT-5.4 NanoReasoning effort: High12.2%
  42. #41OpenAIGPT-5 MiniReasoning effort: High12.2%
  43. #41Moonshot AIKimi K2.7 Code12.2%
  44. #44OpenAIGPT-5.4 MiniReasoning effort: Extra High9.8%
  45. #45AnthropicClaude Opus 4.5Reasoning effort: Budget 32K4.9%
  46. #46AnthropicClaude Opus 4.1Reasoning effort: Budget 32K2.4%
  47. #46AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K2.4%
  48. #46OpenAIGPT-5 NanoReasoning effort: High2.4%
  49. #49GoogleGemini 3.5 Flash-LiteReasoning effort: High0.0%
  50. #49GoogleGemini 2.5 Pro0.0%
Half of models ≤ 28.0%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.