FrontierMath Tiers 1-3 v2

Widely citedHigher is better

Version 2 of FrontierMath Tiers 1-3, original math problems written by mathematicians from advanced undergraduate to early research level (June 2026: 123 problems corrected and 5 removed, leaving 295). The AI can use Python and must give an exact answer. Scores run from 0 to 100%. Higher is better.

Top score93.7%GPT-6.1 Sol
Models tested58
Last updated2026.09.29
Model release date (newest on the right)
Best score so farHigher on the chart is better
  1. 🥇OpenAIGPT-6.1 SolReasoning effort: Max93.7%
  2. 🥇OpenAIGPT-6 AstraReasoning effort: Max93.7%
  3. 🥉AnthropicClaude Opus 5.5Reasoning effort: Max91.2%
  4. #4AnthropicClaude Fable 5.1Reasoning effort: Max90.2%
  5. #5OpenAIGPT-6 SolReasoning effort: Max89.8%
  6. #6OpenAIGPT-5.6 SolReasoning effort: Max89.1%
  7. #7AnthropicClaude Sonnet 5.5Reasoning effort: Max88.8%
  8. #8AnthropicClaude Fable 5Reasoning effort: Max87.0%
  9. #9OpenAIGPT-5.6 TerraReasoning effort: Max86.0%
  10. #10AnthropicClaude Opus 5Reasoning effort: Max85.6%
  11. #11OpenAIGPT-5.5Reasoning effort: Extra High85.3%
  12. #12OpenAIGPT-5.4 ProReasoning effort: Extra High82.5%
  13. #13OpenAIGPT-5.6 LunaReasoning effort: Max82.1%
  14. #14AnthropicClaude Opus 4.8Reasoning effort: Max80.0%
  15. #15OpenAIGPT-6 LunaReasoning effort: Max78.9%
  16. #16OpenAIGPT-5.4Reasoning effort: Extra High78.6%
  17. #17MetaMuse Spark 1.3Reasoning effort: Extra High74.4%
  18. #18Moonshot AIKimi K3Reasoning effort: Max72.2%
  19. #19GoogleGemini 3.7 FlashReasoning effort: High71.6%
  20. #20AnthropicClaude Opus 4.7Reasoning effort: Max70.2%
  21. #21Z.aiGLM 5.3Reasoning effort: Max68.8%
  22. #22GoogleGemini 3.8 FlashReasoning effort: High68.4%
  23. #23AnthropicClaude Opus 4.6Reasoning effort: Max66.0%
  24. #23xAIGrok 4.6Reasoning effort: Extra High66.0%
  25. #25AnthropicClaude Sonnet 5Reasoning effort: Max65.6%
  26. #26AlibabaQwen3.7 Max64.6%
  27. #26DeepSeekDeepSeek V4 ProReasoning effort: Max64.6%
  28. #28GoogleGemini 3.5 FlashReasoning effort: High62.8%
  29. #29GoogleGemini 3.1 Pro59.6%
  30. #30Z.aiGLM 5.2Reasoning effort: Max59.2%
  31. #31GoogleGemini 3.6 FlashReasoning effort: High58.9%
  32. #32DeepSeekDeepSeek V4 FlashReasoning effort: Max57.5%
  33. #33Moonshot AIKimi K2.657.2%
  34. #33xAIGrok 4.5Reasoning effort: High57.2%
  35. #35Z.aiGLM 5.3 FlashReasoning effort: Max55.8%
  36. #36OpenAIGPT-5Reasoning effort: High55.4%
  37. #37Moonshot AIKimi K2.7 Code54.0%
  38. #38xAIGrok 4.7Reasoning effort: Extra High53.0%
  39. #39GoogleGemini 3 Flash51.2%
  40. #39OpenAIGPT-5.4 MiniReasoning effort: Extra High51.2%
  41. #41OpenAIGPT-5 MiniReasoning effort: High46.7%
  42. #42OpenAIGPT-5.4 NanoReasoning effort: High44.9%
  43. #42xAIGrok 4.20 (Reasoning)44.9%
  44. #44xAIGrok 4.3Reasoning effort: High42.8%
  45. #45AlibabaQwen3.6 Plus38.2%
  46. #46Z.aiGLM-5.136.8%
  47. #47AlibabaQwen3.7 PlusReasoning effort: None34.4%
  48. #47AnthropicClaude Opus 4.5Reasoning effort: Budget 32K34.4%
  49. #49AlibabaQwen3.5 397B A17BReasoning effort: None31.2%
  50. #50GoogleGemini 3.1 Flash LiteReasoning effort: High27.7%
  51. #51GoogleGemini 3.5 Flash-LiteReasoning effort: High26.0%
  52. #52GoogleGemini 2.5 Pro24.6%
  53. #53AnthropicClaude Sonnet 4.5Reasoning effort: Budget 32K23.9%
  54. #54AlibabaQwen3.6 FlashReasoning effort: None22.5%
  55. #55AlibabaQwen3.6 35B A3BReasoning effort: None20.4%
  56. #56OpenAIGPT-5 NanoReasoning effort: High20.0%
  57. #57AnthropicClaude Opus 4.1Reasoning effort: Budget 32K12.6%
  58. #58OpenAIGPT-4.16.0%
Half of models ≤ 59.4%Last updated 2026-10-07

The "harness" is the agent program the AI used to carry out the task. The same model can score very differently depending on its harness and reasoning effort.