FrontierMath Tiers 1-3 v2

よく引用高いほど良い

数学者が新たに作った大学上級から初期研究レベルまでの数学問題群FrontierMath第1〜3段階の第2版です(2026年6月、123問修正・5問削除、295問)。AIはPythonを使い、正確な答えを出す必要があります。スコアは0〜100%です。高いほど良い結果です。

最高スコア93.7%GPT-6.1 Sol
測定したモデル58件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6.1 Sol推論強度: Max93.7%
  2. 🥇OpenAIGPT-6 Astra推論強度: Max93.7%
  3. 🥉AnthropicClaude Opus 5.5推論強度: Max91.2%
  4. #4AnthropicClaude Fable 5.1推論強度: Max90.2%
  5. #5OpenAIGPT-6 Sol推論強度: Max89.8%
  6. #6OpenAIGPT-5.6 Sol推論強度: Max89.1%
  7. #7AnthropicClaude Sonnet 5.5推論強度: Max88.8%
  8. #8AnthropicClaude Fable 5推論強度: Max87.0%
  9. #9OpenAIGPT-5.6 Terra推論強度: Max86.0%
  10. #10AnthropicClaude Opus 5推論強度: Max85.6%
  11. #11OpenAIGPT-5.5推論強度: Extra High85.3%
  12. #12OpenAIGPT-5.4 Pro推論強度: Extra High82.5%
  13. #13OpenAIGPT-5.6 Luna推論強度: Max82.1%
  14. #14AnthropicClaude Opus 4.8推論強度: Max80.0%
  15. #15OpenAIGPT-6 Luna推論強度: Max78.9%
  16. #16OpenAIGPT-5.4推論強度: Extra High78.6%
  17. #17MetaMuse Spark 1.3推論強度: Extra High74.4%
  18. #18Moonshot AIKimi K3推論強度: Max72.2%
  19. #19GoogleGemini 3.7 Flash推論強度: High71.6%
  20. #20AnthropicClaude Opus 4.7推論強度: Max70.2%
  21. #21Z.aiGLM 5.3推論強度: Max68.8%
  22. #22GoogleGemini 3.8 Flash推論強度: High68.4%
  23. #23AnthropicClaude Opus 4.6推論強度: Max66.0%
  24. #23xAIGrok 4.6推論強度: Extra High66.0%
  25. #25AnthropicClaude Sonnet 5推論強度: Max65.6%
  26. #26AlibabaQwen3.7 Max64.6%
  27. #26DeepSeekDeepSeek V4 Pro推論強度: Max64.6%
  28. #28GoogleGemini 3.5 Flash推論強度: High62.8%
  29. #29GoogleGemini 3.1 Pro59.6%
  30. #30Z.aiGLM 5.2推論強度: Max59.2%
  31. #31GoogleGemini 3.6 Flash推論強度: High58.9%
  32. #32DeepSeekDeepSeek V4 Flash推論強度: Max57.5%
  33. #33Moonshot AIKimi K2.657.2%
  34. #33xAIGrok 4.5推論強度: High57.2%
  35. #35Z.aiGLM 5.3 Flash推論強度: Max55.8%
  36. #36OpenAIGPT-5推論強度: High55.4%
  37. #37Moonshot AIKimi K2.7 Code54.0%
  38. #38xAIGrok 4.7推論強度: Extra High53.0%
  39. #39GoogleGemini 3 Flash51.2%
  40. #39OpenAIGPT-5.4 Mini推論強度: Extra High51.2%
  41. #41OpenAIGPT-5 Mini推論強度: High46.7%
  42. #42OpenAIGPT-5.4 Nano推論強度: High44.9%
  43. #42xAIGrok 4.20 (Reasoning)44.9%
  44. #44xAIGrok 4.3推論強度: High42.8%
  45. #45AlibabaQwen3.6 Plus38.2%
  46. #46Z.aiGLM-5.136.8%
  47. #47AlibabaQwen3.7 Plus推論強度: None34.4%
  48. #47AnthropicClaude Opus 4.5推論強度: Budget 32K34.4%
  49. #49AlibabaQwen3.5 397B A17B推論強度: None31.2%
  50. #50GoogleGemini 3.1 Flash Lite推論強度: High27.7%
  51. #51GoogleGemini 3.5 Flash-Lite推論強度: High26.0%
  52. #52GoogleGemini 2.5 Pro24.6%
  53. #53AnthropicClaude Sonnet 4.5推論強度: Budget 32K23.9%
  54. #54AlibabaQwen3.6 Flash推論強度: None22.5%
  55. #55AlibabaQwen3.6 35B A3B推論強度: None20.4%
  56. #56OpenAIGPT-5 Nano推論強度: High20.0%
  57. #57AnthropicClaude Opus 4.1推論強度: Budget 32K12.6%
  58. #58OpenAIGPT-4.16.0%
モデルの半数が59.4%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。