FrontierMath Tier 4 v2

よく引用高いほど良い

Epoch AIのFrontierMathのうち最も難しい研究レベルの数学問題群(第4段階)の第2版です(2026年6月、12問修正・7問削除、43問)。AIはPythonを使い、正確な答えを出す必要があります。スコアは0〜100%です。高いほど良い結果です。

最高スコア100.0%GPT-6.1 Sol
測定したモデル50件
最終更新2026.09.29
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇OpenAIGPT-6.1 Sol推論強度: Max100.0%
  2. 🥈OpenAIGPT-6 Astra推論強度: Max97.6%
  3. 🥉AnthropicClaude Opus 5.5推論強度: Max95.0%
  4. #4AnthropicClaude Fable 5推論強度: Max90.2%
  5. #5OpenAIGPT-6 Sol推論強度: Max90.0%
  6. #6AnthropicClaude Fable 5.1推論強度: Max87.8%
  7. #7OpenAIGPT-5.6 Sol推論強度: Max82.9%
  8. #8AnthropicClaude Sonnet 5.5推論強度: Max80.5%
  9. #9AnthropicClaude Opus 5推論強度: Max73.2%
  10. #10OpenAIGPT-5.5推論強度: Extra High72.5%
  11. #11OpenAIGPT-5.6 Terra推論強度: Max70.7%
  12. #12OpenAIGPT-5.6 Luna推論強度: Max61.0%
  13. #13OpenAIGPT-5.4 Pro推論強度: Extra High58.5%
  14. #14OpenAIGPT-6 Luna推論強度: Max56.1%
  15. #14AnthropicClaude Opus 4.8推論強度: Max56.1%
  16. #16OpenAIGPT-5.4推論強度: Extra High49.0%
  17. #17MetaMuse Spark 1.3推論強度: Max46.3%
  18. #18Moonshot AIKimi K3推論強度: Max39.0%
  19. #19GoogleGemini 3.7 Flash推論強度: High36.6%
  20. #20AlibabaQwen3.7 Max34.1%
  21. #21xAIGrok 4.6推論強度: Extra High31.7%
  22. #21AnthropicClaude Opus 4.7推論強度: Max31.7%
  23. #23Z.aiGLM 5.3推論強度: Max29.3%
  24. #23AnthropicClaude Sonnet 5推論強度: Max29.3%
  25. #23Z.aiGLM 5.2推論強度: Max29.3%
  26. #26AnthropicClaude Opus 4.6推論強度: Max26.8%
  27. #26GoogleGemini 3.5 Flash推論強度: High26.8%
  28. #26GoogleGemini 3.1 Pro26.8%
  29. #26DeepSeekDeepSeek V4 Pro推論強度: Max26.8%
  30. #30Moonshot AIKimi K2.625.6%
  31. #31xAIGrok 4.5推論強度: High24.4%
  32. #31DeepSeekDeepSeek V4 Flash推論強度: Max24.4%
  33. #33OpenAIGPT-5推論強度: High22.0%
  34. #33GoogleGemini 3.8 Flash推論強度: High22.0%
  35. #33GoogleGemini 3.6 Flash推論強度: High22.0%
  36. #36GoogleGemini 3 Flash17.1%
  37. #36xAIGrok 4.7推論強度: Extra High17.1%
  38. #36Z.aiGLM 5.3 Flash推論強度: Max17.1%
  39. #36xAIGrok 4.20 (Reasoning)17.1%
  40. #40xAIGrok 4.3推論強度: High14.6%
  41. #41OpenAIGPT-5.4 Nano推論強度: High12.2%
  42. #41OpenAIGPT-5 Mini推論強度: High12.2%
  43. #41Moonshot AIKimi K2.7 Code12.2%
  44. #44OpenAIGPT-5.4 Mini推論強度: Extra High9.8%
  45. #45AnthropicClaude Opus 4.5推論強度: Budget 32K4.9%
  46. #46AnthropicClaude Opus 4.1推論強度: Budget 32K2.4%
  47. #46AnthropicClaude Sonnet 4.5推論強度: Budget 32K2.4%
  48. #46OpenAIGPT-5 Nano推論強度: High2.4%
  49. #49GoogleGemini 3.5 Flash-Lite推論強度: High0.0%
  50. #49GoogleGemini 2.5 Pro0.0%
モデルの半数が28.0%以下最終更新 2026-10-07

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。