Arena Math

かんたんに言うと · 数学の質問で人々がより好んだ答えを出したAIの順位

何を測定しますか?
数学の質問(計算・解法・証明)での好みです。正解照合ではなく人が選んだ答えなので、解き方が読みやすい答えが有利です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 数学の概念を実際に適用して計算・解答する質問をAI分類器が選んで集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 正答率試験(AIME・MATH-500)とは測るものが違い、正解したかではなく人が気に入ったかです。

最終更新: 2026-10-02

順位

最高スコア1530Gemini 4 Argon
測定したモデル94件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 4 Argon57.1%27.1%1530
  2. 🥈AnthropicClaude Fable 555.5%28.6%1522
  3. 🥉AnthropicClaude Fable 5.159.1%31.1%1518
  4. #4GoogleGemini 3.8 Flash47.8%18.3%1518
  5. #5AnthropicClaude Opus 554.9%29.1%1516
  6. #6AnthropicClaude Opus 5.561.4%31.7%1511
  7. #7MetaMuse Spark 1.348.7%26.0%1509
  8. #8AnthropicClaude Opus 4.639.9%—1507
  9. #9GoogleGemini 3.7 Flash47.9%14.3%1503
  10. #10Z.aiGLM 5.3 Flash39.9%15.4%1503
  11. #11DeepSeekDeepSeek V4.1 Flash39.2%14.3%1503
  12. #12GoogleGemini 3.6 Flash40.8%10.6%1501
  13. #13Moonshot AIKimi K346.9%23.4%1501
  14. #14OpenAIGPT-5.545.8%27.1%1500
  15. #15Z.aiGLM 5.342.3%19.1%1494
  16. #16OpenAIGPT-5.6 Sol49.5%32.3%1494
  17. #17MetaMuse Spark 1.146.2%15.1%1492
  18. #18OpenAIGPT-5.443.7%23.4%1492
  19. #19AnthropicClaude Opus 4.742.3%12.0%1492
  20. #20OpenAIGPT-6 Astra54.7%31.7%1490
  21. #21GoogleGemini 3.1 Pro47.0%17.7%1488
  22. #21Z.aiGLM 5.241.1%20.9%1488
  23. #23XiaomiMiMo-V2.6-Pro49.4%26.6%1487
  24. #24AlibabaQwen3.7 Max40.5%13.4%1484
  25. #25GoogleGemini 3.5 Flash42.7%13.1%1482
  26. #26XiaomiMiMo V2.5 Pro35.7%4.0%1481
  27. #27Moonshot AIKimi K2.637.5%8.0%1480
  28. #28OpenAIGPT-5.6 Terra42.9%30.0%1479
  29. #29OpenAIGPT-5.6 Luna39.5%20.6%1477
  30. #30AnthropicClaude Opus 4.848.7%20.9%1477
  31. #31AlibabaQwen3.6 Max30.8%—1476
  32. #32Z.aiGLM-5.130.1%4.6%1475
  33. #33GoogleGemini 3 Flash36.6%—1474
  34. #34AnthropicClaude Sonnet 541.3%16.9%1474
  35. #35xAIGrok 4.542.7%15.4%1473
  36. #36XiaomiMiMo-V2.6-Flash35.1%12.0%1472
  37. #37Moonshot AIKimi K2.530.7%3.1%1471
  38. #38GoogleGemma 4 31B23.6%1.4%1469
  39. #39MetaMuse Spark 1.245.5%17.7%1468
  40. #40MetaMuse Spark40.7%11.3%1466
  41. #41AlibabaQwen3.7 Plus35.6%9.1%1466
  42. #42xAIGrok 4.20 (Reasoning)34.5%—1465
  43. #43AnthropicClaude Sonnet 4.633.6%3.1%1464
  44. #44AnthropicClaude Opus 4.530.1%—1463
  45. #45OpenAIGPT-6 Luna38.5%19.4%1460
  46. #46AlibabaQwen3.6 Plus27.8%2.9%1454
  47. #47AlibabaQwen3.5 397B A17B29.0%—1452
  48. #48OpenAIGPT-6 Sol47.9%30.9%1451
  49. #49XiaomiMiMo V2 Pro30.4%—1451
  50. #50ByteDanceDola Seed 2.0 Pro——1450
  51. #51xAIGrok 4.2027.9%—1449
  52. #52xAIGrok 4.644.1%19.7%1448
  53. #53DeepSeekDeepSeek V4 Pro41.0%18.0%1445
  54. #54xAIGrok 4.743.1%18.0%1444
  55. #55Z.aiGLM-529.3%—1444
  56. #56AnthropicClaude Opus 4.112.5%—1443
  57. #57GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
  58. #58NVIDIANemotron 3 Ultra28.4%3.1%1442
  59. #59GoogleGemini 2.5 Pro22.5%2.0%1439
  60. #60OpenAIGPT-5.4 Mini28.1%10.0%1439
  61. #61XiaomiMiMo V2.527.2%3.7%1438
  62. #62Z.aiGLM 5V Turbo17.1%—1437
  63. #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
  64. #64MeituanLongcat Flash Chat5.8%—1435
  65. #65BaiduERNIE 5.0 Thinking13.3%—1435
  66. #66OpenAIGPT-528.5%12.6%1434
  67. #67MiniMaxMiniMax M339.0%3.7%1432
  68. #68TencentHy333.5%—1431
  69. #69Mistral AIMistral Medium 3.513.8%0.0%1429
  70. #70AnthropicClaude Sonnet 4.517.8%1.1%1428
  71. #71DeepSeekDeepSeek V3.224.6%—1427
  72. #72DeepSeekDeepSeek V4 Flash38.6%16.6%1425
  73. #73OpenAIGPT-5.4 Nano28.3%9.3%1425
  74. #74MiniMaxMiniMax M2.729.6%0.6%1422
  75. #75AnthropicClaude Opus 412.3%0.3%1421
  76. #76xAIGrok 4.1 Fast (Reasoning)19.3%—1421
  77. #77xAIGrok 4.337.2%8.0%1419
  78. #78UpstageSolar Pro 429.2%—1412
  79. #79OpenAIGPT-5 Mini21.5%0.0%1405
  80. #80GoogleGemini 2.5 Flash12.1%1.1%1405
  81. #81AnthropicClaude Sonnet 410.7%0.3%1404
  82. #82AnthropicClaude Haiku 4.510.4%0.0%1400
  83. #83MiniMaxMiniMax M2.520.5%—1393
  84. #84Arcee AITrinity Large Thinking15.8%0.9%1384
  85. #85OpenAIGPT OSS 120B19.6%1.1%1381
  86. #86NVIDIANemotron 3 Super20.8%3.1%1373
  87. #87GoogleGemini 2.5 Flash Lite7.0%—1362
  88. #88NVIDIANemotron 3 Nano 30B A3B11.4%—1347
  89. #89OpenAIGPT-5 Nano9.5%—1346
  90. #90AmazonNova 2 Lite11.6%—1332
  91. #91IBMGranite 4.1 8B3.8%—1317
  92. #92MetaLlama 4 Maverick4.9%0.0%1316
  93. #93MetaLlama 4 Scout3.8%0.0%1309
  94. #94OpenAIGPT-4.14.2%—1303
モデルの半数が1452以下測定: ユーザー選好投票最終更新 2026-10-02

直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。