Arena Math
かんたんに言うと · 数学の質問で人々がより好んだ答えを出したAIの順位
- 何を測定しますか?
- 数学の質問(計算・解法・証明)での好みです。正解照合ではなく人が選んだ答えなので、解き方が読みやすい答えが有利です。
- 誰がどのように評価しますか?
- Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 数学の概念を実際に適用して計算・解答する質問をAI分類器が選んで集計します。
- スコアの読み方
- 試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 正答率試験(AIME・MATH-500)とは測るものが違い、正解したかではなく人が気に入ったかです。
最終更新: 2026-10-02
順位
最高スコア1530Gemini 4 Argon
測定したモデル94件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇
- 🥇GoogleGemini 4 Argon57.1%27.1%1530
- 🥈AnthropicClaude Fable 555.5%28.6%1522
- 🥉AnthropicClaude Fable 5.159.1%31.1%1518
- #4GoogleGemini 3.8 Flash47.8%18.3%1518
- #5AnthropicClaude Opus 554.9%29.1%1516
- #6AnthropicClaude Opus 5.561.4%31.7%1511
- #7MetaMuse Spark 1.348.7%26.0%1509
- #8AnthropicClaude Opus 4.639.9%—1507
- #9GoogleGemini 3.7 Flash47.9%14.3%1503
- #10Z.aiGLM 5.3 Flash39.9%15.4%1503
- #11DeepSeekDeepSeek V4.1 Flash39.2%14.3%1503
- #12GoogleGemini 3.6 Flash40.8%10.6%1501
- #13Moonshot AIKimi K346.9%23.4%1501
- #14OpenAIGPT-5.545.8%27.1%1500
- #15Z.aiGLM 5.342.3%19.1%1494
- #16OpenAIGPT-5.6 Sol49.5%32.3%1494
- #17MetaMuse Spark 1.146.2%15.1%1492
- #18OpenAIGPT-5.443.7%23.4%1492
- #19AnthropicClaude Opus 4.742.3%12.0%1492
- #20OpenAIGPT-6 Astra54.7%31.7%1490
- #21GoogleGemini 3.1 Pro47.0%17.7%1488
- #21Z.aiGLM 5.241.1%20.9%1488
- #23XiaomiMiMo-V2.6-Pro49.4%26.6%1487
- #24AlibabaQwen3.7 Max40.5%13.4%1484
- #25GoogleGemini 3.5 Flash42.7%13.1%1482
- #26XiaomiMiMo V2.5 Pro35.7%4.0%1481
- #27Moonshot AIKimi K2.637.5%8.0%1480
- #28OpenAIGPT-5.6 Terra42.9%30.0%1479
- #29OpenAIGPT-5.6 Luna39.5%20.6%1477
- #30AnthropicClaude Opus 4.848.7%20.9%1477
- #31AlibabaQwen3.6 Max30.8%—1476
- #32Z.aiGLM-5.130.1%4.6%1475
- #33GoogleGemini 3 Flash36.6%—1474
- #34AnthropicClaude Sonnet 541.3%16.9%1474
- #35xAIGrok 4.542.7%15.4%1473
- #36XiaomiMiMo-V2.6-Flash35.1%12.0%1472
- #37Moonshot AIKimi K2.530.7%3.1%1471
- #38GoogleGemma 4 31B23.6%1.4%1469
- #39MetaMuse Spark 1.245.5%17.7%1468
- #40MetaMuse Spark40.7%11.3%1466
- #41AlibabaQwen3.7 Plus35.6%9.1%1466
- #42xAIGrok 4.20 (Reasoning)34.5%—1465
- #43AnthropicClaude Sonnet 4.633.6%3.1%1464
- #44AnthropicClaude Opus 4.530.1%—1463
- #45OpenAIGPT-6 Luna38.5%19.4%1460
- #46AlibabaQwen3.6 Plus27.8%2.9%1454
- #47AlibabaQwen3.5 397B A17B29.0%—1452
- #48OpenAIGPT-6 Sol47.9%30.9%1451
- #49XiaomiMiMo V2 Pro30.4%—1451
- #50ByteDanceDola Seed 2.0 Pro——1450
- #51xAIGrok 4.2027.9%—1449
- #52xAIGrok 4.644.1%19.7%1448
- #53DeepSeekDeepSeek V4 Pro41.0%18.0%1445
- #54xAIGrok 4.743.1%18.0%1444
- #55Z.aiGLM-529.3%—1444
- #56AnthropicClaude Opus 4.112.5%—1443
- #57GoogleGemini 3.5 Flash-Lite18.8%0.0%1442
- #58NVIDIANemotron 3 Ultra28.4%3.1%1442
- #59GoogleGemini 2.5 Pro22.5%2.0%1439
- #60OpenAIGPT-5.4 Mini28.1%10.0%1439
- #61XiaomiMiMo V2.527.2%3.7%1438
- #62Z.aiGLM 5V Turbo17.1%—1437
- #63GoogleGemini 3.1 Flash Lite17.2%1.1%1436
- #64MeituanLongcat Flash Chat5.8%—1435
- #65BaiduERNIE 5.0 Thinking13.3%—1435
- #66OpenAIGPT-528.5%12.6%1434
- #67MiniMaxMiniMax M339.0%3.7%1432
- #68TencentHy333.5%—1431
- #69Mistral AIMistral Medium 3.513.8%0.0%1429
- #70AnthropicClaude Sonnet 4.517.8%1.1%1428
- #71DeepSeekDeepSeek V3.224.6%—1427
- #72DeepSeekDeepSeek V4 Flash38.6%16.6%1425
- #73OpenAIGPT-5.4 Nano28.3%9.3%1425
- #74MiniMaxMiniMax M2.729.6%0.6%1422
- #75AnthropicClaude Opus 412.3%0.3%1421
- #76xAIGrok 4.1 Fast (Reasoning)19.3%—1421
- #77xAIGrok 4.337.2%8.0%1419
- #78UpstageSolar Pro 429.2%—1412
- #79OpenAIGPT-5 Mini21.5%0.0%1405
- #80GoogleGemini 2.5 Flash12.1%1.1%1405
- #81AnthropicClaude Sonnet 410.7%0.3%1404
- #82AnthropicClaude Haiku 4.510.4%0.0%1400
- #83MiniMaxMiniMax M2.520.5%—1393
- #84Arcee AITrinity Large Thinking15.8%0.9%1384
- #85OpenAIGPT OSS 120B19.6%1.1%1381
- #86NVIDIANemotron 3 Super20.8%3.1%1373
- #87GoogleGemini 2.5 Flash Lite7.0%—1362
- #88NVIDIANemotron 3 Nano 30B A3B11.4%—1347
- #89OpenAIGPT-5 Nano9.5%—1346
- #90AmazonNova 2 Lite11.6%—1332
- #91IBMGranite 4.1 8B3.8%—1317
- #92MetaLlama 4 Maverick4.9%0.0%1316
- #93MetaLlama 4 Scout3.8%0.0%1309
- #94OpenAIGPT-4.14.2%—1303
モデルの半数が1452以下測定: ユーザー選好投票最終更新 2026-10-02
直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個
出典: Arena Intelligence データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
- どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。