Arena Mathematical
かんたんに言うと · 数学・統計分野の専門家レベルの質問で人々がより好んだAI
- 何を測定しますか?
- 数学・統計分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:証明の検討、統計モデルの選択、最適化問題。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
- 誰がどのように評価しますか?
- Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「数学・統計」に分類された質問だけを集計します。
- スコアの読み方
- 試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。
最終更新: 2026-10-02
順位
最高スコア1542Gemini 4 Argon
測定したモデル94件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
さまざまな分野の専門家でも難しい問題を解ける?Humanity's Last Exam
Claude Opus 5.5🥇
Claude Opus 5.5🥇研究レベルの物理の問題を解ける?CritPt
GPT-5.6 Sol🥇
GPT-5.6 Sol🥇多くの人に最も好まれる数学の回答をするAIは?Arena Math
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇GoogleGemini 4 Argon1542
- 🥈AnthropicClaude Fable 5.11523
- 🥉AnthropicClaude Fable 51522
- #4AnthropicClaude Opus 5.51521
- #5AnthropicClaude Opus 51518
- #6AnthropicClaude Opus 4.61513
- #7OpenAIGPT-5.6 Sol1513
- #8GoogleGemini 3.8 Flash1512
- #9Moonshot AIKimi K31509
- #10DeepSeekDeepSeek V4.1 Flash1503
- #11XiaomiMiMo-V2.6-Pro1501
- #12MetaMuse Spark 1.11500
- #13Z.aiGLM 5.31499
- #14OpenAIGPT-5.41499
- #15OpenAIGPT-5.51499
- #16AnthropicClaude Opus 4.71499
- #17OpenAIGPT-6 Astra1498
- #18GoogleGemini 3.7 Flash1495
- #19Z.aiGLM 5.3 Flash1495
- #20MetaMuse Spark 1.21494
- #21Z.aiGLM 5.21494
- #22xAIGrok 4.51493
- #23MetaMuse Spark 1.31493
- #24XiaomiMiMo V2.5 Pro1491
- #25AnthropicClaude Opus 4.81490
- #26OpenAIGPT-5.6 Terra1489
- #27GoogleGemini 3.5 Flash1488
- #28GoogleGemini 3.6 Flash1487
- #29AlibabaQwen3.6 Max1487
- #30AnthropicClaude Sonnet 51487
- #31OpenAIGPT-5.6 Luna1487
- #32xAIGrok 4.61485
- #33Moonshot AIKimi K2.61485
- #34AnthropicClaude Sonnet 4.61485
- #35GoogleGemini 3.1 Pro1484
- #36Moonshot AIKimi K2.51477
- #37AnthropicClaude Opus 4.51475
- #38Z.aiGLM-5.11474
- #39AlibabaQwen3.7 Plus1474
- #40GoogleGemma 4 31B1473
- #41XiaomiMiMo V2 Pro1471
- #41MetaMuse Spark1471
- #43GoogleGemini 3 Flash1468
- #44OpenAIGPT-6 Luna1468
- #45AlibabaQwen3.7 Max1466
- #46xAIGrok 4.20 (Reasoning)1460
- #47DeepSeekDeepSeek V4 Pro1460
- #48Z.aiGLM-51458
- #49XiaomiMiMo-V2.6-Flash1457
- #50AlibabaQwen3.6 Plus1455
- #51xAIGrok 4.201455
- #52AlibabaQwen3.5 397B A17B1454
- #53XiaomiMiMo V2.51454
- #54OpenAIGPT-6 Sol1454
- #55AnthropicClaude Sonnet 4.51452
- #55OpenAIGPT-5.4 Mini1452
- #55TencentHy31452
- #58NVIDIANemotron 3 Ultra1451
- #59AnthropicClaude Opus 4.11451
- #60xAIGrok 4.71450
- #61ByteDanceDola Seed 2.0 Pro1448
- #62GoogleGemini 3.5 Flash-Lite1448
- #62MiniMaxMiniMax M31448
- #64GoogleGemini 2.5 Pro1447
- #65Z.aiGLM 5V Turbo1446
- #66OpenAIGPT-51442
- #67MiniMaxMiniMax M2.71441
- #68MeituanLongcat Flash Chat1440
- #69Mistral AIMistral Medium 3.51439
- #70BaiduERNIE 5.0 Thinking1435
- #71DeepSeekDeepSeek V4 Flash1434
- #72AnthropicClaude Haiku 4.51433
- #73DeepSeekDeepSeek V3.21432
- #74GoogleGemini 3.1 Flash Lite1432
- #75xAIGrok 4.31431
- #76OpenAIGPT-5.4 Nano1431
- #77AnthropicClaude Opus 41426
- #78xAIGrok 4.1 Fast (Reasoning)1423
- #79UpstageSolar Pro 41421
- #80GoogleGemini 2.5 Flash1416
- #81AnthropicClaude Sonnet 41413
- #82OpenAIGPT-5 Mini1407
- #83MiniMaxMiniMax M2.51399
- #83NVIDIANemotron 3 Super1399
- #85OpenAIGPT OSS 120B1384
- #86Arcee AITrinity Large Thinking1376
- #87GoogleGemini 2.5 Flash Lite1370
- #88OpenAIGPT-5 Nano1355
- #89NVIDIANemotron 3 Nano 30B A3B1354
- #90AmazonNova 2 Lite1347
- #91IBMGranite 4.1 8B1326
- #92MetaLlama 4 Maverick1319
- #93MetaLlama 4 Scout1314
- #94OpenAIGPT-4.11309
モデルの半数が1459以下測定: ユーザー選好投票最終更新 2026-10-02
直近60日にリリースされたAI 37個のうち21個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか18個
出典: Arena Intelligence データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
- どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。