Arena Business, Management & Finance
かんたんに言うと · ビジネス・経営・金融分野の専門家レベルの質問で人々がより好んだAI
- 何を測定しますか?
- ビジネス・経営・金融分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:財務モデルの検討、事業計画、会計処理。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
- 誰がどのように評価しますか?
- Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「ビジネス・経営・金融」に分類された質問だけを集計します。
- スコアの読み方
- 試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。
最終更新: 2026-10-02
順位
最高スコア1523Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
複数の長い文書に散らばった情報を、まとめて答えられる?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇表を読んで、求める形に整理できる?LiveBench Data Analysis
GPT-6 Astra🥇
GPT-6 Astra🥇
- 🥇GoogleGemini 4 Argon79.7%—1523
- 🥈MetaMuse Spark 1.279.0%76.51514
- 🥉MetaMuse Spark 1.383.0%79.61505
- #4AnthropicClaude Fable 582.3%80.51502
- #5AnthropicClaude Opus 4.678.0%69.91500
- #6AnthropicClaude Opus 4.778.7%78.31496
- #7MetaMuse Spark 1.177.7%72.51493
- #8MetaMuse Spark78.0%—1489
- #9AnthropicClaude Opus 5.584.7%79.81489
- #10Moonshot AIKimi K388.7%78.71487
- #11AnthropicClaude Opus 4.877.7%66.01487
- #12OpenAIGPT-5.584.3%81.61485
- #13OpenAIGPT-5.6 Sol84.0%79.81485
- #14AnthropicClaude Opus 582.0%74.51484
- #15AnthropicClaude Fable 5.185.3%80.31484
- #16GoogleGemini 3.7 Flash83.0%68.01483
- #17OpenAIGPT-5.482.0%79.31482
- #17AnthropicClaude Sonnet 4.680.0%78.01482
- #19GoogleGemini 3.8 Flash84.0%54.01481
- #20DeepSeekDeepSeek V4.1 Flash84.0%79.31479
- #21GoogleGemini 3.1 Pro82.0%78.51477
- #22Z.aiGLM 5.379.7%70.21475
- #23OpenAIGPT-6.1 Sol84.0%82.21475
- #24OpenAIGPT-6 Astra80.7%83.01473
- #25GoogleGemini 3.6 Flash80.0%63.01472
- #26AnthropicClaude Opus 4.577.3%74.41472
- #27XiaomiMiMo V2.5 Pro79.7%—1471
- #28xAIGrok 4.2023.3%—1470
- #29GoogleGemini 3 Flash78.0%—1468
- #30StepfunStep-588.3%—1468
- #31OpenAIGPT-5.6 Terra83.0%79.31467
- #31Z.aiGLM 5.3 Flash80.0%76.41467
- #33xAIGrok 4.20 (Reasoning)69.0%—1466
- #34Z.aiGLM 5.278.3%73.71466
- #35xAIGrok 4.579.3%73.01465
- #36Z.aiGLM-5.173.7%—1465
- #37AnthropicClaude Sonnet 582.0%71.71465
- #38ByteDanceDola Seed 2.0 Pro——1464
- #39AnthropicClaude Sonnet 5.582.7%78.61464
- #40OpenAIGPT-5.6 Luna83.7%78.01463
- #41GoogleGemini 3.5 Flash74.3%64.91462
- #42XiaomiMiMo-V2.6-Pro86.3%—1461
- #43AnthropicClaude Sonnet 4.572.3%—1461
- #44DeepSeekDeepSeek V4 Pro80.3%74.51460
- #45OpenAIGPT-5.4 Mini77.0%70.81460
- #46XiaomiMiMo-V2.6-Flash74.3%—1459
- #47AlibabaQwen3.7 Max79.0%71.81458
- #48Moonshot AIKimi K2.681.0%65.11455
- #49XiaomiMiMo V2 Pro68.3%—1454
- #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
- #51AlibabaQwen3.6 Max80.7%—1451
- #52Z.aiGLM-575.7%—1451
- #53GoogleGemma 4 31B69.7%—1449
- #54MiniMaxMiniMax M383.0%76.21448
- #55AnthropicClaude Opus 4.176.0%—1447
- #56OpenAIGPT-6 Luna83.3%73.41447
- #56xAIGrok 4.681.0%73.91447
- #58AlibabaQwen3.5 397B A17B77.3%—1446
- #59OpenAIGPT-6 Sol83.7%81.21446
- #60AlibabaQwen3.6 Plus78.3%69.91446
- #61AlibabaQwen3.7 Plus73.0%—1445
- #62XiaomiMiMo V2.573.0%—1441
- #63BaiduERNIE 5.0 Thinking7.0%—1441
- #64Moonshot AIKimi K2.578.0%—1440
- #65Z.aiGLM 5V Turbo70.3%—1440
- #66xAIGrok 4.375.0%55.81439
- #67DeepSeekDeepSeek V4 Flash79.7%68.01439
- #68GoogleGemini 2.5 Pro69.0%—1437
- #69xAIGrok 4.780.0%76.91433
- #70MeituanLongcat Flash Chat28.3%—1433
- #71Mistral AIMistral Medium 3.569.3%—1430
- #72MiniMaxMiniMax M2.778.3%—1424
- #73DeepSeekDeepSeek V3.273.3%—1422
- #74GoogleGemini 3.1 Flash Lite74.3%—1420
- #75AnthropicClaude Haiku 4.574.3%—1420
- #76NVIDIANemotron 3 Ultra79.3%54.51418
- #77xAIGrok 4.1 Fast (Reasoning)74.0%—1417
- #78OpenAIGPT-578.2%—1413
- #79TencentHy379.0%—1412
- #80AnthropicClaude Opus 469.3%—1409
- #81OpenAIGPT-5.4 Nano76.7%67.61405
- #82MiniMaxMiniMax M2.573.3%—1400
- #83GoogleGemini 2.5 Flash65.3%—1399
- #84UpstageSolar Pro 474.0%—1388
- #85OpenAIGPT-5 Mini72.3%—1381
- #86AnthropicClaude Sonnet 470.3%—1381
- #87GoogleGemini 2.5 Flash Lite64.7%—1378
- #88Arcee AITrinity Large Thinking38.0%—1367
- #89OpenAIGPT OSS 120B52.0%—1352
- #90AmazonNova 2 Lite60.3%—1351
- #91NVIDIANemotron 3 Super65.7%—1350
- #92OpenAIGPT-5 Nano45.0%—1339
- #93MetaLlama 4 Maverick50.0%—1317
- #93NVIDIANemotron 3 Nano 30B A3B38.0%—1317
- #95MetaLlama 4 Scout27.7%—1316
- #96IBMGranite 4.1 8B13.3%—1293
- #97OpenAIGPT-4.168.3%—1279
モデルの半数が1454以下測定: ユーザー選好投票最終更新 2026-10-02
直近60日にリリースされたAI 37個のうち18個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか15個
出典: Arena Intelligence データの出典・掲載停止のご依頼このスコアを読むときに知っておくこと
- 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
- どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
- 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。