Arena Business, Management & Finance

かんたんに言うと · ビジネス・経営・金融分野の専門家レベルの質問で人々がより好んだAI

何を測定しますか?
ビジネス・経営・金融分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:財務モデルの検討、事業計画、会計処理。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「ビジネス・経営・金融」に分類された質問だけを集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。

最終更新: 2026-10-02

順位

最高スコア1523Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 4 Argon79.7%—1523
  2. 🥈MetaMuse Spark 1.279.0%76.51514
  3. 🥉MetaMuse Spark 1.383.0%79.61505
  4. #4AnthropicClaude Fable 582.3%80.51502
  5. #5AnthropicClaude Opus 4.678.0%69.91500
  6. #6AnthropicClaude Opus 4.778.7%78.31496
  7. #7MetaMuse Spark 1.177.7%72.51493
  8. #8MetaMuse Spark78.0%—1489
  9. #9AnthropicClaude Opus 5.584.7%79.81489
  10. #10Moonshot AIKimi K388.7%78.71487
  11. #11AnthropicClaude Opus 4.877.7%66.01487
  12. #12OpenAIGPT-5.584.3%81.61485
  13. #13OpenAIGPT-5.6 Sol84.0%79.81485
  14. #14AnthropicClaude Opus 582.0%74.51484
  15. #15AnthropicClaude Fable 5.185.3%80.31484
  16. #16GoogleGemini 3.7 Flash83.0%68.01483
  17. #17OpenAIGPT-5.482.0%79.31482
  18. #17AnthropicClaude Sonnet 4.680.0%78.01482
  19. #19GoogleGemini 3.8 Flash84.0%54.01481
  20. #20DeepSeekDeepSeek V4.1 Flash84.0%79.31479
  21. #21GoogleGemini 3.1 Pro82.0%78.51477
  22. #22Z.aiGLM 5.379.7%70.21475
  23. #23OpenAIGPT-6.1 Sol84.0%82.21475
  24. #24OpenAIGPT-6 Astra80.7%83.01473
  25. #25GoogleGemini 3.6 Flash80.0%63.01472
  26. #26AnthropicClaude Opus 4.577.3%74.41472
  27. #27XiaomiMiMo V2.5 Pro79.7%—1471
  28. #28xAIGrok 4.2023.3%—1470
  29. #29GoogleGemini 3 Flash78.0%—1468
  30. #30StepfunStep-588.3%—1468
  31. #31OpenAIGPT-5.6 Terra83.0%79.31467
  32. #31Z.aiGLM 5.3 Flash80.0%76.41467
  33. #33xAIGrok 4.20 (Reasoning)69.0%—1466
  34. #34Z.aiGLM 5.278.3%73.71466
  35. #35xAIGrok 4.579.3%73.01465
  36. #36Z.aiGLM-5.173.7%—1465
  37. #37AnthropicClaude Sonnet 582.0%71.71465
  38. #38ByteDanceDola Seed 2.0 Pro——1464
  39. #39AnthropicClaude Sonnet 5.582.7%78.61464
  40. #40OpenAIGPT-5.6 Luna83.7%78.01463
  41. #41GoogleGemini 3.5 Flash74.3%64.91462
  42. #42XiaomiMiMo-V2.6-Pro86.3%—1461
  43. #43AnthropicClaude Sonnet 4.572.3%—1461
  44. #44DeepSeekDeepSeek V4 Pro80.3%74.51460
  45. #45OpenAIGPT-5.4 Mini77.0%70.81460
  46. #46XiaomiMiMo-V2.6-Flash74.3%—1459
  47. #47AlibabaQwen3.7 Max79.0%71.81458
  48. #48Moonshot AIKimi K2.681.0%65.11455
  49. #49XiaomiMiMo V2 Pro68.3%—1454
  50. #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
  51. #51AlibabaQwen3.6 Max80.7%—1451
  52. #52Z.aiGLM-575.7%—1451
  53. #53GoogleGemma 4 31B69.7%—1449
  54. #54MiniMaxMiniMax M383.0%76.21448
  55. #55AnthropicClaude Opus 4.176.0%—1447
  56. #56OpenAIGPT-6 Luna83.3%73.41447
  57. #56xAIGrok 4.681.0%73.91447
  58. #58AlibabaQwen3.5 397B A17B77.3%—1446
  59. #59OpenAIGPT-6 Sol83.7%81.21446
  60. #60AlibabaQwen3.6 Plus78.3%69.91446
  61. #61AlibabaQwen3.7 Plus73.0%—1445
  62. #62XiaomiMiMo V2.573.0%—1441
  63. #63BaiduERNIE 5.0 Thinking7.0%—1441
  64. #64Moonshot AIKimi K2.578.0%—1440
  65. #65Z.aiGLM 5V Turbo70.3%—1440
  66. #66xAIGrok 4.375.0%55.81439
  67. #67DeepSeekDeepSeek V4 Flash79.7%68.01439
  68. #68GoogleGemini 2.5 Pro69.0%—1437
  69. #69xAIGrok 4.780.0%76.91433
  70. #70MeituanLongcat Flash Chat28.3%—1433
  71. #71Mistral AIMistral Medium 3.569.3%—1430
  72. #72MiniMaxMiniMax M2.778.3%—1424
  73. #73DeepSeekDeepSeek V3.273.3%—1422
  74. #74GoogleGemini 3.1 Flash Lite74.3%—1420
  75. #75AnthropicClaude Haiku 4.574.3%—1420
  76. #76NVIDIANemotron 3 Ultra79.3%54.51418
  77. #77xAIGrok 4.1 Fast (Reasoning)74.0%—1417
  78. #78OpenAIGPT-578.2%—1413
  79. #79TencentHy379.0%—1412
  80. #80AnthropicClaude Opus 469.3%—1409
  81. #81OpenAIGPT-5.4 Nano76.7%67.61405
  82. #82MiniMaxMiniMax M2.573.3%—1400
  83. #83GoogleGemini 2.5 Flash65.3%—1399
  84. #84UpstageSolar Pro 474.0%—1388
  85. #85OpenAIGPT-5 Mini72.3%—1381
  86. #86AnthropicClaude Sonnet 470.3%—1381
  87. #87GoogleGemini 2.5 Flash Lite64.7%—1378
  88. #88Arcee AITrinity Large Thinking38.0%—1367
  89. #89OpenAIGPT OSS 120B52.0%—1352
  90. #90AmazonNova 2 Lite60.3%—1351
  91. #91NVIDIANemotron 3 Super65.7%—1350
  92. #92OpenAIGPT-5 Nano45.0%—1339
  93. #93MetaLlama 4 Maverick50.0%—1317
  94. #93NVIDIANemotron 3 Nano 30B A3B38.0%—1317
  95. #95MetaLlama 4 Scout27.7%—1316
  96. #96IBMGranite 4.1 8B13.3%—1293
  97. #97OpenAIGPT-4.168.3%—1279
モデルの半数が1454以下測定: ユーザー選好投票最終更新 2026-10-02

直近60日にリリースされたAI 37個のうち18個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか15個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。