Arena Entertainment, Sports & Media

かんたんに言うと · エンタメ・スポーツ・メディア分野の専門家レベルの質問で人々がより好んだAI

何を測定しますか?
エンタメ・スポーツ・メディア分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:脚本構成、コンテンツ企画、スポーツ分析。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「エンタメ・スポーツ・メディア」に分類された質問だけを集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。

最終更新: 2026-10-02

順位

最高スコア1522Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 4 Argon1522
  2. 🥈AnthropicClaude Opus 5.51501
  3. 🥉AnthropicClaude Fable 51495
  4. #4GoogleGemini 3.7 Flash1480
  5. #5AnthropicClaude Opus 4.61478
  6. #6AnthropicClaude Fable 5.11475
  7. #7AnthropicClaude Opus 4.71473
  8. #8GoogleGemini 3.8 Flash1471
  9. #9OpenAIGPT-5.6 Sol1471
  10. #10GoogleGemini 3.1 Pro1469
  11. #11MetaMuse Spark1462
  12. #12OpenAIGPT-6.1 Sol1462
  13. #13GoogleGemini 3.6 Flash1461
  14. #14AnthropicClaude Opus 51461
  15. #15MetaMuse Spark 1.21460
  16. #16Moonshot AIKimi K31460
  17. #17OpenAIGPT-6 Astra1458
  18. #18GoogleGemini 3.5 Flash1457
  19. #19MetaMuse Spark 1.31456
  20. #20AnthropicClaude Opus 4.51455
  21. #21AnthropicClaude Opus 4.81454
  22. #22GoogleGemini 3 Flash1453
  23. #23DeepSeekDeepSeek V4.1 Flash1453
  24. #24MetaMuse Spark 1.11450
  25. #25xAIGrok 4.201449
  26. #26OpenAIGPT-5.51447
  27. #26XiaomiMiMo-V2.6-Pro1447
  28. #28Z.aiGLM 5.31447
  29. #29Z.aiGLM 5.21446
  30. #30AnthropicClaude Sonnet 4.61446
  31. #31xAIGrok 4.51445
  32. #32xAIGrok 4.20 (Reasoning)1445
  33. #33AnthropicClaude Sonnet 4.51444
  34. #34AlibabaQwen3.7 Max1443
  35. #35xAIGrok 4.61443
  36. #36Z.aiGLM-5.11442
  37. #37OpenAIGPT-6 Sol1442
  38. #38OpenAIGPT-5.41441
  39. #39AnthropicClaude Sonnet 5.51441
  40. #40Z.aiGLM-51439
  41. #41Z.aiGLM 5.3 Flash1439
  42. #42XiaomiMiMo V2.5 Pro1438
  43. #43AnthropicClaude Opus 4.11435
  44. #44DeepSeekDeepSeek V4 Pro1435
  45. #45GoogleGemini 3.5 Flash-Lite1433
  46. #46AnthropicClaude Sonnet 51433
  47. #47OpenAIGPT-5.6 Terra1432
  48. #48GoogleGemini 2.5 Pro1431
  49. #49Moonshot AIKimi K2.61429
  50. #50AlibabaQwen3.6 Max1427
  51. #51XiaomiMiMo V2 Pro1426
  52. #52OpenAIGPT-6 Luna1422
  53. #53AnthropicClaude Opus 41422
  54. #54Moonshot AIKimi K2.51421
  55. #55StepfunStep-51420
  56. #56AlibabaQwen3.7 Plus1419
  57. #57OpenAIGPT-5.6 Luna1418
  58. #58GoogleGemma 4 31B1417
  59. #59xAIGrok 4.71416
  60. #60xAIGrok 4.31416
  61. #61ByteDanceDola Seed 2.0 Pro1414
  62. #62BaiduERNIE 5.0 Thinking1412
  63. #63OpenAIGPT-5.4 Mini1409
  64. #64AlibabaQwen3.6 Plus1407
  65. #65XiaomiMiMo-V2.6-Flash1407
  66. #66MiniMaxMiniMax M31407
  67. #67DeepSeekDeepSeek V4 Flash1405
  68. #68GoogleGemini 3.1 Flash Lite1404
  69. #69XiaomiMiMo V2.51403
  70. #70xAIGrok 4.1 Fast (Reasoning)1402
  71. #71AlibabaQwen3.5 397B A17B1402
  72. #72OpenAIGPT-51398
  73. #73Z.aiGLM 5V Turbo1398
  74. #74MeituanLongcat Flash Chat1397
  75. #75Mistral AIMistral Medium 3.51396
  76. #76DeepSeekDeepSeek V3.21396
  77. #77AnthropicClaude Sonnet 41389
  78. #78AnthropicClaude Haiku 4.51389
  79. #79GoogleGemini 2.5 Flash1386
  80. #80NVIDIANemotron 3 Ultra1378
  81. #81MiniMaxMiniMax M2.71372
  82. #82TencentHy31364
  83. #83MiniMaxMiniMax M2.51362
  84. #84OpenAIGPT-5.4 Nano1352
  85. #85OpenAIGPT-5 Mini1348
  86. #86GoogleGemini 2.5 Flash Lite1346
  87. #87UpstageSolar Pro 41326
  88. #88Arcee AITrinity Large Thinking1324
  89. #89NVIDIANemotron 3 Super1316
  90. #90MetaLlama 4 Maverick1296
  91. #91OpenAIGPT-4.11291
  92. #92MetaLlama 4 Scout1289
  93. #93OpenAIGPT OSS 120B1286
  94. #94AmazonNova 2 Lite1283
  95. #95OpenAIGPT-5 Nano1277
  96. #96NVIDIANemotron 3 Nano 30B A3B1257
  97. #97IBMGranite 4.1 8B1256
モデルの半数が1429以下測定: ユーザー選好投票最終更新 2026-10-02

直近60日にリリースされたAI 37個のうち18個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか15個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。