Arena Life, Physical & Social Science

かんたんに言うと · 生命・物理・社会科学分野の専門家レベルの質問で人々がより好んだAI

何を測定しますか?
生命・物理・社会科学分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:実験設計の検討、統計の解釈、論文要約。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「生命・物理・社会科学」に分類された質問だけを集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。

最終更新: 2026-10-02

順位

最高スコア1542Gemini 4 Argon
測定したモデル97件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇GoogleGemini 4 Argon1542
  2. 🥈AnthropicClaude Fable 51527
  3. 🥉Moonshot AIKimi K31523
  4. #4AnthropicClaude Fable 5.11522
  5. #5AnthropicClaude Opus 5.51521
  6. #6AnthropicClaude Opus 4.61518
  7. #7MetaMuse Spark 1.31518
  8. #8GoogleGemini 3.8 Flash1517
  9. #9AnthropicClaude Opus 4.71514
  10. #10MetaMuse Spark 1.21513
  11. #11GoogleGemini 3.7 Flash1513
  12. #12AnthropicClaude Opus 51512
  13. #13GoogleGemini 3.1 Pro1510
  14. #14MetaMuse Spark 1.11505
  15. #15Z.aiGLM 5.31505
  16. #16OpenAIGPT-6.1 Sol1503
  17. #17AnthropicClaude Sonnet 4.61500
  18. #18AnthropicClaude Opus 4.81500
  19. #19Z.aiGLM 5.21499
  20. #20OpenAIGPT-5.51497
  21. #21GoogleGemini 3.5 Flash1496
  22. #22MetaMuse Spark1496
  23. #23XiaomiMiMo-V2.6-Pro1496
  24. #24GoogleGemini 3.6 Flash1495
  25. #25OpenAIGPT-6 Astra1493
  26. #26Z.aiGLM 5.3 Flash1492
  27. #27XiaomiMiMo V2.5 Pro1491
  28. #28AnthropicClaude Sonnet 51490
  29. #29OpenAIGPT-5.6 Sol1489
  30. #30DeepSeekDeepSeek V4.1 Flash1489
  31. #31xAIGrok 4.20 (Reasoning)1489
  32. #32AnthropicClaude Sonnet 5.51488
  33. #32OpenAIGPT-5.41488
  34. #34AnthropicClaude Opus 4.51488
  35. #35Z.aiGLM-5.11488
  36. #36GoogleGemini 3 Flash1486
  37. #37xAIGrok 4.51485
  38. #38AlibabaQwen3.7 Max1484
  39. #39AlibabaQwen3.6 Max1483
  40. #40DeepSeekDeepSeek V4 Pro1481
  41. #41Z.aiGLM-51480
  42. #42GoogleGemini 3.5 Flash-Lite1479
  43. #42XiaomiMiMo V2 Pro1479
  44. #44xAIGrok 4.201479
  45. #45Moonshot AIKimi K2.61478
  46. #46OpenAIGPT-5.6 Terra1477
  47. #47GoogleGemma 4 31B1476
  48. #48OpenAIGPT-6 Sol1473
  49. #49AnthropicClaude Sonnet 4.51472
  50. #50GoogleGemini 2.5 Pro1472
  51. #51ByteDanceDola Seed 2.0 Pro1472
  52. #52AlibabaQwen3.7 Plus1471
  53. #53xAIGrok 4.61471
  54. #54AnthropicClaude Opus 4.11471
  55. #55XiaomiMiMo-V2.6-Flash1471
  56. #56Moonshot AIKimi K2.51470
  57. #57StepfunStep-51469
  58. #58OpenAIGPT-5.4 Mini1465
  59. #59AlibabaQwen3.5 397B A17B1465
  60. #60MiniMaxMiniMax M31464
  61. #61OpenAIGPT-5.6 Luna1462
  62. #62BaiduERNIE 5.0 Thinking1458
  63. #63xAIGrok 4.31457
  64. #64DeepSeekDeepSeek V4 Flash1457
  65. #65MeituanLongcat Flash Chat1455
  66. #66xAIGrok 4.71455
  67. #67XiaomiMiMo V2.51453
  68. #68AlibabaQwen3.6 Plus1453
  69. #69DeepSeekDeepSeek V3.21451
  70. #70GoogleGemini 3.1 Flash Lite1450
  71. #71Z.aiGLM 5V Turbo1447
  72. #71xAIGrok 4.1 Fast (Reasoning)1447
  73. #73NVIDIANemotron 3 Ultra1446
  74. #74OpenAIGPT-51444
  75. #75OpenAIGPT-6 Luna1441
  76. #76AnthropicClaude Opus 41437
  77. #77Mistral AIMistral Medium 3.51436
  78. #78MiniMaxMiniMax M2.71432
  79. #79TencentHy31431
  80. #80GoogleGemini 2.5 Flash1430
  81. #81AnthropicClaude Haiku 4.51430
  82. #82AnthropicClaude Sonnet 41416
  83. #83OpenAIGPT-5.4 Nano1415
  84. #84MiniMaxMiniMax M2.51410
  85. #85UpstageSolar Pro 41404
  86. #86GoogleGemini 2.5 Flash Lite1402
  87. #87OpenAIGPT-5 Mini1398
  88. #88Arcee AITrinity Large Thinking1391
  89. #89NVIDIANemotron 3 Super1368
  90. #90OpenAIGPT OSS 120B1361
  91. #91AmazonNova 2 Lite1357
  92. #92OpenAIGPT-5 Nano1348
  93. #93MetaLlama 4 Maverick1342
  94. #94MetaLlama 4 Scout1334
  95. #95IBMGranite 4.1 8B1326
  96. #96OpenAIGPT-4.11319
  97. #97NVIDIANemotron 3 Nano 30B A3B1314
モデルの半数が1472以下測定: ユーザー選好投票最終更新 2026-10-02

直近60日にリリースされたAI 37個のうち18個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか15個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。