Arena Medicine & Healthcare

かんたんに言うと · 医学・保健分野の専門家レベルの質問で人々がより好んだAI

何を測定しますか?
医学・保健分野の専門家レベルの質問で、どのAIの答えが好まれたかです。例:症例の解釈、治療ガイドラインの比較、医学論文の要約。一般的な質問ではなく、その仕事を実際にしている人が投げかけそうな質問です。
誰がどのように評価しますか?
Arena Intelligence でユーザーが質問を入力すると、名前を隠した2つのAIが答え、より良い方に投票します。累計8,200万票以上の投票を統計モデル(Bradley-Terry)で集計して Elo 風の点数に換算し、この表は長く華やかに整えた回答を好む偏りを統計的に取り除いた「スタイル補正版」を公式データセットから取得します。 質問の推論の深さと専門性をAI分類器が判定し、全体の約5.5%だけを「専門家の質問」としてタグ付けし、さらに米国労働統計局の職業分類(SOC)に基づく職種に分けます(2025年11月新設)。 この表はそのうち「医学・保健」に分類された質問だけを集計します。
スコアの読み方
試験の点数(正答率%)ではなく対戦成績です。他のAIと対戦して選ばれた確率から計算するため満点がなく、新しいAIが入ると既存のAIの点数も少し動きます。通常1,000〜1,500の範囲で、2つのAIの点差が100点なら上位側が約64%、200点なら約76%の確率で選ばれるという意味です。正解かどうかは数えないため、間違った答えでも説明が親切なら勝てます。正確さが重要な用途なら正答率試験(GPQA・AIME など)も併せて見るのがよいでしょう。点差が数十点以内なら順位が違っても実質同じ等級と見るのが安全です。 この職種は質問数が少なく上位の順位が頻繁に変わるため、順位より点数帯を見るのが安全です。

最終更新: 2026-10-02

順位

最高スコア1547Gemini 4 Argon
測定したモデル96件
最終更新2026.10.02
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Google2026.09.30
    1547
  2. 2
    Anthropic2026.09.22
    1539
  3. 3
    Anthropic2026.09.01
    1523
  4. 4
    Anthropic2026.02.04
    1514
  5. 5
    Anthropic2026.04.16
    1513
  6. 6
    Moonshot AI2026.07.17
    1512
  7. 7
    Meta2026.08.05
    1511
  8. 8
    Google2026.09.03
    1510
  9. 9
    Anthropic2026.07.24
    1506
  10. 10
    Anthropic2026.06.09
    1506

直近60日にリリースされたAI 37個のうち19個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか16個

出典: Arena Intelligence データの出典・掲載停止のご依頼

このスコアを読むときに知っておくこと

  • 好みの投票なので正解かどうかは測りません。間違っていても説明が親切なら勝てます。
  • どんな質問が出されたかは投票した人によって変わります。自分の用途と違う質問かもしれません。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。