HealthBench Professional

引用多め高いほど良い

OpenAIが作った医療専門家向けの試験で、臨床業務に近い課題525件への回答を採点基準で評価します。ここでの値は回答の長さを補正したスコアに統一しています。スコアは0〜100%です。高いほど良い結果です。

他のバージョン:HealthBenchHealthBench Hard

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア65.6%Claude Opus 5.5
測定したモデル21件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.09.22 · length-adjusted · no tools · max (adaptive thinking)
    65.6%
  2. 2
    OpenAI2026.09.04 · length-adjusted
    64.7%
  3. 3
    Anthropic2026.06.09 · length-adjusted · no tools
    63.3%
  4. 4
    Anthropic2026.09.01 · length-adjusted · no tools · max (adaptive thinking)
    62.1%
  5. 5
    OpenAI2026.09.22 · length-adjusted
    60.8%
  6. 5
    OpenAI2026.09.22 · length-adjusted
    60.8%
  7. 7
    OpenAI2026.07.09 · length-adjusted
    60.5%
  8. 8
    Anthropic2026.07.24 · length-adjusted · no tools · max (adaptive thinking)
    59.8%
  9. 9
    Meta2026.07.09 · length-adjusted · xhigh
    59.3%
  10. 10
    Anthropic2026.06.30 · length-adjusted · no tools · max (adaptive thinking)
    57.8%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。