HealthBench

引用多め高いほど良い

OpenAIが作った医療会話の試験で、患者や医療者との複数回のやり取り5,000件への回答を、医師が作った採点基準で評価します。ここでの値は回答の長さを補正したスコアに統一しています。スコアは0〜100%です。高いほど良い結果です。

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア60.6%Claude Opus 5.5
測定したモデル12件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Anthropic2026.09.22 · length-adjusted · no tools · max (adaptive thinking)
    60.6%
  2. 2
    Anthropic2026.09.01 · length-adjusted · no tools · max (adaptive thinking)
    60.0%
  3. 3
    Anthropic2026.05.27 · length-adjusted · no tools · max (adaptive thinking)
    59.3%
  4. 4
    OpenAI2026.09.04 · length-adjusted
    58.3%
  5. 5
    Anthropic2026.07.24 · length-adjusted · no tools · max (adaptive thinking)
    57.8%
  6. 6
    OpenAI2026.07.09 · length-adjusted
    57.0%
  7. 6
    OpenAI2026.07.09 · length-adjusted
    57.0%
  8. 8
    OpenAI2026.04.23 · length-adjusted
    56.5%
  9. 9
    OpenAI2026.07.09 · length-adjusted
    55.8%
  10. 10
    OpenAI2026.09.22 · length-adjusted
    54.5%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。