HealthBench Professional
引用多め高いほど良い
OpenAIが作った医療専門家向けの試験で、臨床業務に近い課題525件への回答を採点基準で評価します。ここでの値は回答の長さを補正したスコアに統一しています。スコアは0〜100%です。高いほど良い結果です。
このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。
最高スコア65.6%Claude Opus 5.5
測定したモデル21件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1length-adjusted · no tools · max (adaptive thinking)2026.09.22$1665.6%
- 2length-adjusted2026.09.04$4064.7%
- 3length-adjusted · no tools2026.06.09$4063.3%
- 4length-adjusted · no tools · max (adaptive thinking)2026.09.01$4062.1%
- 5length-adjusted2026.09.22$0.4060.8%
- 5length-adjusted2026.09.22$860.8%
- 7length-adjusted2026.07.09$1660.5%
- 8length-adjusted · no tools · max (adaptive thinking)2026.07.24$2059.8%
- 9length-adjusted · xhigh2026.07.09$3.5059.3%
- 10length-adjusted · no tools · max (adaptive thinking)2026.06.30$857.8%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。
メーカー発表値は測定条件がまちまちなので参考値です。