HealthBench Hard

引用多め高いほど良い

HealthBenchのうち最も難しい会話1,000件だけを集めた部分試験です。ここでの値は回答の長さを補正したスコアに統一しています。スコアは0〜100%です。高いほど良い結果です。

このランキングは、モデルの開発元が自ら発表したスコアだけで作っています。ツール使用の有無や推論強度などの測定条件が開発元ごとに異なるため、モデル同士を直接比べるときは各スコアの条件もあわせて確認してください。

最高スコア42.8%Muse Spark
測定したモデル9件
最終更新2026.09.22
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Meta2026.04.08 · Thinking
    42.8%
  2. 2
    OpenAI2026.09.04 · length-adjusted
    36.6%
  3. 3
    OpenAI2026.07.09 · length-adjusted
    33.1%
  4. 4
    OpenAI2026.07.09 · length-adjusted
    32.7%
  5. 5
    OpenAI2026.07.09 · length-adjusted
    32.0%
  6. 6
    OpenAI2026.04.23 · length-adjusted
    31.5%
  7. 7
    OpenAI2026.09.22 · length-adjusted
    31.4%
  8. 8
    OpenAI2026.09.22 · length-adjusted
    30.1%
  9. 9
    OpenAI2026.03.05 · length-adjusted
    29.1%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。

メーカー発表値は測定条件がまちまちなので参考値です。