HealthBench

인용 많음높을수록 좋음

OpenAI가 만든 의료 대화 시험으로, 환자·의료인과의 여러 차례 대화 5,000개에 대한 답변을 의사들이 쓴 채점 기준으로 평가합니다. 여기 값은 답변 길이를 보정한 점수로 통일했습니다. 점수는 0~100%입니다. 높을수록 좋습니다.

이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.

최고 점수60.6%Claude Opus 5.5
측정한 모델12개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 1
    Anthropic2026.09.22 · length-adjusted · no tools · max (adaptive thinking)
    60.6%
  2. 2
    Anthropic2026.09.01 · length-adjusted · no tools · max (adaptive thinking)
    60.0%
  3. 3
    Anthropic2026.05.27 · length-adjusted · no tools · max (adaptive thinking)
    59.3%
  4. 4
    OpenAI2026.09.04 · length-adjusted
    58.3%
  5. 5
    Anthropic2026.07.24 · length-adjusted · no tools · max (adaptive thinking)
    57.8%
  6. 6
    OpenAI2026.07.09 · length-adjusted
    57.0%
  7. 6
    OpenAI2026.07.09 · length-adjusted
    57.0%
  8. 8
    OpenAI2026.04.23 · length-adjusted
    56.5%
  9. 9
    OpenAI2026.07.09 · length-adjusted
    55.8%
  10. 10
    OpenAI2026.09.22 · length-adjusted
    54.5%

"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.

제조사 발표값은 측정 조건이 제각각이라 참고용입니다.