HealthBench Hard
인용 많음높을수록 좋음
HealthBench에서 가장 어려운 대화 1,000개만 모은 부분 시험입니다. 여기 값은 답변 길이를 보정한 점수로 통일했습니다. 점수는 0~100%입니다. 높을수록 좋습니다.
이 순위는 모델 제조사가 스스로 발표한 점수만으로 만들었습니다. 도구 사용 여부·추론 강도 같은 측정 조건이 제조사마다 달라, 모델끼리 직접 비교할 때는 각 점수의 조건을 함께 보세요.
최고 점수42.8%Muse Spark
측정한 모델9개
최근 갱신2026.09.22
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
순위모델실행 조건출시일가격/1M점수
- 1Thinking2026.04.08—42.8%
- 2length-adjusted2026.09.04$4036.6%
- 3length-adjusted2026.07.09$1633.1%
- 4length-adjusted2026.07.09$9.5032.7%
- 5length-adjusted2026.07.09$0.9532.0%
- 6length-adjusted2026.04.23$2431.5%
- 7length-adjusted2026.09.22$0.4031.4%
- 8length-adjusted2026.09.22$830.1%
- 9length-adjusted2026.03.05$1229.1%
"작업 도구"는 AI가 과제를 풀 때 함께 쓴 실행 환경(에이전트 프로그램)입니다. 같은 모델이라도 작업 도구와 추론 강도에 따라 점수가 크게 달라질 수 있습니다.
제조사 발표값은 측정 조건이 제각각이라 참고용입니다.