무릎 골관절염 답변, 챗봇별 차이
- •PLoS ONE 연구진은 무릎 골관절염 환자 질문에 대한 Perplexity, ChatGPT-5, Gemini 답변을 비교했다
- •ChatGPT-5는 FRES:45, FKGL:9.24, SMOG:8.37 등으로 가장 읽기 쉬운 답변을 냈다
- •Perplexity는 DISCERN: 4, JAMA: 2, EQIP: 92.8로 품질·신뢰성 평가에서 앞섰다
에르뎀 마라슐르(Erdem Maraşlı), E. 오즈두란(E. Ozduran), 볼칸 한즈(Volkan Hancı)는 무릎 골관절염 질문에 대한 Perplexity, ChatGPT-5, Gemini 답변을 비교한 2026년 PLoS ONE 연구를 발표했다. 무릎 골관절염은 전 세계 골관절염 부담의 약 5분의 4를 차지하며, 연구진은 인기 AI 챗봇이 환자에게 읽기 쉽고 정확하며 신뢰할 수 있는 정보를 제공하는지 평가했다.
연구진은 반복되거나 관련 없거나 동의어인 용어를 제외한 뒤, Google Trends에서 영어 무릎 골관절염 키워드 상위 25개 가운데 8개를 골랐다. 가장 많이 검색된 용어는 “osteoarthritis of knee,” “knee pain,” “osteoarthritis knee pain”였으며, 연구진은 이 용어들을 질문 형태로 3개 AI 기반 챗봇에 입력했다. 또한 Coleman-Liau Index, Automated Readability Index, Linsear Write 등 여러 공식으로 가독성을 측정했다.
3개 챗봇 시스템은 모두 Grade 6 기준을 넘는 텍스트를 생성했으며, 가독성 차이는 통계적으로 유의했다(p < 0.05). 특히 ChatGPT-5가 가장 읽기 쉬운 콘텐츠를 만들었고, 점수는 FRES:45, GFOG:11.9, FKGL:9.24, CLI:14.03, SMOG:8.37, ARI:11.37, LW:7.2였다.
Perplexity는 모든 품질·신뢰성 평가에서 ChatGPT-5보다 유의미하게 높은 점수를 받았고, 중앙값은 DISCERN: 4, JAMA: 2, GQS: 4, EQIP: 92.8이었다. 또한 Perplexity는 mDISCERN 신뢰성 평가에서 Gemini보다 높은 성과를 보였으며(p = 0.001), Gemini와 ChatGPT-5 사이의 신뢰성·품질 설문에서는 통계적으로 유의한 차이가 나타나지 않았다.
저자들은 인기 AI 챗봇의 무릎 골관절염 답변이 여전히 환자가 이해하기 어렵다고 결론 내렸다. 의료 정보의 과학적 타당성과 무결성에 대한 우려도 제기했으며, 향후 AI 기반 도구에는 충분한 품질, 견고성, 적절한 이해 가능성을 보장할 효과적인 감독 장치가 필요하다고 밝혔다.