AI 무지외반증 조언 신뢰도 시험
- •3개 모델이 4개 임상 영역에서 환자 중심 무지외반증 질문 20개에 답했다
- •Gemini-2.5-Flash는 원인과 임상 양상 질문에서 특히 신뢰도가 다소 높았다
- •DeepSeek-V3는 훨씬 읽기 쉬운 답변을 냈지만 전체 품질 점수 차이는 유의하지 않았다
A. 콜루만(A. Koluman), 에브루 알로울루 치프치(Ebru Aloğlu Çiftçi), 메흐메트 우트쿠 치프치(Mehmet Utku Çiftçi) 등 연구진은 2026년 BMC Medical Informatics and Decision Making 연구에서 ChatGPT-4o, Gemini-2.5-Flash, DeepSeek-V3가 무지외반증에 대해 신뢰할 수 있고 유용하며 읽기 쉬운 환자 교육 정보를 만들 수 있는지 평가했다. 무지외반증은 흔히 버니언으로 불리는 발 변형이다. 연구진은 환자들이 소비자용 AI 기반 환자 교육 도구를 점점 더 많이 쓰고 있지만, 대규모 언어모델 기반 대화형 에이전트가 제공하는 무지외반증 정보에 관한 근거는 제한적이라고 밝혔다.
횡단면 비교 연구는 3개 모델에 무지외반증 관련 환자 중심 질문 20개를 제시했다. 질문은 AI 보조 질문 생성과 공개 Google Trends 검색 패턴을 활용해 만들었고, 이후 4개 임상 영역으로 묶었다. 정형외과 의사 3명은 익명 처리된 모델 답변을 독립적으로 검토하며 7점 리커트 기반 신뢰도·유용성 척도와 Global Quality Scale로 평가했고, 가독성은 6개 표준 지표로 측정했다.
Gemini-2.5-Flash는 전반적 신뢰도에서 다소 높은 결과를 보였으며, 특히 원인과 임상 양상 질문에서 두드러졌다. DeepSeek-V3는 장기 결과와 삶의 질 영역에서 더 높은 유용성 점수를 받았고, Flesch Reading Ease 점수가 높고 학년 수준 지표가 낮아 훨씬 읽기 쉬운 답변을 생성했다. 반면 Gemini-2.5-Flash는 언어적으로 더 복잡한 답변을 내 이해에 더 높은 교육 수준을 요구했다.
ChatGPT-4o, Gemini-2.5-Flash, DeepSeek-V3 사이에서 전반적 유용성과 전체 품질 점수는 유의한 차이를 보이지 않았다. 평가자들은 일부 답변에서 지나치게 단순화됐거나 잠재적으로 오해를 부를 수 있는 정보를 발견했으며, 여러 가독성 지표가 권장 환자 건강 문해력 기준을 넘었다. 연구진은 모델별로 사실 정확성과 언어 접근성이 달랐기 때문에 AI 대화형 에이전트는 임상의가 주도하는 환자 교육을 대체하는 것이 아니라 보조해야 한다고 결론 내렸다.