LLM의 마취 위험도 평가(ASA) 일치도 연구
Semantic Scholar
2026년 7월 23일 (목)
- •5개 LLM과 숙련된 마취과 전문의의 ASA 신체 상태 점수 판정을 비교함
- •Copilot이 15년 차 전문의와 가장 높은 일치도(Kappa = 0.82)를 기록함
- •DeepSeek와 Gemini는 100개 시뮬레이션 사례에서 상대적으로 낮은 일치도를 보임
무함메드 에민 조라(Muhammed Emin Zora)는 수술 전 위험도 평가를 위한 미국마취과학회(ASA) 신체 상태 점수 판정에서 LLM의 신뢰성을 평가했다. 본 연구는 100개의 시뮬레이션 환자 사례(ASA I–V 등급)를 활용해 ChatGPT, Copilot, Grok, DeepSeek, Gemini 등 5개 모델의 평가 결과를 15년 경력의 마취과 전문의와 비교했다.
연구 결과, 모델 간 유의미한 성능 차이(p < 0.001)가 확인됐다. Copilot이 Cohen’s Kappa 지수 0.82로 가장 높은 일치도를 보였으며, ChatGPT와 Grok이 그 뒤를 이었다. 반면 DeepSeek와 Gemini는 다소 낮은 일치도를 나타냈다. 의견 차이는 주로 ASA II–III 또는 III–IV와 같은 인접 등급 간에 발생했다. 연구진은 LLM이 통제된 환경에서는 가능성을 보였으나, 실제 임상 현장에 도입하기 위해서는 실제 의료 데이터를 사용한 다기관 검증이 추가로 필요하다고 밝혔다.