GPT-4.1, 심장학 보고서 구조화
- •GPT-4.1이 병원 환경에서 환자 하위분류와 임상시험 모집을 위해 심장학 퇴원기록을 구조화했다
- •100건의 퇴원기록 검증에서 대부분 임상 변수의 추출 정확도는 0.94 ± 0.08이었다
- •대부분의 검토된 적격성 기준에서 위음성과 위양성은 3% 미만으로 유지됐다
F. 페스콜(F. Pescol), T. 부오노코레(T. Buonocore), V. 티볼로(V. Tibollo)와 공동저자들은 2026 International Journal of Medical Informatics에서 GPT-4.1이 실제 병원 환경에서 심장학 퇴원기록을 구조화하는 데 시험됐다고 보고했다. 목적은 환자 하위분류와 임상시험 모집이었으며, 연구진은 심장학 퇴원기록을 풍부하지만 충분히 활용되지 않는 환자 데이터 원천으로 보고 대형언어모델로 구조화된 임상 정보를 추출했다.
연구팀은 먼저 병원 인프라 안에 배포된 Microsoft Azure Machine Learning Studio를 통해 OpenAI의 GPT-4.1을 사용해 퇴원기록에서 상세 정보를 추출하는 파이프라인을 구축했다. 이후 특정 임상시험에 대한 환자 하위분류와 적격성 평가는 rule-based approach(고정 규칙으로 해석 가능한 출력을 내는 방식)로 수행했으며, 이는 결정적이고 해석 가능한 결과를 최대화하기 위한 선택이었다.
검증에는 100건의 퇴원기록이 사용됐고, 모델 출력은 전문 임상의가 미리 채운 정답 템플릿과 exact match 방식으로 비교됐다. GPT-4.1은 대부분의 임상 변수에서 정보 추출 정확도 0.94 ± 0.08을 기록했다. 환자 하위분류에서 위음성과 위양성은 각각 0.12와 0.13으로 제한적이었고, 적격성 평가에서도 오류가 제한적이었다.
기준별로 보면 위음성과 위양성은 대부분 기준에서 3% 미만으로 유지됐다. 위음성 검토 대상 14개 기준 중 13개, 위양성 검토 대상 14개 기준 중 11개가 이 범위에 들었다. 저자들은 의료 현장이 엄격한 요구조건을 부과하는 상황에서도 이 접근법이 AI 기반 환자 모집을 일상 임상 진료에 통합하는 데 실용적이고 효과적이라고 결론냈다.