AI ICD-10 코딩 검토 공개
- •체계적 문헌고찰이 24개 연구를 바탕으로 임상 서술문 기반 AI ICD-10 코딩을 평가했다
- •연구진은 7개 학술 데이터베이스에서 257개 기록을 선별하고 296개 실험 평가를 집계했다
- •Hybrid DL은 전체 코드 성능이 안정적이었지만, LLM 기반 방법은 아직 초기 단계였다
K. 탕구돔킷(K. Tangudomkit), 사와라윗 차이라트(Sawrawit Chairat), 싯티촉 차이출리(Sitthichok Chaichulee)는 2026년 Frontiers in Digital Health에 임상 서술문에서 ICD-10 코드를 자동 부여하는 AI 시스템에 관한 체계적 문헌고찰을 발표했다. ICD-10 코딩은 임상 관리, 진료비 상환, 보건 데이터 분석을 지원하지만, 코드 체계가 계층적이고 사용 가능한 코드가 많아 수작업 코딩은 시간, 비용, 일관성 측면에서 제약을 받는다.
연구진은 자동 ICD-10 코딩 시스템의 알고리즘, 데이터셋, 평가 방법, 실제 구현 준비도를 살폈다. 선정 대상은 2020년 1월 1일부터 2025년 12월 31일까지 영어로 발표된 원저 연구논문, 프리프린트, 학회논문이며, Scopus, PubMed, Web of Science, IEEE Xplore, ACM Digital Library, arXiv, Google Scholar 등 7개 데이터베이스에서 검색됐다. 포함된 연구는 임상 텍스트에 머신러닝, 딥러닝, Transformer 기반 또는 LLM 접근법을 적용했다. 문헌고찰은 PRISMA 2020 지침을 따랐고 Open Science Framework의 https://osf.io/cegqk 에 사전 등록됐다.
저자들은 257개 기록을 확인해 24개 연구를 선정했으며, 296개 실험 평가를 집계했다. 연구 품질은 7개 연구가 높음, 8개 연구가 보통, 9개 연구가 기술적 또는 방법론적 우려로 제한적이라고 평가됐다. Hybrid DL은 가장 흔한 주요 접근법이었고, 머신러닝과 규칙 기반 방법은 주로 기준선으로 쓰였다. F1-macro는 두 지표가 모두 보고된 경우 F1-micro보다 일관되게 낮았다. Hybrid DL은 전체 코드 또는 모든 코드 평가에서 가장 안정적인 성능을 보였고, 성능은 라벨당 문서 수 비율에 따라 달라졌다.
근거는 Hybrid DL과 Transformer 기반 접근법에서 기술적 진전이 있었음을 보여줬다. 다만 LLM 기반 방법은 구조화된 다중 레이블 코딩에서 아직 초기 단계였고 효과도 덜 일관적이었다. 저자들은 향후 연구가 희귀 라벨 불균형, 재현성, 설명가능성, 다양한 임상 환경에서의 검증을 우선해야 한다고 밝혔다.