OpenAI, 의사들을 ChatGPT 건강 조언 검토에 투입
- •매주 3억 명 넘게 건강 조언을 구하는 ChatGPT 답변을 수백 명의 의사가 검토
- •49개 언어를 구사하는 의사들이 7월 기준 답변 70만 건 이상 검토해 연구팀에 개선 지점 전달
- •OpenAI는 진단·치료 목적이 아니라고 밝히면서 건강 기능을 확대하고 결과 근거 수집
OpenAI는 매주 3억 명 넘게 건강 관련 조언을 구하는 ChatGPT 답변을 평가하도록 전 세계에서 진료 중인 의사 수백 명을 영입했습니다. 49개 언어를 구사하는 의사들은 사용자나 의사가 ChatGPT와 나눌 법한 대화를 검토해 혼란을 주는 답변과 신체적 위험을 초래할 수 있는 조언을 찾아냅니다. 2024년 OpenAI에 합류한 레베카 소스킨 힉스(Rebecca Soskin Hicks)가 의사들과 회사 사이에서 이 업무를 이끌며 건강 제품 개선을 지원합니다.
의사들은 케냐, 네팔, 브라질 등을 포함한 여러 나라에서 시간제 계약직으로 일합니다. 7월 기준으로 ChatGPT 답변 70만 건 이상을 검토했지만, 평가 자료를 AI 학습에 직접 제공하지는 않습니다. 대신 평가를 통해 성능의 공백을 찾으면 OpenAI 연구팀이 응급 상황을 분류하고, 빠진 정보를 묻고, 불확실성을 알리며, 적절한 수준으로 설명하도록 돕는 데이터와 학습 방법을 모색합니다. 소스킨 힉스는 팀이 모호하고 복잡하며 정보가 불완전한 상황을 시험한다고 말했습니다.
OpenAI는 ChatGPT가 진단이나 치료를 위한 서비스가 아니라고 밝히지만, 챗봇은 질병이나 부상 평가를 돕겠다고 제안할 수 있습니다. 회사의 건강 제품 책임자인 애슐리 알렉산더(Ashley Alexander)는 의료 결정에서 챗봇을 유일한 판단 근거로 삼는 상황은 문제를 지나치게 단순화한다고 말했습니다. 7월에는 한 목사가 GPT-4o가 폐 건강 위기와 관련된 증상을 오진하고 가볍게 취급했다며 OpenAI를 상대로 소송을 제기했고, 의료 관련 제품의 중단을 요구했습니다. OpenAI는 챗봇, 의료 조언, 제품 책임을 둘러싼 법적 기준이 아직 검증되지 않은 상황에서도 관련 업무를 이어왔습니다.
ChatGPT는 Apple Health 및 일부 의료 기록과 연결할 수 있습니다. OpenAI는 모델의 정신 건강 답변을 평가하는 벤치마크도 공개했으며, 카란 싱할(Karan Singhal)은 GPT-6 Astra가 건강 벤치마크에서 최첨단 성능을 보였다고 설명했습니다. 소스킨 힉스는 의사들의 피드백과 벤치마크 결과가 근거를 쌓는 초기 단계라며, 향후 연구를 통해 챗봇의 건강 조언이 개인과 집단의 건강 결과를 개선하는지 확인하기를 바란다고 말했습니다.