GPT-4.1, 외과 포스터 예측 시험
- •GPT-4.1은 260개 포스터에서 AAST 초록의 논문 게재 여부를 58.5% 정확도로 예측했다
- •Violence, Societal, and Behavioral 분야 정확도는 74.2%였지만 다른 분야에서는 우연 수준으로 떨어졌다
- •142개 초록, 즉 54.6%가 평균 13.4개월 뒤 논문으로 게재됐다
소하일 칸(Sohail Khan), 개빈 맥아피(Gavin McAfee), 알렉스 키오도 오르티스(Alex Chiodo Ortiz)와 공동 저자들은 2026년 9월 14일 The American Surgeon에 GPT-4.1이 포스터 내용만으로 2021-2022 American Association for the Surgery of Trauma Annual Meetings 외과 초록의 후속 논문 게재 여부를 예측할 수 있는지 시험했다고 보고했다. 이 후향 연구는 260개 초록을 분석했으며, 서지 검색으로 논문 게재 여부를 확인하고 GPT-4.1에 포스터 이미지를 입력해 6개 영역 평가표를 30회 반복 평균으로 점수화했다.
GPT-4.1은 전체적으로 논문 게재를 58.5% 정확도로 예측했으며, P = .009였다. 연구 분야별 성능은 달랐다. Violence, Societal, and Behavioral에서는 정확도가 74.2%, Hemorrhage, Resuscitation, and Vascular Control에서는 62.2%에 도달했지만, Critical Care and Outcomes와 Systems, Technology, and Process Optimization에서는 우연 수준으로 떨어졌다.
연구진은 142개 초록, 즉 54.6%가 평균 13.4개월 뒤 논문으로 게재됐다고 밝혔다. 다변량 로지스틱 회귀(여러 예측 요인을 함께 검정하는 방법)에서는 다기관 기원만 독립 예측 요인으로 확인됐으며, P = .02였다.
저자들은 공개 데이터를 활용해 연구자의 성별, 인종, 민족성도 조사했다. 히스패닉 연구자는 제1저자에서 P = .03, 책임저자에서 P = .01로 과소대표됐으며, 게재된 Hemorrhage, Resuscitation, and Vascular Control 하위 집단에서는 나타나지 않았다. 논의는 논문 게재가 포스터에 드러난 내용뿐 아니라 모델이 읽을 수 없는 구조적 이점, 즉 다기관 기반, 멘토십, 책임저자의 유창성에도 달려 있다고 결론냈다.