AI 시대, 동료 평가의 부담
- •Scopus와 Web of Science 등재 논문이 매년 5.6 percent 늘며 동료 평가 부담이 커졌다
- •2019년 이후 주요 AI 학회 제출 논문은 2배에서 10배까지 증가했다
- •Frontiers 설문에서 동료 평가자 절반 이상이 평가 과정 어딘가에 AI를 이미 쓴다고 답했다
디모인대학교 보건경제학자 제이슨 셈프리니(Jason Semprini)는 초등학교 HPV 백신 의무화에 관한 논문을 냈다가, 연구의 핵심을 오해한 단 1명의 동료 평가자 때문에 게재를 거절당했다. 셈프리니는 HPV 백신이 자궁경부암을 예방하는지 자체가 아니라, 의무화 정책이 인구 집단 전체의 자궁경부암 발생률을 낮추는지를 분석했다. 그러나 해당 논문은 통상적인 2명 또는 3명이 아니라 1명의 평가만 받았고, 그 오해만으로 출판이 막혔다.
연구자와 편집자들은 Ars Technica에 논문 발행량이 늘고 평가자들이 무급 업무에 쓸 시간이 줄면서 동료 평가가 압박을 받고 있다고 말했다. Scopus와 Web of Science에 등재된 논문은 최근 매년 5.6 percent씩 지수적으로 증가했으며, 한 추산에 따르면 전 세계 연구자들은 매년 동료 평가에 15,000년어치 노동을 쓴다. 미국 몫을 유급으로 환산하면 $1.5 billion에 이른다. Human Immunology 편집자인 스티븐 맥(Steven Mack)은 약 five years ago에는 5 to 10통의 이메일로 3명의 평가자를 찾을 수 있었지만, 최근에는 1명을 찾기 위해 around thirty명의 연구자에게 이메일을 보냈다고 말했다.
과학사학자들에 따르면 동료 평가는 약 50 years ago에야 보편적 규범이 됐다. early 1800s 과학 학회들은 다양한 방식으로 투고 원고를 검토했지만, 출판은 오늘날처럼 학계 경력과 밀접하게 묶여 있지 않았다. 1970s에는 제2차 세계대전 이후 연방 과학 예산이 25-fold 늘고 미국 경제가 인플레이션, 실업, 가스 위기를 겪자, National Science Foundation이 독립적인 외부 심사를 근거로 공공 연구비 지원을 방어했다.
현재 학술지 편집자들은 대학 교수들에게 본업과 병행해 원고 평가를 요청하고 있으며, 투고 증가, 학술지 증가, 온라인 전용 출판, 특집호 확대가 수요를 더 키웠다. Whitehead Institute의 세바스찬 로우리도(Sebastian Lourido)는 매달 약 10건의 원고 평가 요청을 받지만 현실적으로 처리할 수 있는 것은 1건 또는 2건뿐이라고 추산했다. 맥은 University of California, San Francisco의 면역유전학자로서 편집 업무와 별개로 하루나 이틀에 한 번꼴로 평가 요청을 받는다고 말했다.
AI는 논문 작성과 영어 학술지 투고를 쉽게 만들며 부담을 더하고 있고, 페이퍼 밀은 조작됐지만 그럴듯해 보이는 출판물의 저자 자리를 판매한다. 특히 AI 연구 분야는 압박을 강하게 느끼고 있다. 2019년 이후 주요 AI 학회 논문 제출은 2배에서 10배까지 늘었다. University of California, Santa Barbara의 정혜원(Haewon Jeong)은 평가자들이 때때로 투고작을 판단하거나 유용한 피드백을 제공할 만큼 충분한 분야 지식을 갖추지 못한다고 말했다.
일부 AI 연구자들은 분야 변화가 빠르고 많은 작업이 학계 밖에서 이뤄진다는 이유로 연구 소통을 블로그로 옮기고 있다. Flatiron Institute의 헬렌 취(Helen Qu)는 앞으로 연구를 자신의 블로그에만 공개할 계획이라고 말했다. AI Alignment Forum은 전통적 동료 평가 대신 추천, 비추천, 댓글을 사용한다. 포럼을 운영하는 Lightcone Infrastructure의 올리버 하브리카(Oliver Habryka)는 이 형식이 더 빠르고 반론을 드러낼 수 있다고 말했지만, 투표가 깊은 숙고를 반영하지 않을 수도 있다고 인정했다.
동료 평가 내부에서도 AI 사용이 늘고 있다는 보고가 나왔다. Frontiers 설문은 동료 평가자 절반 이상이 이미 어떤 방식으로든 AI를 사용한다고 밝혔다. 언어학자 마레인 판 퓌턴(Marijn van Putten)은 평가 의견이 추천한 중세 아랍어 매뉴얼을 이틀 동안 찾다가 인용이 환각일 수 있다고 의심했다. New Mexico Tech의 크리스 초글루엑(Chris ChoGlueck)은 미공개 원고를 챗봇에 업로드하면 기밀성이 침해될 수 있다고 경고했다. NeurIPS는 올해 평가자가 논문을 이해하고 배경 조사를 하는 데 도움을 주되, 평가문을 대신 작성하지는 않는 맞춤형 AI 도구를 시범 운영할 예정이다.