AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

치과 근관치료 문항 생성에서의 AI 모델 평가

치과 근관치료 문항 생성에서의 AI 모델 평가

Semantic Scholar·2026년 7월 12일 (일)
  • •근관치료 다지선다형 문제 생성을 위해 ChatGPT-4, Copilot, Gemini의 성능을 비교 연구했다.
  • •ChatGPT-4가 120개 문항에서 가장 높은 평가를 받은 반면, Gemini는 최저 점수를 기록했다.
  • •세 모델 모두 근관치료 평가를 위한 고품질의 매력적인 오답지(distractor) 생성에는 실패했다.
  • •근관치료 다지선다형 문제 생성을 위해 ChatGPT-4, Copilot, Gemini의 성능을 비교 연구했다.
  • •ChatGPT-4가 120개 문항에서 가장 높은 평가를 받은 반면, Gemini는 최저 점수를 기록했다.
  • •세 모델 모두 근관치료 평가를 위한 고품질의 매력적인 오답지(distractor) 생성에는 실패했다.

2026년 7월 5일 호주 근관치료 학술지(Australian Endodontic Journal)에 게재된 연구에 따르면, ChatGPT-4, Copilot, Gemini 등 3개 LLM의 근관치료 다지선다형 문항 생성 능력이 평가되었다. 연구진은 유럽근관치료학회(European Society of Endodontology)의 입장문 2건을 참고 자료로 활용했으며, 각 모델이 동일한 프롬프트 기반으로 40개씩, 총 120개의 문항을 생성하도록 했다.

문항들은 오답지의 품질, 신뢰도, 내용 타당성을 기준으로 가중 카파(Weighted Kappa) 및 크러스컬-월리스 검정(Kruskal-Wallis test) 등 통계적 기법을 통해 평가되었다. 평가자 간 일치도는 0.870에서 1.000에 달했다. ChatGPT-4가 가장 높은 점수를 얻은 반면, Gemini는 지속적으로 가장 낮은 점수를 기록했다. 특히 ChatGPT-4와 Gemini, 그리고 Copilot과 Gemini 간에는 유의미한 성능 차이가 관찰되었다(p < 0.05). 그럼에도 불구하고 연구진은 모든 모델이 고품질 오답지를 만드는 데 어려움을 겪었다고 밝혔다. 이번 연구는 AI 도구가 평가 개발에 도움을 줄 수 있지만, 교육적 품질 유지를 위해 인간 전문가의 검토가 필수적이라는 점을 시사한다.

2026년 7월 5일 호주 근관치료 학술지(Australian Endodontic Journal)에 게재된 연구에 따르면, ChatGPT-4, Copilot, Gemini 등 3개 LLM의 근관치료 다지선다형 문항 생성 능력이 평가되었다. 연구진은 유럽근관치료학회(European Society of Endodontology)의 입장문 2건을 참고 자료로 활용했으며, 각 모델이 동일한 프롬프트 기반으로 40개씩, 총 120개의 문항을 생성하도록 했다.

문항들은 오답지의 품질, 신뢰도, 내용 타당성을 기준으로 가중 카파(Weighted Kappa) 및 크러스컬-월리스 검정(Kruskal-Wallis test) 등 통계적 기법을 통해 평가되었다. 평가자 간 일치도는 0.870에서 1.000에 달했다. ChatGPT-4가 가장 높은 점수를 얻은 반면, Gemini는 지속적으로 가장 낮은 점수를 기록했다. 특히 ChatGPT-4와 Gemini, 그리고 Copilot과 Gemini 간에는 유의미한 성능 차이가 관찰되었다(p < 0.05). 그럼에도 불구하고 연구진은 모든 모델이 고품질 오답지를 만드는 데 어려움을 겪었다고 밝혔다. 이번 연구는 AI 도구가 평가 개발에 도움을 줄 수 있지만, 교육적 품질 유지를 위해 인간 전문가의 검토가 필수적이라는 점을 시사한다.

원문 보기 (영어)·2026년 7월 5일
의료#endodontics#llm#assessment#chatgpt 4#copilot#gemini#education