AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

LLM, 손 수술 시험 평가

LLM, 손 수술 시험 평가

Semantic Scholar·2026년 8월 21일 (금)
  • •3개 LLM이 2010년부터 2025년까지 터키 손 수술 전문의 시험 220문항에 답했다
  • •ChatGPT-5.0, Gemini-Pro, DeepSeek-V3의 성공률은 73.6%에서 90.9% 범위였다
  • •3차례 별도 세션에서 개별 질문 방식이 집단 질문 방식보다 평균 점수가 높았다
  • •3개 LLM이 2010년부터 2025년까지 터키 손 수술 전문의 시험 220문항에 답했다
  • •ChatGPT-5.0, Gemini-Pro, DeepSeek-V3의 성공률은 73.6%에서 90.9% 범위였다
  • •3차례 별도 세션에서 개별 질문 방식이 집단 질문 방식보다 평균 점수가 높았다
  • •3개 LLM이 2010년부터 2025년까지 터키 손 수술 전문의 시험 220문항에 답했다
  • •ChatGPT-5.0, Gemini-Pro, DeepSeek-V3의 성공률은 73.6%에서 90.9% 범위였다
  • •3차례 별도 세션에서 개별 질문 방식이 집단 질문 방식보다 평균 점수가 높았다
  • •3개 LLM이 2010년부터 2025년까지 터키 손 수술 전문의 시험 220문항에 답했다
  • •ChatGPT-5.0, Gemini-Pro, DeepSeek-V3의 성공률은 73.6%에서 90.9% 범위였다
  • •3차례 별도 세션에서 개별 질문 방식이 집단 질문 방식보다 평균 점수가 높았다

아흐메트 아자르(Ahmet Acar), A. 기르긴(A. Girgin), 세마 지한(Sema Cihan)은 2026년 Acta Medica Alanya에 실린 연구에서 터키 정형외과·외상학 전문의 시험의 손 수술 문항으로 3개 대규모 언어 모델을 평가했다. 연구진은 2010년부터 2025년까지 시행된 국가 전문의 시험에서 손 수술 관련 객관식 220문항을 사용해 ChatGPT-5.0, Gemini-Pro, DeepSeek-V3가 공식 시험 문항에 얼마나 정확히 답하는지 측정했다.

연구팀은 3차례 별도 세션에서 문항을 집단 질문 방식과 개별 질문 방식으로 제시한 뒤, 모델 응답을 공식 정답과 비교했다. 3개 LLM은 모든 연도에서 만족할 만한 결과를 보였으며, 성공률은 73.6%에서 90.9% 범위였다. 특히 개별로 제시된 문항은 집단으로 제시된 문항보다 평균 점수가 높았다.

연도별 분석에서는 16년 기간 동안 모든 모델이 시험 합격 기준을 충족하거나 넘어선 것으로 나타났다. 연구는 현재 LLM이 손 수술 전문의 시험 문항에서 높은 사실 지식을 보이지만, 정규 의학 교육이나 임상 판단을 대체할 수는 없으며 정형외과 교육과 시험 준비를 지원하는 데 쓰일 수 있다고 결론 내렸다.

아흐메트 아자르(Ahmet Acar), A. 기르긴(A. Girgin), 세마 지한(Sema Cihan)은 2026년 Acta Medica Alanya에 실린 연구에서 터키 정형외과·외상학 전문의 시험의 손 수술 문항으로 3개 대규모 언어 모델을 평가했다. 연구진은 2010년부터 2025년까지 시행된 국가 전문의 시험에서 손 수술 관련 객관식 220문항을 사용해 ChatGPT-5.0, Gemini-Pro, DeepSeek-V3가 공식 시험 문항에 얼마나 정확히 답하는지 측정했다.

연구팀은 3차례 별도 세션에서 문항을 집단 질문 방식과 개별 질문 방식으로 제시한 뒤, 모델 응답을 공식 정답과 비교했다. 3개 LLM은 모든 연도에서 만족할 만한 결과를 보였으며, 성공률은 73.6%에서 90.9% 범위였다. 특히 개별로 제시된 문항은 집단으로 제시된 문항보다 평균 점수가 높았다.

연도별 분석에서는 16년 기간 동안 모든 모델이 시험 합격 기준을 충족하거나 넘어선 것으로 나타났다. 연구는 현재 LLM이 손 수술 전문의 시험 문항에서 높은 사실 지식을 보이지만, 정규 의학 교육이나 임상 판단을 대체할 수는 없으며 정형외과 교육과 시험 준비를 지원하는 데 쓰일 수 있다고 결론 내렸다.

원문 보기 (영어)·2026년 8월 16일
의료#large language model#chatgpt 5#gemini pro#deepseek v3#hand surgery#orthopedic education#board exam