LLMの麻酔科ASA分類スコアリング精度を評価
Semantic Scholar
2026年7月23日 (木)
- •研究は5つのLLMと熟練麻酔科医によるASA身体状態分類スコアリングを比較した。
- •Copilotは15年の経験を持つ麻酔科医との間で最高の一致度(Kappa値 = 0.82)を示した。
- •100の模擬症例において、DeepSeekとGeminiは他モデルに比べ有意に低い一致度となった。
ムハンマド・エミン・ゾラ(Muhammed Emin Zora)は、術前のリスク評価における米国麻酔科学会(ASA)の身体状態分類スコアの割り当てにおいて、LLMがどの程度信頼できるかを評価した。この研究では、ASAクラスIからVにわたる100の模擬症例を用い、ChatGPT、Copilot、Grok、DeepSeek、Geminiの5つのAIモデルを、15年の臨床経験を持つ麻酔科医による評価と比較した。
結果、モデル間で有意な性能差(p < 0.001)が認められた。Copilotが最高の一致度(Cohen’s Kappa = 0.82)を達成し、ChatGPTおよびGrokがそれに続いた。一方、DeepSeekとGeminiは比較的低い性能を示した。評価の不一致は主にASA II–IIIやASA III–IVといった隣接するカテゴリー間で発生した。本研究は、これらのモデルが管理された環境下では有望な結果を示しているものの、臨床現場での導入には実データを用いたさらなる多施設共同検証が必要であると結論付けている。