膝関節症回答でチャットボット比較
- •PLoS ONE研究が、膝関節症の患者質問への回答でPerplexity、ChatGPT-5、Geminiを比較した
- •ChatGPT-5は最も読みやすい回答を生成し、FRES:45、FKGL:9.24、SMOG:8.37だった
- •Perplexityは品質と信頼性で首位となり、DISCERN: 4、JAMA: 2、EQIP: 92.8を記録した
エルデム・マラシュル(Erdem Maraşlı)、E. オズドゥラン(E. Ozduran)、ヴォルカン・ハンジュ(Volkan Hancı)は、膝関節症に関する質問への回答を対象に、Perplexity、ChatGPT-5、Geminiを比較した2026年のPLoS ONE研究を発表した。膝関節症は世界の変形性関節症負担のおよそ5分の4を占め、研究者らは人気AIチャットボットが患者向け情報として読みやすく、正確で、信頼できる内容を生成するかを検証した。
研究では、Google Trendsで最も頻繁に使われた英語の膝関節症キーワード25語から、反復的、無関係、同義の語を除外し、8キーワードを選んだ。検索頻度が最も高かった語句は「osteoarthritis of knee」「knee pain」「osteoarthritis knee pain」だった。研究者らはこれらの語句を質問として3つのAIベースのチャットボットに入力し、Coleman-Liau Index、Automated Readability Index、Linsear Writeなどの指標で読みやすさを測定した。
3つのチャットボットシステムはいずれもGrade 6の基準を上回る文章を生成し、読みやすさの差は統計的に有意だった(p < 0.05)。ChatGPT-5は最も読みやすい内容を出し、FRES:45、GFOG:11.9、FKGL:9.24、CLI:14.03、SMOG:8.37、ARI:11.37、LW:7.2だった。
Perplexityは品質と信頼性の全評価でChatGPT-5を有意に上回り、中央値はDISCERN: 4、JAMA: 2、GQS: 4、EQIP: 92.8だった。PerplexityはmDISCERNの信頼性評価でもGeminiを上回った(p = 0.001)。一方、GeminiとChatGPT-5の信頼性・品質調査では統計的に有意な差はなかった。
著者らは、人気AIチャットボットによる膝関節症の回答は患者にとってなお理解しにくいと結論づけ、医療情報における科学的妥当性と完全性への懸念を示した。研究は、今後のAIベースのツールには、十分な品質、堅牢性、適切な理解しやすさを確保する有効な監督メカニズムが必要だとした。