AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

HPV患者質問でLLMを検証

HPV患者質問でLLMを検証

Semantic Scholar·2026年8月5日 (水)
  • •ChatGPT-5.5 InstantとDeepSeek-V3が、高リスクHPV患者の15質問に回答した専門家評価研究
  • •5人の婦人科専門家が90件のAI生成回答を盲検評価し、450件の専門家評価記録を作成
  • •重大な誤りまたは潜在的危害がない回答はChatGPTが42/45、DeepSeek-V3が38/45
  • •ChatGPT-5.5 InstantとDeepSeek-V3が、高リスクHPV患者の15質問に回答した専門家評価研究
  • •5人の婦人科専門家が90件のAI生成回答を盲検評価し、450件の専門家評価記録を作成
  • •重大な誤りまたは潜在的危害がない回答はChatGPTが42/45、DeepSeek-V3が38/45
  • •ChatGPT-5.5 InstantとDeepSeek-V3が、高リスクHPV患者の15質問に回答した専門家評価研究
  • •5人の婦人科専門家が90件のAI生成回答を盲検評価し、450件の専門家評価記録を作成
  • •重大な誤りまたは潜在的危害がない回答はChatGPTが42/45、DeepSeek-V3が38/45
  • •ChatGPT-5.5 InstantとDeepSeek-V3が、高リスクHPV患者の15質問に回答した専門家評価研究
  • •5人の婦人科専門家が90件のAI生成回答を盲検評価し、450件の専門家評価記録を作成
  • •重大な誤りまたは潜在的危害がない回答はChatGPTが42/45、DeepSeek-V3が38/45

2026-07-31にFrontiers in Public Healthで発表された単一施設研究が、高リスクヒトパピローマウイルス感染の診断後に患者が尋ねる質問への回答について、ChatGPT-5.5 InstantとDeepSeek-V3を比較した。Zhen Hao、Lin Wang、Yue Wuら共著者は、大規模言語モデルが、がんリスク、コルポスコピー、フォローアップ、治療、パートナー管理、妊娠、不安などの懸念に対し、正確で安全、ガイドラインに沿い、完全で理解しやすいデジタル患者教育を提供できるかを検証した。

研究者は、一般的な外来相談に基づく患者風の15質問をChatGPT-5.5 InstantとDeepSeek-V3に入力した。各モデルは質問ごとに3件の独立した回答を作成し、AI生成回答は計90件となった。5人の盲検化された婦人科専門家が全回答を独立に評価し、1-5のリッカート尺度(同意度などを段階評価する尺度)で450件の専門家評価記録を作成したうえで、重大な誤りと潜在的危害も判定した。主要評価項目は、重大な誤りまたは潜在的危害がない回答の割合だった。

ChatGPT-5.5 Instantは正確性でDeepSeek-V3を上回り、平均差は0.25、95% CIは0.11-0.39、FDR-adjusted p = 0.010だった。安全性でも0.27、0.07-0.47、p = 0.010、完全性では0.22、0.07-0.37、p = 0.020、複合スコアでは0.18、0.04-0.31、p = 0.027と高かった。ガイドライン一致度は多重性補正後に有意性を維持せず、0.16、-0.01 to 0.33、FDR-adjusted p = 0.057だった。理解しやすさは同程度だった。

重大な誤りまたは潜在的危害がない回答は、ChatGPTでは42/45、すなわち93.3%、95% CI 81.7-98.6%だった。DeepSeek-V3では38/45、すなわち84.4%、70.5-93.5%だった。リスク差は8.9 percentage points、95% CI -13.3 to 31.1、p = 0.344で、二値安全性の差は不正確で統計的に有意ではなかった。探索的な質問別リスクは、HPV16/18陽性、細胞診正常、パートナー管理、妊娠の場面で見られた。著者らは、両モデルは全体として強い性能を示したが、なおガイドラインに基づく臨床監督が必要だと結論づけた。

2026-07-31にFrontiers in Public Healthで発表された単一施設研究が、高リスクヒトパピローマウイルス感染の診断後に患者が尋ねる質問への回答について、ChatGPT-5.5 InstantとDeepSeek-V3を比較した。Zhen Hao、Lin Wang、Yue Wuら共著者は、大規模言語モデルが、がんリスク、コルポスコピー、フォローアップ、治療、パートナー管理、妊娠、不安などの懸念に対し、正確で安全、ガイドラインに沿い、完全で理解しやすいデジタル患者教育を提供できるかを検証した。

研究者は、一般的な外来相談に基づく患者風の15質問をChatGPT-5.5 InstantとDeepSeek-V3に入力した。各モデルは質問ごとに3件の独立した回答を作成し、AI生成回答は計90件となった。5人の盲検化された婦人科専門家が全回答を独立に評価し、1-5のリッカート尺度(同意度などを段階評価する尺度)で450件の専門家評価記録を作成したうえで、重大な誤りと潜在的危害も判定した。主要評価項目は、重大な誤りまたは潜在的危害がない回答の割合だった。

ChatGPT-5.5 Instantは正確性でDeepSeek-V3を上回り、平均差は0.25、95% CIは0.11-0.39、FDR-adjusted p = 0.010だった。安全性でも0.27、0.07-0.47、p = 0.010、完全性では0.22、0.07-0.37、p = 0.020、複合スコアでは0.18、0.04-0.31、p = 0.027と高かった。ガイドライン一致度は多重性補正後に有意性を維持せず、0.16、-0.01 to 0.33、FDR-adjusted p = 0.057だった。理解しやすさは同程度だった。

重大な誤りまたは潜在的危害がない回答は、ChatGPTでは42/45、すなわち93.3%、95% CI 81.7-98.6%だった。DeepSeek-V3では38/45、すなわち84.4%、70.5-93.5%だった。リスク差は8.9 percentage points、95% CI -13.3 to 31.1、p = 0.344で、二値安全性の差は不正確で統計的に有意ではなかった。探索的な質問別リスクは、HPV16/18陽性、細胞診正常、パートナー管理、妊娠の場面で見られた。著者らは、両モデルは全体として強い性能を示したが、なおガイドラインに基づく臨床監督が必要だと結論づけた。

原文(英語)を読む·2026年7月31日
医療#chatgpt 5 5 instant#deepseek v3#hpv#patient education#gynecology#likert scale#fdr adjusted p#medical consultation