AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

FDA規制科学でLLMを検証

FDA規制科学でLLMを検証

Semantic Scholar·2026年8月12日 (水)
  • •Gemini 2.5 Proは、3つのLLMでFDA規制情報抽出の精度66.7%を記録し首位だった
  • •一般プロンプトは詳細プロンプトを上回り、324件の回答で精度59.3%対44.4%だった
  • •ハルシネーションが最も多いエラー類型となり、研究者は人間による補完的レビューを支持した
  • •Gemini 2.5 Proは、3つのLLMでFDA規制情報抽出の精度66.7%を記録し首位だった
  • •一般プロンプトは詳細プロンプトを上回り、324件の回答で精度59.3%対44.4%だった
  • •ハルシネーションが最も多いエラー類型となり、研究者は人間による補完的レビューを支持した
  • •Gemini 2.5 Proは、3つのLLMでFDA規制情報抽出の精度66.7%を記録し首位だった
  • •一般プロンプトは詳細プロンプトを上回り、324件の回答で精度59.3%対44.4%だった
  • •ハルシネーションが最も多いエラー類型となり、研究者は人間による補完的レビューを支持した
  • •Gemini 2.5 Proは、3つのLLMでFDA規制情報抽出の精度66.7%を記録し首位だった
  • •一般プロンプトは詳細プロンプトを上回り、324件の回答で精度59.3%対44.4%だった
  • •ハルシネーションが最も多いエラー類型となり、研究者は人間による補完的レビューを支持した

Khulud Bukhari、Rosa Rodriguez-Monguio、B. Lopez-Bermudezら共著者は、2026年にDiscover Artificial Intelligenceで、米国FDAの規制科学タスクにおけるChatGPT-4o、Gemini 2.5 Pro、DeepSeek R1を評価した研究を発表した。研究チームは、生成AIの大規模言語モデルが、2010年から2025年までに複雑性尿路感染症(cUTIs)向けに承認された抗菌薬について、FDAの医薬品審査、業界向けガイダンス、医薬品ラベルから情報を抽出、分析、統合できるかを検証した。

研究では標準的なユーザーインターフェースを使い、短く直接的とされた一般プロンプトと、構造化されガイダンスを参照する詳細プロンプトを比較した。モデルは5つの領域で判定された。適合率と再現率で測る精度、説明の質、ハルシネーション率・誤分類・欠落を含むエラー類型、応答時間・1秒あたりの正答数・1正答あたりの秒数を含む運用効率、重複実行での一貫性である。

2人の調査担当者が、FDAガイダンスに照らして出力を独立に確認し、不一致は合意によって解消した。統計解析にはχ2検定、Wilcoxon検定、Kruskal-Wallis検定が用いられ、false discovery rate補正を適用した。薬剤と質問によるクラスタリングには、混合効果ロジスティック回帰(群ごとの観測を統計的に扱う手法)が使われた。

324件の回答では、モデル間の精度差が有意だった(χ2、p < 0.001)。Gemini 2.5 Proの精度が66.7%で最も高く、ChatGPT-4oが51.9%、DeepSeek R1が37.0%で続いた。一般プロンプトは詳細プロンプトより精度が高く、59.3%対44.4%、p = 0.011だった。

説明の質はGemini 2.5 Proが最も高く、Gemini 2.5 ProとChatGPT-4oは同程度の一貫性を示した。DeepSeek R1は一貫性が低く、大半の領域で劣った。ハルシネーションは最も頻度の高いエラー類型であり、著者らは規制審査における証拠抽出と統合で、人間のレビューを伴う補完的な利用を支持した。

Khulud Bukhari、Rosa Rodriguez-Monguio、B. Lopez-Bermudezら共著者は、2026年にDiscover Artificial Intelligenceで、米国FDAの規制科学タスクにおけるChatGPT-4o、Gemini 2.5 Pro、DeepSeek R1を評価した研究を発表した。研究チームは、生成AIの大規模言語モデルが、2010年から2025年までに複雑性尿路感染症(cUTIs)向けに承認された抗菌薬について、FDAの医薬品審査、業界向けガイダンス、医薬品ラベルから情報を抽出、分析、統合できるかを検証した。

研究では標準的なユーザーインターフェースを使い、短く直接的とされた一般プロンプトと、構造化されガイダンスを参照する詳細プロンプトを比較した。モデルは5つの領域で判定された。適合率と再現率で測る精度、説明の質、ハルシネーション率・誤分類・欠落を含むエラー類型、応答時間・1秒あたりの正答数・1正答あたりの秒数を含む運用効率、重複実行での一貫性である。

2人の調査担当者が、FDAガイダンスに照らして出力を独立に確認し、不一致は合意によって解消した。統計解析にはχ2検定、Wilcoxon検定、Kruskal-Wallis検定が用いられ、false discovery rate補正を適用した。薬剤と質問によるクラスタリングには、混合効果ロジスティック回帰(群ごとの観測を統計的に扱う手法)が使われた。

324件の回答では、モデル間の精度差が有意だった(χ2、p < 0.001)。Gemini 2.5 Proの精度が66.7%で最も高く、ChatGPT-4oが51.9%、DeepSeek R1が37.0%で続いた。一般プロンプトは詳細プロンプトより精度が高く、59.3%対44.4%、p = 0.011だった。

説明の質はGemini 2.5 Proが最も高く、Gemini 2.5 ProとChatGPT-4oは同程度の一貫性を示した。DeepSeek R1は一貫性が低く、大半の領域で劣った。ハルシネーションは最も頻度の高いエラー類型であり、著者らは規制審査における証拠抽出と統合で、人間のレビューを伴う補完的な利用を支持した。

原文(英語)を読む·2026年8月8日
#llm#fda#regulatory science#gemini 2 5 pro#chatgpt 4o#deepseek r1#hallucination#prompting#drug reviews#clinical trials