FDA規制科学でLLMを検証
- •Gemini 2.5 Proは、3つのLLMでFDA規制情報抽出の精度66.7%を記録し首位だった
- •一般プロンプトは詳細プロンプトを上回り、324件の回答で精度59.3%対44.4%だった
- •ハルシネーションが最も多いエラー類型となり、研究者は人間による補完的レビューを支持した
Khulud Bukhari、Rosa Rodriguez-Monguio、B. Lopez-Bermudezら共著者は、2026年にDiscover Artificial Intelligenceで、米国FDAの規制科学タスクにおけるChatGPT-4o、Gemini 2.5 Pro、DeepSeek R1を評価した研究を発表した。研究チームは、生成AIの大規模言語モデルが、2010年から2025年までに複雑性尿路感染症(cUTIs)向けに承認された抗菌薬について、FDAの医薬品審査、業界向けガイダンス、医薬品ラベルから情報を抽出、分析、統合できるかを検証した。
研究では標準的なユーザーインターフェースを使い、短く直接的とされた一般プロンプトと、構造化されガイダンスを参照する詳細プロンプトを比較した。モデルは5つの領域で判定された。適合率と再現率で測る精度、説明の質、ハルシネーション率・誤分類・欠落を含むエラー類型、応答時間・1秒あたりの正答数・1正答あたりの秒数を含む運用効率、重複実行での一貫性である。
2人の調査担当者が、FDAガイダンスに照らして出力を独立に確認し、不一致は合意によって解消した。統計解析にはχ2検定、Wilcoxon検定、Kruskal-Wallis検定が用いられ、false discovery rate補正を適用した。薬剤と質問によるクラスタリングには、混合効果ロジスティック回帰(群ごとの観測を統計的に扱う手法)が使われた。
324件の回答では、モデル間の精度差が有意だった(χ2、p < 0.001)。Gemini 2.5 Proの精度が66.7%で最も高く、ChatGPT-4oが51.9%、DeepSeek R1が37.0%で続いた。一般プロンプトは詳細プロンプトより精度が高く、59.3%対44.4%、p = 0.011だった。
説明の質はGemini 2.5 Proが最も高く、Gemini 2.5 ProとChatGPT-4oは同程度の一貫性を示した。DeepSeek R1は一貫性が低く、大半の領域で劣った。ハルシネーションは最も頻度の高いエラー類型であり、著者らは規制審査における証拠抽出と統合で、人間のレビューを伴う補完的な利用を支持した。