AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Prompt Guard 2、閾値設定で攻撃を見逃す

Prompt Guard 2、閾値設定で攻撃を見逃す

DEV.to·2026年10月1日 (木)
  • •標準の0.5閾値ではAgentDojoの埋め込み攻撃629件中6件のみ検出
  • •閾値を0.003に下げると621件を検出、誤警報は最大2%
  • •既知の攻撃を実運用の防御機能に通し、遮断を確認するよう提言
  • •標準の0.5閾値ではAgentDojoの埋め込み攻撃629件中6件のみ検出
  • •閾値を0.003に下げると621件を検出、誤警報は最大2%
  • •既知の攻撃を実運用の防御機能に通し、遮断を確認するよう提言
  • •標準の0.5閾値ではAgentDojoの埋め込み攻撃629件中6件のみ検出
  • •閾値を0.003に下げると621件を検出、誤警報は最大2%
  • •既知の攻撃を実運用の防御機能に通し、遮断を確認するよう提言
  • •標準の0.5閾値ではAgentDojoの埋め込み攻撃629件中6件のみ検出
  • •閾値を0.003に下げると621件を検出、誤警報は最大2%
  • •既知の攻撃を実運用の防御機能に通し、遮断を確認するよう提言

Rudratosh Shastri氏は、オープンソースのプロンプトインジェクション検出器10種を、AgentDojoの実際の攻撃629件で評価しました。各攻撃を請求書、メール、ウェブページなど通常のツール出力に埋め込み、正常な通信を誤って検出しないか確かめるため、無害なツール出力97件も加えました。検出器が稼働し、正常性チェックに合格していても、判定閾値が高すぎれば攻撃を遮断できないという問題が明らかになりました。

MetaのPrompt Guard 2は、標準の判定閾値0.5では攻撃629件のうち6件、約1%しか検出しませんでした。攻撃の平均スコアは約0.009、無害な文章では0.0008で、攻撃を約10倍高く評価していましたが、どちらも閾値に届かず、すべてのリクエストが許可されました。Shastri氏によると、0.5はMetaが誤設定として固定した値ではなく、確率分類器を二択で判定するとき一般に使われる初期値です。この値は埋め込まれた攻撃のスコアのおよそ50倍高い一方、検出器は有効なスコアを返し、正常性チェックにも合格していました。

Shastri氏が閾値を0.003に下げ、検出器の調整に使っていないAgentDojoの領域で調整したところ、Prompt Guard 2は攻撃629件のうち621件、99%を検出し、通常の通信を誤って検出する割合は最大2%でした。モデル、重み、リクエストは変えず、閾値だけを変更しました。ただし、攻撃には共通のテンプレートが使われていたため、調整後の閾値がプロンプトインジェクション全般ではなく、そのテンプレートを捉えた可能性があると注意を促しています。この結果が示すのは今回のテストでの調整不良であり、Prompt Guard 2がプロンプトインジェクションを解決したということではありません。各チームの実際の通信データを使って調整するよう勧めています。

Shastri氏は、システムが動作しているかを確かめる稼働確認と、攻撃を遮断できるかを調べる有効性確認を区別しています。攻撃と無害な入力のスコア差、閾値ごとの性能を別々に測り、ベンダーの初期設定を自社データで検証し、検出した攻撃の割合と誤警報率を併記するよう提言しました。評価した検出器のうち2種は攻撃を100%検出した一方、正当な呼び出しの98%まで遮断しており、攻撃検出率だけでは性能を判断できない例となりました。

さらに、既知の攻撃を稼働中の防御機能に送り、実際に遮断されるか確認すること、モデルの重みだけでなく設定もテストすること、モデルや設定の変更後に確認を繰り返すことを勧めています。検出器10種、攻撃629件、閾値の幅広い検証、異なる領域での調整を含むベンチマークは、公開された再現可能なプロジェクトとして利用できます。Shastri氏は、同様の見えにくい失敗が、記録専用モードのまま運用されるウェブアプリケーションファイアウォールの規則、ミュートされた通知先へのアラート、旧式のAPI経路に残る多要素認証の欠落、テストが省略されても合格するテストスイートでも起こり得ると述べています。

Rudratosh Shastri氏は、オープンソースのプロンプトインジェクション検出器10種を、AgentDojoの実際の攻撃629件で評価しました。各攻撃を請求書、メール、ウェブページなど通常のツール出力に埋め込み、正常な通信を誤って検出しないか確かめるため、無害なツール出力97件も加えました。検出器が稼働し、正常性チェックに合格していても、判定閾値が高すぎれば攻撃を遮断できないという問題が明らかになりました。

MetaのPrompt Guard 2は、標準の判定閾値0.5では攻撃629件のうち6件、約1%しか検出しませんでした。攻撃の平均スコアは約0.009、無害な文章では0.0008で、攻撃を約10倍高く評価していましたが、どちらも閾値に届かず、すべてのリクエストが許可されました。Shastri氏によると、0.5はMetaが誤設定として固定した値ではなく、確率分類器を二択で判定するとき一般に使われる初期値です。この値は埋め込まれた攻撃のスコアのおよそ50倍高い一方、検出器は有効なスコアを返し、正常性チェックにも合格していました。

Shastri氏が閾値を0.003に下げ、検出器の調整に使っていないAgentDojoの領域で調整したところ、Prompt Guard 2は攻撃629件のうち621件、99%を検出し、通常の通信を誤って検出する割合は最大2%でした。モデル、重み、リクエストは変えず、閾値だけを変更しました。ただし、攻撃には共通のテンプレートが使われていたため、調整後の閾値がプロンプトインジェクション全般ではなく、そのテンプレートを捉えた可能性があると注意を促しています。この結果が示すのは今回のテストでの調整不良であり、Prompt Guard 2がプロンプトインジェクションを解決したということではありません。各チームの実際の通信データを使って調整するよう勧めています。

Shastri氏は、システムが動作しているかを確かめる稼働確認と、攻撃を遮断できるかを調べる有効性確認を区別しています。攻撃と無害な入力のスコア差、閾値ごとの性能を別々に測り、ベンダーの初期設定を自社データで検証し、検出した攻撃の割合と誤警報率を併記するよう提言しました。評価した検出器のうち2種は攻撃を100%検出した一方、正当な呼び出しの98%まで遮断しており、攻撃検出率だけでは性能を判断できない例となりました。

さらに、既知の攻撃を稼働中の防御機能に送り、実際に遮断されるか確認すること、モデルの重みだけでなく設定もテストすること、モデルや設定の変更後に確認を繰り返すことを勧めています。検出器10種、攻撃629件、閾値の幅広い検証、異なる領域での調整を含むベンチマークは、公開された再現可能なプロジェクトとして利用できます。Shastri氏は、同様の見えにくい失敗が、記録専用モードのまま運用されるウェブアプリケーションファイアウォールの規則、ミュートされた通知先へのアラート、旧式のAPI経路に残る多要素認証の欠落、テストが省略されても合格するテストスイートでも起こり得ると述べています。

原文(英語)を読む·2026年9月30日
安全·倫理#prompt guard 2#meta#agentdojo#prompt injection#security guardrails#decision threshold#false alarm rate#open source detectors