AIエージェントのメモリ監査ツール、自己修正試験で誤作動
DEV.to2026年7月3日 (金)
- •AIメモリ監査ツールが自己試験中、プロジェクトの標語を古い指示と誤判定した。
- •開発者は、単なるキーワード一致ではなく、明示的な置き換え表現を優先するようツールを更新した。
- •現状では、完全自動の安全性認証ではなく、人間が検証するための権限マップとリスクレポートを提供する。
AIエージェント向けメモリ監査ツールを開発中の技術者が自己分析結果を公表し、自身のワークスペースで試験を行った際に発生した誤検知と検出漏れを明らかにした。この監査ツールは、命令ファイルを解析して、統治ルール、検証要件、文脈上の注記を区別するように設計されている。試験では、スタートアップファイルと538項目のメモリを含むライブ状態ファイルを解析した際、プロジェクト自身の標語を古い命令と誤判定し、トピックへの言及を無効化されたコマンドとして誤って識別した。
監査ツールは、自然な文章で記述されていたため、スタートアップファイル内の実際の古い設定を検出できなかった。この不具合を解消するため、開発者は単なるキーワード一致への依存を改め、「非推奨」や「置き換え」といった置き換えの根拠を要求する仕様へ更新した。古い指示と単純なトピック参照を正確に区別できるよう、2件の回帰テストも新たに追加された。
これらの調整後も、文章レベルの乖離を解釈する能力には依然として意味的な乖離が残る。開発者は、主張と証拠をマッピングしつつ、自動的に実行ゲートへ変換しない意味的矛盾層を構築することで対応する意向だ。現在のプロジェクトは、システムの安全性を自動認証する段階ではなく、人間が検証するための権限マップやリスクレポートを提供する段階にある。今後は、開発者以外のユーザーにとっても有用かを確認するため、外部エージェントのメモリファイルを用いた試験を行う予定である。