汎用エージェントに本番リスク
- •ディミトリス・キルコス(Dimitris Kyrkos)は、汎用エージェントでは1つのシステムプロンプトが本番障害点になると警告した
- •4,000語のサポート用プロンプトは、請求、返金、トラブルシューティング、口調ルールを分離なく混在させる
- •キルコスは巨大なエージェント用プロンプトではなく、意図分類器、専門機能、決定論的ルーティングを推奨した
ディミトリス・キルコス(Dimitris Kyrkos)はJuly 31, 2026、単一の汎用AIエージェントはデモでは効率的に見えても、本番環境では壊れやすくなると主張した。実トラフィック下では、1つのプロンプト、1つのAPI呼び出し、1つの思考モデルが無関係なタスクまで処理しなければならないからだ。記事によると、このパターンはチームが障害、トークンの浪費、数千件のエッジケースにまたがる回帰に直面するまで、コストを見えにくくする。
キルコスは、製品質問から始まったサポートエージェントが、請求、返金、技術的トラブルシューティング、3つの顧客セグメント向けの口調ルールを含む4,000語のシステムプロンプトへ膨らむ例を示した。エッジケース#41を追加すると、同じモデルによるエッジケース#12の処理が変わり得る。両方の指示が1つのアテンション予算内で競合し、チームはどの行が回帰を起こしたのか切り分けられなくなる。
記事によると、巨大な単一エージェントを通るすべてのリクエストは、使われない機能の分までコストを支払う。「注文状況を知りたい」といった高頻度で単純な意図も、5行の関数で処理できる可能性がある。ルーティング、タスク実行、整形を1回の推論パス(1回のモデル実行)にまとめると、1つの悪い指示が下流全体に影響し、ユーザーに見える前に挙動のずれを捕捉する境界もなくなる。
キルコスは、4,000語の万能プロンプトのテストは「確率の演習」になると述べた。チームは同じ会話を12回ほど再実行し、失敗が許容しきい値を下回ることを期待するしかないためだ。提案された修正策は、統合ではなくルーティングである。小さな分類器が意図を判定し、専門機能が分離されたタスクを処理し、LLMではないコードがルーティング、状態、最終整形を担う。各部品は単体テストが可能なほど小さくなる。