AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

ブラウンフィールドでのエージェント活用指針

ブラウンフィールドでのエージェント活用指針

Addy Osmani·2026年9月21日 (月)
  • •アディ・オスマニ(Addy Osmani)は、古いブラウンフィールドコードベースで動くエージェントにゾーン別管理を求めた
  • •黄・赤のコード領域では、キャラクタリゼーションテスト、調査メモ、人間によるレビューゲートが必要になる
  • •移行例には、SWE Refactor Benchの520回実行とBunの535,000行移植が含まれる
  • •アディ・オスマニ(Addy Osmani)は、古いブラウンフィールドコードベースで動くエージェントにゾーン別管理を求めた
  • •黄・赤のコード領域では、キャラクタリゼーションテスト、調査メモ、人間によるレビューゲートが必要になる
  • •移行例には、SWE Refactor Benchの520回実行とBunの535,000行移植が含まれる
  • •アディ・オスマニ(Addy Osmani)は、古いブラウンフィールドコードベースで動くエージェントにゾーン別管理を求めた
  • •黄・赤のコード領域では、キャラクタリゼーションテスト、調査メモ、人間によるレビューゲートが必要になる
  • •移行例には、SWE Refactor Benchの520回実行とBunの535,000行移植が含まれる
  • •アディ・オスマニ(Addy Osmani)は、古いブラウンフィールドコードベースで動くエージェントにゾーン別管理を求めた
  • •黄・赤のコード領域では、キャラクタリゼーションテスト、調査メモ、人間によるレビューゲートが必要になる
  • •移行例には、SWE Refactor Benchの520回実行とBunの535,000行移植が含まれる

アディ・オスマニ(Addy Osmani)は、古いコードベースでのAgentic Engineeringは、隠れた制約を可視化し、小さな変更が安全であると証明するところから始めるべきだと主張した。ブラウンフィールドシステムとは、制度的知識、レガシーサービス、チームの期待、本番環境の癖がリポジトリ外に存在し、コードだけではすべての挙動を表せなくなった状態のリポジトリだと説明した。監督されないエージェントは、「動く」コードを出しながら、誤ったシステム設計や壊れやすいテストを選ぶ可能性があると警告した。

オスマニは、エージェントが変更を加える前に、古いコードベースをゾーンに分けることを提案した。グリーンゾーンは十分なテスト、現代的な慣習、分離性を備え、エージェントが短いループで作業できる。イエローゾーンは品質が混在しており、エージェント変更の前にキャラクタリゼーションテスト(現在の挙動を記録するテスト)が必要になる。レッドゾーンには認証、請求、権限、給与計算、少人数しか理解していない領域が含まれ、すべての手順で人間とのペア作業が必要、または作業すべきではない領域とした。

オスマニは、ゾーンマップはエージェントではなく人間が作成し、根拠を得た場合にだけ変更すべきだと述べた。イエロー領域は、キャラクタリゼーションテストが整い、モジュール所有者がエージェントの最初の変更をレビューした後にグリーンへ移れる。自律性はモデルの自信ではなく、影響範囲、観測可能性、復旧可能性に従うべきだとした。チームが文書化すべきなのは、コードから読み取れない事業固有のニュアンス、トレードオフ、強制されていないガイドライン、ドメインルール、外部制約、特殊な実装に至った歴史的理由だと述べた。

オスマニは、イエローおよびレッドの作業では、各エージェントが同じ調査を繰り返さないよう、読み取り専用の調査パスを別に設けることを勧めた。その調査は、入口、所有者、呼び出し元、既存の抽象化、テスト、本番シグナル、履歴、未解決の問いをまとめた短いメモを生むべきで、主張はファイル、Issue、所有権記録、ダッシュボードに結び付ける必要がある。調査後の計画はクリーンなコンテキストで始め、マップが誤っていたと分かった時点で実装を止めるべきだとした。

オスマニは、エージェントハーネスを、エージェントを取り巻く環境、すなわちコンテキスト、ツール、権限、テスト、ログ、復旧だと説明した。レビューで繰り返される修正は、可能ならlintルール、フック、型、テスト、スキルへ移すべきで、文章は機械的に強制できない制約に限るべきだとした。拒否ルール、範囲を限定した認証情報、CIチェックは、記憶に頼らず過去の失敗から得た教訓を保持できる。

オスマニは、チームはモノリスをRustで書き直すのではなく、システムの仕組みを説明する、またはキャラクタリゼーションテストを生成するといったゼロリスク作業から始めるべきだと述べた。NetflixのGraphQL切り替えでは、昇格前にリプレイとシャドウトラフィックで旧経路と新経路を比較したと紹介した。AOL.comの壊れたホームページ修正では、数十の部門、コンポーネント、スクリプト、A/Bテスト、限られたユニットテスト範囲が絡み、他チームの作業を壊さないためにユーザーテストが必要だったとも振り返った。

オスマニは、移行は完全な単位で終えるべきだと主張した。中途半端な移行は、矛盾した前例によってエージェントを混乱させるからだ。SWE Refactor Benchでは、520回のエージェント実行のうち、移行監査、挙動テスト、独立検証を通過したのは28件だけだった。BunのZigからRustへの移植では、535,000行のコードベースから約50のワークフローを11日間走らせ、生成された各単位に2人の敵対的レビュアーを付けた。VB6からC#への研究では、単純な機能で92%、複雑な機能で47%の挙動同等性が測定された。

オスマニは、エージェントによって複数の妥当な実装を試すコストは変わったが、どれを選ぶかに必要な証拠は変わっていないと述べた。Stripeは数カ月のcodemod作業を通じて、3.7 million行を1つのPRでTypeScriptへ移行した。SpotifyはBackstageで月650件超のエージェントPRがマージされていると報告した。Asanaは複数年分のEnzymeバックログを2 calendar weeksで解消し、モデルとインフラの費用は約$12,000だった。ShopifyはShop消費者向けアプリをReact NativeからネイティブのSwiftとKotlinへ12 weeksで再構築し、画面単位のエージェントゲート付きチェックポイントを使った。

アディ・オスマニ(Addy Osmani)は、古いコードベースでのAgentic Engineeringは、隠れた制約を可視化し、小さな変更が安全であると証明するところから始めるべきだと主張した。ブラウンフィールドシステムとは、制度的知識、レガシーサービス、チームの期待、本番環境の癖がリポジトリ外に存在し、コードだけではすべての挙動を表せなくなった状態のリポジトリだと説明した。監督されないエージェントは、「動く」コードを出しながら、誤ったシステム設計や壊れやすいテストを選ぶ可能性があると警告した。

オスマニは、エージェントが変更を加える前に、古いコードベースをゾーンに分けることを提案した。グリーンゾーンは十分なテスト、現代的な慣習、分離性を備え、エージェントが短いループで作業できる。イエローゾーンは品質が混在しており、エージェント変更の前にキャラクタリゼーションテスト(現在の挙動を記録するテスト)が必要になる。レッドゾーンには認証、請求、権限、給与計算、少人数しか理解していない領域が含まれ、すべての手順で人間とのペア作業が必要、または作業すべきではない領域とした。

オスマニは、ゾーンマップはエージェントではなく人間が作成し、根拠を得た場合にだけ変更すべきだと述べた。イエロー領域は、キャラクタリゼーションテストが整い、モジュール所有者がエージェントの最初の変更をレビューした後にグリーンへ移れる。自律性はモデルの自信ではなく、影響範囲、観測可能性、復旧可能性に従うべきだとした。チームが文書化すべきなのは、コードから読み取れない事業固有のニュアンス、トレードオフ、強制されていないガイドライン、ドメインルール、外部制約、特殊な実装に至った歴史的理由だと述べた。

オスマニは、イエローおよびレッドの作業では、各エージェントが同じ調査を繰り返さないよう、読み取り専用の調査パスを別に設けることを勧めた。その調査は、入口、所有者、呼び出し元、既存の抽象化、テスト、本番シグナル、履歴、未解決の問いをまとめた短いメモを生むべきで、主張はファイル、Issue、所有権記録、ダッシュボードに結び付ける必要がある。調査後の計画はクリーンなコンテキストで始め、マップが誤っていたと分かった時点で実装を止めるべきだとした。

オスマニは、エージェントハーネスを、エージェントを取り巻く環境、すなわちコンテキスト、ツール、権限、テスト、ログ、復旧だと説明した。レビューで繰り返される修正は、可能ならlintルール、フック、型、テスト、スキルへ移すべきで、文章は機械的に強制できない制約に限るべきだとした。拒否ルール、範囲を限定した認証情報、CIチェックは、記憶に頼らず過去の失敗から得た教訓を保持できる。

オスマニは、チームはモノリスをRustで書き直すのではなく、システムの仕組みを説明する、またはキャラクタリゼーションテストを生成するといったゼロリスク作業から始めるべきだと述べた。NetflixのGraphQL切り替えでは、昇格前にリプレイとシャドウトラフィックで旧経路と新経路を比較したと紹介した。AOL.comの壊れたホームページ修正では、数十の部門、コンポーネント、スクリプト、A/Bテスト、限られたユニットテスト範囲が絡み、他チームの作業を壊さないためにユーザーテストが必要だったとも振り返った。

オスマニは、移行は完全な単位で終えるべきだと主張した。中途半端な移行は、矛盾した前例によってエージェントを混乱させるからだ。SWE Refactor Benchでは、520回のエージェント実行のうち、移行監査、挙動テスト、独立検証を通過したのは28件だけだった。BunのZigからRustへの移植では、535,000行のコードベースから約50のワークフローを11日間走らせ、生成された各単位に2人の敵対的レビュアーを付けた。VB6からC#への研究では、単純な機能で92%、複雑な機能で47%の挙動同等性が測定された。

オスマニは、エージェントによって複数の妥当な実装を試すコストは変わったが、どれを選ぶかに必要な証拠は変わっていないと述べた。Stripeは数カ月のcodemod作業を通じて、3.7 million行を1つのPRでTypeScriptへ移行した。SpotifyはBackstageで月650件超のエージェントPRがマージされていると報告した。Asanaは複数年分のEnzymeバックログを2 calendar weeksで解消し、モデルとインフラの費用は約$12,000だった。ShopifyはShop消費者向けアプリをReact NativeからネイティブのSwiftとKotlinへ12 weeksで再構築し、画面単位のエージェントゲート付きチェックポイントを使った。

原文(英語)を読む·2026年9月14日
#agentic ai#brownfield codebase#characterization tests#software migration#codemod#swe refactor bench#zig to rust#typescript migration