WebMCPデモ、AIエージェントがブラウザーで操作
- •WebMCPデモで、一般のウェブサイトが公開するツールをAIエージェントから呼び出し可能に
- •WebMCP Local AgentはPrompt API、Ollama、Gemini Flashの3つのモードに対応
- •ConsequentialHintで、fireEmployees()など重要な操作の前にユーザー確認を追加
Sylwia Laskowska氏は2026年9月21日、2,000人超が参加したAGNTCon + MCPCon EuropeでのWebMCP発表後、デモを紹介する記事を公開しました。WebMCPは、ウェブサイトがAIエージェントから呼び出せるツールを明示的に公開する実験的なブラウザーAPIです。開発に携わる人物は、少なくともChromiumでは1月か2月ごろに十分安定する見通しだとLaskowska氏に伝えました。
「従来型」のMCPと異なり、WebMCPはブラウザー内で動作します。対象のウェブサイトを開き、認証が必要ならユーザーがログインした状態で、エージェントがページの公開するツールを呼び出します。Laskowska氏によると、エージェント対応ブラウザーまたはChrome拡張機能を通じて利用でき、ChatGPTも最近、内蔵ブラウザーでWebMCP対応サイトのツールをサポートしました。
Laskowska氏のデモアプリ「AI CEO Simulator」は、手動でも操作できる通常のウェブサイトで、WebMCPツールも公開しています。現金、月間売上、従業員数、生産上のインシデント、従業員の幸福度、話題性などのスタートアップ指標に加え、「AI導入」「エージェント事業への転換」「Rustで書き直す」「従業員の解雇」「従業員の採用」といった取締役会の決定項目があります。
ライブデモでWebMCPツールを呼び出すため、Laskowska氏はChrome拡張機能「WebMCP Local Agent」を開発しました。拡張機能はユーザーの意図を受け取り、現在のページで利用可能なWebMCPツールを確認して、適切と判断したものを呼び出します。エージェントの処理では、モデルにユーザーの意図と利用可能なツールを渡し、結果を受けて次の手順を判断します。設定を変更しない場合、反復回数は最大10回です。
WebMCP Local Agentは現在、3つのプロバイダーモードに対応しています。GoogleのPrompt APIはChromiumが管理するGemini Nanoを使います。モデルのダウンロード後、推論は端末内で行われ、プロンプトをGoogleや他の第三者に送信せず、APIキーも不要です。Ollamaもローカルで動作し、Laskowska氏はLlama 3.1を使っていますが、別のモデルも選べます。クラウドの選択肢はAPIキーが必要な旧型のGemini Flashで、能力と速度の面では使いやすい一方、常に利用できるとは限らないと同氏は説明しています。
ローカルプロバイダーを使う場合、プロンプトとモデルの推論をユーザーの端末内に保てるため、やり取りのたびにクラウドモデルへ送る方法よりプライバシー面で利点があります。Laskowska氏は、クラウドAIサービスへのアクセスが不安定な環境でもローカルモデルが役立つと述べる一方、Llama 3.1がJSONではなくMarkdownや余分な説明を返すことがあると指摘しました。
Laskowska氏は、WebMCPによって操作が明示的なクリックから、ユーザーの意図に基づくモデルの計画とツール呼び出しへ変わるため、安全性が中心的な課題だとしています。従業員一覧を表示するlistEmployees()のようなリスクの低いツールと、従業員を解雇するfireEmployees()のような重大な操作を区別し、WebMCPにはconsequentialHintなどのツール注釈が加わりました。同氏の拡張機能はconsequentialHintに対応し、該当する操作の実行前に確認画面を表示して、ユーザーが承認または拒否できるようにします。
Laskowska氏によると、デモと拡張機能は、複数のモデルと仕様駆動開発に対応するAWSのIDE「Kiro」を使って作りました。カンファレンス講演の2時間前に起きたAPI変更を含め、変化するWebMCP APIへの対応をKiroが担ったといいます。同氏は、既存のウェブサイトを全面的に作り直す必要はなく、ユーザーは引き続きボタンをクリックしたりフォームに入力したりでき、WebMCPによってエージェントも同じサイトを構造化された方法で操作できると結論づけています。