AWS、リアルタイム音声エージェント開発基盤を発表
- •AWSは、Amazon Nova 2 SonicとVision Agentsを組み合わせたリアルタイム音声エージェント構築用フレームワークをリリースした。
- •Streamの高速エッジネットワークを活用し、エンドツーエンドの遅延時間を500ミリ秒未満に抑える構成を実現した。
- •Pythonのデコレータインターフェースを介し、API実行用のネイティブ関数呼び出し機能を簡単に実装可能だ。
AWSは2026年5月14日、リアルタイム音声エージェント構築に向けた商用レベルのフレームワークを発表した。このシステムは、オープンソースの「Vision Agents」フレームワークと、Amazon Bedrock経由で提供される音声対話特化型基盤モデル「Amazon Nova 2 Sonic」を統合したものだ。開発者はこれにより、個別の音声認識(STT)や音声合成(TTS)パイプラインを構築することなく、双方向のオーディオストリーミングやターン検出、関数呼び出しを統合的に制御できる。
基盤となる技術スタックは、Streamの分散型エッジネットワークを活用してリアルタイムのメディア伝送を処理する。これにより、接続開始時間は500ミリ秒未満、音声遅延は30ミリ秒未満を維持する。Vision Agentsはプラグイン型のオーディネーション層として機能し、ユーザー端末とAmazon Bedrock間の接続状態を管理する仕組みだ。音声はRTP経由でSFU(Selective Forwarding Unit)に送信され、ワーカープロセスを介してAmazon Nova 2 Sonicへと送られる。応答音声も同様の低遅延ループを通り、即座にクライアントへ送り返される。
Amazon Nova 2 Sonicはネイティブな関数呼び出しに対応しており、会話中に外部APIのクエリ実行やワークフローのトリガーが可能だ。開発者はPythonの「@llm.register_function」デコレータを用いてこれらの機能を実装できる。また、ユーザーが割り込んだ際にエージェントの出力を停止する「Barge-in」機能や、イベント駆動型ストリーミングAPIによる文脈管理も標準で備えている。動作環境としてPython 3.12とパッケージ管理ツール「uv」が必要となり、30行未満のコードで実用的な音声エージェントを構築可能だ。対応クライアントSDKにはReact、iOS、Android、Flutter、React Nativeが含まれる。