AWS、AgentCore評価を公開
- •Amazon Bedrock AgentCore Evaluationsは、LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDKで構築したエージェントを採点する
- •同サービスは、Amazon CloudWatchに保存されたinvoke agent、inference、execute toolのspanからセッションを再構成する
- •AWSは、end-to-end評価にはsession.id、メッセージ内容、準拠したinstrumentation scope nameが必要だとした
Amazon Web ServicesはAugust 26, 2026、Amazon Bedrock AgentCore Evaluationsが、特定のSDK、LLMクライアント、トレーシング方式を求めず、OpenTelemetry traceを読み取って異なるフレームワークで構築された本番AIエージェントを採点できると発表した。AWSブログによると、LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDK、Strands Agentsを使うチームは、ホスティング、スケーリング、メモリ、可観測性インフラを扱うAmazon Bedrock AgentCore runtime上にデプロイできる。
AgentCore EvaluationsはOpenTelemetryを共通のテレメトリ層として使う。OpenTelemetryはリクエストをspan(単一の作業ステップ)で構成されるtraceとして記録し、AgentCore runtimeではそれらのspanがAWS Distro for OpenTelemetryを通じて収集され、Amazon CloudWatchへ送られる。サービスがセッションを再構成するには、最上位のユーザーターンを示すinvoke agent span、モデル呼び出し用のinference span、ツール呼び出し用のexecute tool spanという3つのspan役割が必要だ。retrieval、reranking、guardrail、memory、embedding、prompt、evaluator、agent、chainなど他のspanは任意の文脈として扱われ、不要ならスキップされる。
AWSは、OpenTelemetry GenAI conventionsとOpenInference schemasが異なるattribute keyやspan-kind vocabularyを使っていても、同サービスが両者を橋渡しすると説明した。評価がオンデマンド、またはonline evaluation configを通じて実行されると、AgentCore EvaluationsはCloudWatchからspanとevent recordを取得し、session.idでセッションをまとめ、各trace_idを1つのユーザーターンとして扱い、3つの必須span種別を分類する。そのうえで再構成したセッションをGoalSuccessRate、Correctness、Helpfulness、custom LLM-as-a-judgeなどの評価器へ送る。
AWSブログによると、ユーザーがそのマッピングを手動で設定する必要はない。各instrumentation libraryはspanとevent recordにscope.nameを付け、AgentCore Evaluationsはその値を使って読み取り方法を判断する。対応フレームワークのドキュメントはStrands Agents、LangGraph、OpenAI Agents SDK、LlamaIndex、Google ADK、Claude Agent SDKを対象とし、多くはOpenTelemetryとOpenInferenceの両方のinstrumentationに対応する。opentelemetry.instrumentation.またはopeninference.instrumentation.配下のscopeは汎用経路を使えるが、mycompany.agent.tracingのようなscopeは、spanが規約に従っていても取り込まれない。
AWSはend-to-end評価の要件を2つ挙げた。第1に、spanはエージェント呼び出しに使ったruntimeSessionIdと一致するsession.idを持つ必要があり、AgentCore runtimeではADOTがこれを自動で注入する。第2に、data sourceにはspanだけでなくメッセージ内容も含める必要がある。unified observabilityを使う新規作成エージェントは、spanと同じエージェント別log groupにメッセージ内容を保存する。一方、unified以前の古いエージェントはspanをaws/spansに、関連するevent recordをエージェントのlog groupに置く。data sourceがaws/spansだけを対象にすると、span分類は成功しても、メッセージ内容が空のためresponse-quality evaluatorがエラーを返す場合がある。
ウォークスルーによると、AgentCore samples repositoryにはOpenAI Agents SDK、Google ADK、LlamaIndex、Claude Agent SDKを使ったHR assistantの例が含まれる。instrumentationは、opentelemetry-instrumentation-openai-agentsやopentelemetry-instrumentation-llamaindexなどのpackageをrequirements.txtへ追加して有効化できる。OpenAI Agents SDKのsampleではset_tracing_disabled(True)を呼んではならない。instrumentationが使うtracing pipelineが無効になるためだ。LlamaIndexについてAWSは、エージェントが単なるAgentExecutorではなくFunctionAgentまたはReActAgent workflow agentでなければならないとした。workflow agentはターン再構成に必要な最上位のinvoke agent spanを出力する。