에이전트 관측성, 실제 추적 데이터에 부딪히다
- •에이전트 관측성 프로젝트는 Hugging Face 추적 100,000건에서 `empty_response`가 100% 발생함을 확인했다
- •합성 생성기는 추적 100만건을 사용해 구조적 호환성을 99.2%로 높였지만 탐지기 보정을 왜곡했다
- •프로젝트는 PyPI 패키지 3개, Python 테스트 794개, Playwright E2E 테스트 34개로 배포된다
데바시시 고살(Debashish Ghosal)은 2026년 8월 7일 AI 에이전트용 오픈소스 관측성 레이어인 `agent-exec-trace`를 만들던 작업이 Hugging Face의 실제 에이전트 추적 100,000건을 테스트한 뒤 탐지기 설계 문제가 아니라 데이터 형태 문제로 바뀌었다고 밝혔다. 이 도구는 OpenTelemetry 방식의 추적(표준화된 원격 측정 기록)으로 에이전트 실행을 계측한 뒤 루프, 재시도 폭주, 비용 급증, 환각 패턴, 기타 런타임 실패를 분석해 개발자가 에이전트 실행이 어디서 잘못됐는지 파악하도록 한다.
고살은 처음에 어려운 작업이 이상 징후 정의, 임계값 선택, 추적 연결, 분석 실행, 저장소 배포라고 예상했다. 그러나 Hugging Face 말뭉치에 대한 첫 대규모 처리에서 `empty_response` 탐지기는 추적의 100%에서 작동했고, 규칙 기반 탐지기 35개 중 28개는 한 번도 작동하지 않았다. 그는 추적마다 응답 키, 도구 이름 규칙, 작업 이름, 타임스탬프 형식, 부모-자식 관계가 달랐기 때문에 탐지기 자체가 핵심 문제가 아니라고 결론 내렸다. 정규화 4차례를 거친 뒤 원래 호환성 추정치는 42.4%로 떨어졌다.
`agent-exec-trace`는 계획, 도구 호출, 검색, 메모리, 승인, 비용에 대한 span을 내보내고, 문제가 있는 실행을 사용 가능한 UI에서 보여주도록 설계됐다. 이 프로젝트는 PyPI 패키지 3개로 배포되며 Python 테스트 794개와 Playwright E2E 테스트 34개를 갖췄고, 실제 에이전트를 재설계하지 않고 감싸도록 만든 작은 SDK를 사용한다. 고살은 ruff clean, mypy strict clean, 통과된 테스트, 90% 초과 커버리지 등 엄격한 프로젝트 설정이 있었지만, 모의 에이전트에 기반한 가정이 비현실적 데이터로 검증되는 일을 막지는 못했다고 말했다.
실제 추적 말뭉치가 시스템의 한계를 드러낸 뒤, 고살은 추적 100만건, 가짜 에이전트 10개, 도구 14개, 루프와 재시도, 타임아웃, 비활성 구간, 개입 대기, 토큰 폭증, 메모리 급증을 포함한 의도적 행동 모드를 갖춘 합성 추적 생성기를 만들었다. 구조적 호환성은 99.2%로 올랐고, 규칙 기반 탐지기 35개 중 20개가 작동했다. 다만 합성 데이터는 검증을 여전히 왜곡했다. 합성 출력과 도구 증거의 관계가 인위적으로 쉬웠기 때문에 환각 탐지기는 합성 추적의 98%에서 작동했고, 생성된 비용이 대부분 센트 단위 값이어서 `cost_spike` 탐지기는 거의 작동하지 않았다.
고살은 이제 검증에 여러 층이 필요하다고 말했다. 단위 테스트는 로직이 작동한다는 점을 보여주고, 합성 추적은 탐지기가 필요한 필드를 볼 수 있음을 보여주며, 실제 추적은 그 결과가 개발자 샌드박스 밖에서도 의미가 있는지 보여준다. 그는 OTLP 내보내기의 녹색 마일스톤도 오해를 불렀다고 봤다. OTel collector의 gRPC 포트가 Docker Compose에 노출되지 않았고 SDK 경로가 OTLP 내보내기 대신 로컬 추적으로 설정됐는데, 두 버그가 서로를 상쇄했기 때문이다. 고살은 실제 게이트가 되려면 실제 에이전트가 데이터를 내보내고, Jaeger가 이를 수신하며, 분석이 이를 수집하고, API가 결과를 제공한다는 점을 입증해야 한다고 말했다.
프로젝트는 개인정보 보호상의 절충도 요구했다. 메타데이터 전용 수집은 기본적으로 원시 도구 인수, 전체 도구 응답, 메모리 값을 피했지만, 탐지기가 에이전트의 주장과 반환된 도구 증거를 비교할 수 없어 환각 탐지기를 약하게 만들었다. 잘린 콘텐츠가 허용되자 환각 오탐률은 크게 떨어졌다. 고살은 실제 말뭉치에서 의미 있게 작동하지 않은 탐지기 28개, 운영 워크로드의 LLM 탐지기, API의 span-tree 구체화, 워크로드별 임계값 세트, E2E 증거가 없는 녹색 게이트를 아직 완전히 신뢰하지 않는다고 말했다.