AgentEval Forge, 실제 에이전트 검증
- •AgentEval Forge가 GitHub와 PyPI에 v0.1.0 에이전트 평가 도구로 공개됐다
- •현장 테스트는 GitHub의 19개 에이전트와 95개 시나리오에서 9% 통과율을 기록했다
- •저가 gpt-4o-mini와 상위 gpt-4o 계층은 모두 동일한 9/95 통과 결과를 냈다
데바시시 고살(Debashish Ghosal)은 GitHub와 PyPI에 AgentEval Forge를 공개 에이전트 평가 하네스로 배포했다. 이는 에이전트 평가는 최종 답변만이 아니라 전체 실행 과정을 판단해야 한다는 앞선 주장 이후 2주간의 후속 작업으로 나왔다. v0.1.0 프로젝트는 출시 시나리오, 회귀 워크플로, 적대적 사례 생성, CI 게이팅으로 에이전트를 검증하며, 안전 실패를 올바른 최종 답변으로 상쇄할 수 없는 실행 종료 실패로 처리한다.
AgentEval Forge에는 20개 Critical User Journeys, 5개 핵심 구성요소, 17개 결정론적 검사, 11개 LLM-as-judge 지표, 회귀 엔진, 적대적 생성기, M0 scaffold부터 M12 launch까지 12개 마일스톤에 걸친 118개 작업의 WBS가 포함됐다. 이 도구는 subprocess, Python import, HTTP, LangGraph, PydanticAI 등 5개 에이전트 표면을 지원한다. 각 어댑터는 시나리오 입력, 허용 도구, 금지 도구, 예산을 담은 제한된 호출 페이로드를 보내며, 정답과 채점 기준은 숨겨 ground-truth 유출을 막는다.
고살은 sandbox mode, trust policies, audit trails, API key sanitization을 갖춘 보안 모델도 구축했으며 GitHub Actions, GitLab CI, Docker sandbox용 CI 통합을 더했다. 문서화된 기능 목록에는 10개 계열에 걸친 20개 출시 시나리오, 8개 보안 시나리오, 17개 결정론적 채점기, 11개 LLM-as-judge 지표, 5개 프레임워크 어댑터, Safety > Correctness > Efficiency라는 제품 위계가 포함된다.
현장 테스트는 프로젝트 방향을 바꿨다. 단위 테스트와 모의 에이전트가 통합 문제를 가리고 있었기 때문이다. 고살은 150+개 GitHub 저장소를 검색해 테스트 가능해 보이는 19개를 찾았고, 여기에는 11개 LangGraph 에이전트와 8개 PydanticAI 에이전트가 포함됐다. 각 에이전트에는 별도 설정 파일, 시나리오 팩, 가상환경이 배정됐으며, 테스트는 Qwen3.5-9B-MLX-4bit을 제공하는 로컬 MLX 설정, gpt-4o-mini를 쓰는 저가 클라우드 계층, gpt-4o를 쓰는 상위 클라우드 계층 등 3개 계층에서 실행됐다.
현장 테스트 결과는 19개 에이전트와 95개 시나리오에서 9% 통과율, 통과 9건이었다. 고살은 이 결과가 에이전트 품질보다 어댑터 현실성을 더 많이 측정했다고 말했다. 하네스를 계속 살려 두지만 빈 completion을 반환한 래퍼들이 0점을 받았기 때문이다. 저가와 상위 클라우드 계층은 모두 9/95 통과라는 동일한 결과를 냈고, 상위 모델은 저가 모델이 놓친 회귀나 개선을 드러내지 않았다.
설정 실패가 핵심 장애물이 됐다. 한 에이전트는 모듈 범위에서 지원되지 않는 모델 이름으로 ChatOpenAI()를 하드코딩했고, 다른 에이전트는 import 시점에 /root에 쓰기를 시도했다. 3개는 C 확장 ABI 불일치가 있는 ormsgpack을 포함했으며, 1개 저장소는 pyproject.toml을 하위 디렉터리에 둬 루트에서 uv sync를 실행해도 아무 일도 일어나지 않았다. 또 1개 에이전트는 오래된 PydanticAI API 버전을 사용해 제거됐다. 고살은 8개 호환성 래퍼 모듈을 작성하고, 깨진 패키징을 위해 3개 pyproject.toml 파일을 만들었으며, 그 외 실행 가능성이 있던 3개 에이전트를 격리했다.
LangGraph 멀티에이전트 저장소인 lg-mcp-agents는 표적 어댑터 작업 이후 두 클라우드 계층 모두에서 5/5 통과를 기록했다. 고살은 이 결과가 어댑터가 실제 에이전트 동작을 실행하고 있음을 보여준다고 말했다. 해당 저장소는 원래 Streamlit 앱 밖에서는 실행되지 않았기 때문이다. 현장 하네스는 늦게 추가됐다. 모의 에이전트는 어댑터 계약을 지나치게 깔끔하게 따랐지만, 실제 에이전트는 ffmpeg를 import하고, 호환되지 않는 가상환경을 만들고, 절대 경로에 쓰고, 모듈 범위에서 API 키를 하드코딩하고, 프로젝트 파일을 하위 디렉터리에 중첩했다.
고살에 따르면 AgentEval Forge v0.1.0은 GitHub의 실제 서드파티 에이전트를 대규모로 import, configure, invoke, score할 수 있다. 다만 채점기가 대규모 혼합 명단을 의미 있게 순위화할 수 있다는 점은 아직 입증하지 못했다. 일부 PydanticAI 래퍼의 빈 completion, ormsgpack 불일치, 명단 확장, 어댑터 품질, SWE-bench와 WebArena용 기본 CI 통합은 미완성 작업으로 남아 있다. 패키지는 pip install agent-eval-forge로 설치되며, 저장소에는 README, 사용자 가이드, 08.02.2026 날짜의 현장 테스트 보고서, hard-won lessons 문서가 포함된다.