AI 에이전트 준법률, 프롬프트보다 기계적 제어가 효과적
- •기계적 검증 시스템 도입으로 AI 에이전트의 규칙 위반율이 55.9%에서 0.7%로 급감했다.
- •150개 과제 실험 결과, 삼단논법과 명령형 규칙 형식 간의 직접적인 준수율 차이는 거의 없었다.
- •삼단논법 기반 규칙 설정은 명령형보다 심층적인 추론과 교차 검토를 유도하는 것으로 나타났다.
유하오 린(Yuhao Lin) 개발자가 AI 에이전트의 규칙 준수 방식에 미치는 영향력을 평가하기 위해 통제 실험을 진행했다. 이번 연구는 DeepSeek V4 Pro를 활용하여 총 6개 세션, 150개의 표준화된 과제를 수행했다. 과제는 삼단논법(Syllogism) 형태의 제약 조건과 명령형(Imperative) 규칙으로 구분되었으며, 설정 편집, 설계 결정, 빌드, 디버깅, 문서화 등의 범위를 포함했다. 실험 초기에는 삼단논법 방식이 오류를 줄일 것으로 예측했으나, 두 조건 모두 99.3%의 준수율을 보이며 150개 과제 중 149개에서 규칙 위반이 발생하지 않았다.
높은 준수율의 핵심 요인은 검증되지 않은 편집 및 쓰기 작업을 차단하는 기계적 검증 시스템인 GateGuard였다. 실제 이전 로그 기록을 분석한 결과 GateGuard 도입 전에는 규칙 위반율이 55.9%에 달했으나, 시스템 적용 후 0.7%까지 감소했다. 이는 AI의 규칙 준수를 보장하는 데 있어 언어적 표현보다 기계적 제어 방식이 압도적으로 효과적임을 시사한다.
준수율에는 큰 차이가 없었지만, 추론 과정에서는 유의미한 변화가 발견되었다. 삼단논법을 사용한 에이전트는 복잡한 설계 과제에서 인과관계에 기반한 행동을 보이며 다각적인 교차 검토를 수행했다. 반면, 명령형 규칙 에이전트는 체크리스트 방식의 출력에 의존했다. 연구자는 자가 평가 편향과 파일 시스템 오염 가능성을 한계점으로 지적하며, 향후 인간 평가자와 GateGuard를 배제한 테스트 환경을 통해 프롬프트 형식의 순수 효과를 분리할 필요가 있다고 덧붙였다.