AI 검토 패널, 안전 허점 차단
- •브라이언 윌리엄스(Bryan Williams)는 결함 있는 다수 승인 3차례 뒤 반대 1표가 AI 안전 게이트 변경을 막았다고 밝혔다
- •Round 4는 에이전트 답변 텍스트가 아니라 실제 도구 출력에서 영수증이 나온 뒤에야 통과했다
- •윌리엄스는 모델의 공통 맹점이 검증 작업에서 다수결을 취약하게 만든다고 말했다
브라이언 윌리엄스(Bryan Williams)는 2026년 9월 5일 자신의 AI 에이전트 안전 게이트 변경이 3차례 검토에서 다수 승인을 받았지만, 한 경쟁 모델이 계속 보안 결함을 지적해 통과하지 못했다고 밝혔다. 그의 워크플로는 에이전트 자체 안전 게이트에 대한 모든 변경을 4개 연구소의 경쟁 AI 모델 4개에 보내며, 반대 1표가 있으면 변경을 막는다. 해당 검토에서는 리뷰어 1개가 사용할 수 없는 상태였기 때문에 시스템은 그 부재를 숨기지 않고 4개 중 3개만 검토한 것으로 기록했다.
검토 대상 변경은 일부 입력을 보지 못하는 테스트 하네스가 에이전트에 의해 “동결”되는 일을 막기 위한 안전 게이트였다. Round 1에서 `gpt`와 `gemini`는 에이전트가 직접 정당화 문구를 써서 검사를 건너뛸 수 있는 수정안을 승인했지만, `deepseek`는 “자기 증명 면제”가 어떤 것도 강제하지 않는다고 경고했다. Round 2에서는 면제가 검사를 실행하도록 바뀐 뒤에도 `deepseek`가 해당 테스트가 도구 통과 여부를 확인하지 않고 도구를 언급한 모든 명령을 받아들인다고 지적했다. Round 3에서는 면제가 제거된 뒤 `deepseek`가 통과 영수증이 에이전트 자신의 답변 텍스트와 대조된다는 점을 찾아냈고, 이에 따라 에이전트가 직접 “마법의 단어”를 입력할 수 있었다. Round 4에서는 영수증이 실제 도구 출력에서만 나오도록 바뀌었고, 리뷰어 3개가 모두 승인했다.
윌리엄스는 리뷰어 3개 중 2개가 3개 라운드 연속으로 실제 허점을 승인했기 때문에 다수결이었다면 Round 1에서 문제가 배포됐을 것이라고 말했다. 같은 세션에서는 `gemini`가 별도 문제도 잡아냈다. `Date.now ? 'x' : 'x'`로 만든 임시 파일명은 항상 같은 문자열을 반환해, 검사가 조용히 건너뛰어질 수 있는 경쟁 상태를 만들었다.
윌리엄스는 모델 오류가 서로 연관될 수 있으므로 검증 패널이 시스템 자신의 출력을 스스로 채점하게 해서는 안 된다고 주장했다. 그는 검증 결과에서는 신뢰할 만한 반대 1표가 결정을 내려야 한다고 했지만, 이 접근이 방해 행위가 아니라 실수를 잡는 데 초점이 있으며 리뷰어가 확신을 갖고 틀릴 경우 여전히 문제를 놓칠 수 있다고 덧붙였다. 그는 해당 게시물 자체도 같은 패널에 통과시켰고, 리뷰어 3개 모두 첫 제목이 하룻밤 데이터만으로 과장됐다고 판단하자 게시 전 주장을 좁혔다.