AI 테스트 작성의 경계
- •Study 011은 gpt-5.6-sol로 하나의 합성 벤더 심사 정책에 대해 AI 작성 호출 50회를 실행했다
- •유효 실행 49회 모두 사전 등록된 경계 클래스 6개 중 6개를 포함했고 각각 기록 16개를 생성했다
- •연구는 정책과 일치한 기록 784 / 784개를 보고했지만 주장은 하나의 프롬프트와 정책으로 제한했다
브라이언 진(Brian Jin)은 2026년 8월 7일 오픈소스 Judgment Pack 평가기 실험의 Study 011에서 하나의 AI 모델 gpt-5.6-sol이 같은 합성 벤더 심사 정책에 대해 구조화된 테스트 기록을 독립적으로 50회 작성했다고 보고했다. 해당 정책에는 제재 규칙, 국가 제한, 개인정보 조건, 고위험 기준값 70, 개인정보 기준값 40이 포함됐다. 배치 실행 전 가능한 결함 클래스 6개가 사전 등록됐고, 모델은 Judgment Pack이나 나중에 테스트될 결함을 보지 못했다.
실험은 하나의 고정 프롬프트, 하나의 고정 합성 정책, 고정된 CLI와 바이너리, 호출마다 새로 분리된 환경, 순차 작성 호출 50회, 사전 등록된 커버리지 클래스 6개로 구성됐다. 50회 실행 중 49회는 파이프라인 검사를 통과했고 1회는 채점 전 거부됐다. 유효 실행 49회 모두 6개 중 6개 경계 클래스를 전부 포함했으며, 각 유효 실행은 정확히 승인 기록 16개를 만들었다. 승인 기록 784개 중 784개는 기준 정책 의미와 일치했고, 유효 완료 49개는 모두 서로 달랐다.
6개 클래스는 정확히 risk = 70, 70 <= risk < 71, 개인정보가 있고 40 <= risk < 41, 40 <= risk < 70, registered country = SY, 개인정보가 있고 39 <= risk < 40이었다. 각 클래스는 유효 실행 49 / 49회에서 포함돼 관측 비율 100%를 기록했고, 동일한 정확 95% Clopper-Pearson interval은 [0.9275, 1.0000]이었다. 진은 49개 유효 실행 중 49개 성공이 실제 비율 100%를 입증하지 못하며, 해당 실험 셀에서 약 92.75%의 하한만 제시한다고 설명했다.
마지막 클래스인 개인정보가 있고 39 <= risk < 40인 구간에는 별도 주의가 붙었다. 합성 정책은 기준값 40을 명시했지만, 모델에 숨은 계열 경계인 39를 테스트하라고 요구하지 않았다. 그런데도 유효 실행 49회 모두 해당 구간 안의 기록을 만들었다. 이 중 28회는 39.99를, 21회는 39.999를 사용했다. 진은 더 좁은 설명으로, 프롬프트가 40 주변의 경계 사례를 요청했고 모델이 40 바로 아래 값을 생성했다는 해석을 제시했다.
출력은 바이트 단위로 동일한 반복물이 아니었다. 유효 완료 49개는 모두 서로 달랐고, 바이트 단위로 동일한 출력의 최대 그룹 크기는 1이었다. 모델은 이름, 예시, 기록 구성을 바꾸면서도 같은 의미적 영역에 도달했다. 다만 진은 보관된 산출물로는 제공자 측 교차 세션 동작을 관찰할 수 없었기 때문에, 서로 다른 출력이 통계적으로 독립적인 추출을 입증하지는 않는다고 밝혔다.
유효 실행 전체에서 각 완료는 기록 16개를 생성해 49 x 16 = 784개의 승인 기록이 나왔다. 연구는 정책과 일치한 기록 784개, 잘못 라벨링된 기록 0개, 누락된 기록 0개를 보고했고, 통합 라벨 일치율은 784 / 784 = 1.000이었다. 진은 하나의 완료 안에 있는 기록 16개를 독립 시행으로 취급하지 않았기 때문에 이 수치에 이항 신뢰구간을 붙이지 않았다. 반복 단위는 실행이었다.
Run 026은 모델 프로세스가 성공적으로 종료됐지만, 사전 프롬프트 개발자 컨텍스트가 잠긴 골든 컨텍스트와 일치하지 않아 제외됐다. 파이프라인은 transcript-refused를 반환했고, 관측된 파이프라인 무효 비율은 1 / 50 = 2%, 95% 구간은 [0.05%, 10.65%]였다. 가능한 설명은 서비스 측 상용구 변동이었지만, 연구는 거부된 transcript를 검사해 allowlist 규칙을 재정의하지 않았다.
사전 등록된 검토 깊이 매핑은 신뢰구간 하한을 사용했다. lower >= 0.80이면 LIGHT review, lower >= 0.40이면 STANDARD review, lower < 0.40이면 FULL review였다. 6개 클래스 모두 lower bound = 0.9275, mislabel share = 0, tier = LIGHT로 끝났다. 진은 이 매핑이 실험적이며 운영 환경에서 검증되지 않았다고 강조했다.
연구의 주장은 하나의 프롬프트, 하나의 모델, 하나의 작은 합성 정책으로 제한됐다. AI가 임의의 조직 판단을 안정적으로 작성할 수 있음을 보이지 않았고, 다른 모델이나 프롬프트를 테스트하지 않았으며, 상호작용하는 예외, 여러 문서, 모호한 언어, 우선순위, 시간 조건, 누락 증거, 충돌하는 권한, 인간 승인 요건이 있는 실제 정책도 평가하지 않았다. 또한 결함을 드러낼 수 있는 영역의 커버리지를 측정했을 뿐, 결함 탐지 자체를 측정하지 않았다. Study 010은 단일 결함 탐지 추출을 별도로 다뤘다.