집중형 감독, 교차 토크나이저 증류에 효과
- •수학 추론·코드 생성에서 토크나이저가 다른 교사·학생 모델 3쌍 시험
- •학생이 고른 공통 어휘 상위 16개 토큰만으로 전체 어휘와 비슷한 정확도 달성
- •불일치 구간 감독은 범위를 넓혔지만 정확도를 낮추고 약하거나 충돌하는 그래디언트 생성
빙시 허우(Bingxi Hou), 궈차오 장(Guochao Jiang), 궈펑 취안(Guofeng Quan), 웨이칭 리(Weiqing Li), 원펑 펑(Wenfeng Feng), 궈화 류(Guohua Liu), 위웨이 장(Yuewei Zhang) 연구진은 토크나이저가 다른 언어 모델 사이에서도 온폴리시 증류가 가능하다고 보고했습니다. 연구진은 더 넓은 정렬 범위보다 신뢰할 수 있는 감독 신호를 우선해야 한다고 밝혔습니다. 논문은 10월 6일 발표됐고 10월 7일 Hugging Face에 제출됐으며, 수학적 추론과 코드 생성 과제에서 교사·학생 모델 3쌍을 시험했습니다. 증류 전 학생이 생성한 응답을 분석한 결과, 엄격히 정렬된 토큰 위치에서는 어휘가 크게 달라도 교사와 학생의 확률 질량 대부분이 평균적으로 유지됐습니다.
엄격히 정렬된 각 위치에서 연구진은 역-KL(두 확률 분포의 차이를 재는 지표)을 공통 어휘 중 학생이 선택한 상위 16개 토큰으로 제한했습니다. 이 방식은 공통 어휘 전체를 사용했을 때와 비슷한 정확도를 냈고, 평가 대상 교차 토크나이저 기준선보다도 높은 성능을 보였습니다. 엄격한 일대일 토큰 그룹이 학생이 생성한 토큰 대부분을 이미 포괄해, 불일치 구간까지 감독 범위를 넓혀도 얻는 이점은 적었습니다.
불일치 구간의 로그 확률에 평균제곱오차 감독을 추가하면 모든 구간을 포괄했지만 정확도는 낮아졌습니다. 엄격한 손실만으로 학습한 체크포인트에서는 구간 감독의 그래디언트가 엄격한 손실의 그래디언트와 약하거나 음의 방향 일치를 보였으며, 두 신호의 상대적 크기도 커졌습니다. 연구진은 약하게 정렬되거나 서로 충돌하는 학습 신호를 끌어들이는 넓은 감독보다, 엄격히 정렬된 위치에서 간결하게 감독하는 방식을 뒷받침하는 결과라고 설명했습니다.