Direct-OPD, 모델 간 강화 학습 성과 효율적 전이
- •Direct-OPD는 최종 모델 가중치가 아닌 정책 변화를 활용해 모델 간 강화 학습 성과를 전이한다.
- •7B 매개변수 모델은 해당 증류법을 통해 AIME 2024 점수를 56.7에서 63.1로 개선했다.
- •Qwen3-1.7B 모델은 8개의 A100 GPU를 사용하여 4시간 만에 AIME 2024 점수를 48.3%에서 58.3%로 높였다.
Direct-OPD(Direct On-Policy Distillation)는 소형 언어 모델의 강화 학습 성과를 대형 모델로 전이하는 새로운 방법론이다. 강화 학습으로 유도된 정책 변화를 암묵적 보상 신호로 활용함으로써, 대형 모델에서 매번 값비싼 강화 학습을 반복할 필요 없이 효율적인 확장이 가능하다. 칭화대 AIR(Tsinghua AIR)와 바이트댄스 Seed(ByteDance Seed)의 공동 연구소인 SIA-Lab 연구진은 모델 규모가 커짐에 따라 검증 가능한 보상을 활용한 강화 학습(RLVR)을 반복해야 하는 병목 현상을 해결하기 위해 이 기술을 개발했다.
기존의 강화 학습 이후 모델 증류 방식은 소형 교사 모델의 한계점까지 함께 학습되는 경우가 많아 효율이 떨어진다. 반면 Direct-OPD는 강화 학습 전후의 교사 모델 체크포인트를 비교한다. 이 버전들 간의 로그 비율을 계산해 구체적인 정책 변화를 식별하고, 해당 차이를 조밀한 암묵적 보상 신호로 처리하여 성능이 더 높은 학생 모델의 온-정책 상태(On-policy states)에 적용한다.
실험 결과, Direct-OPD는 학생 모델이 교사 모델보다 이미 성능이 앞서는 경우에도 성공적으로 모델을 개선했다. AIME 2024 벤치마크 테스트에서 7B 학생 모델은 Direct-OPD 훈련 후 63.1점을 기록해 기존 56.7점 대비 6.4점 향상됐다. 이는 7B 학생 모델의 성능이 약 50점 수준으로 하락했던 일반적인 온-정책 증류 방식과 대비되는 결과다. 또한 Qwen3-1.7B 모델은 8개의 A100 GPU를 사용해 4시간 만에 AIME 2024 점수를 48.3%에서 58.3%로 끌어올렸다. 연구진은 이 방법이 다수의 정책 변화를 순차적으로 구성할 수 있게 함으로써, 강화 학습 결과를 단순히 최종 가중치를 모방하는 대신 전이 가능한 신호로 재사용할 수 있다고 설명한다.