Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan Gao 외
온정책 증류(OPD)의 성공 조건과 토큰 수준 메커니즘을 규명하고, 실패 시 회복 전략을 제시한 연구.
OPD는 LLM 후속 학습에서 널리 쓰이지만, 어떤 조건에서 성공하고 실패하는지, 그 메커니즘은 무엇인지 명확히 이해되지 않았다.
약→강 역증류 실험을 통해 교사와 학생의 사고 패턴 호환성 및 새로운 능력 제공 필요성을 검증하고, 토큰 수준에서 확률 분포 정렬을 분석했다. 또한 실패 시 off-policy cold start와 교사 정렬 프롬프트 선택 전략을 제안했다.
OPD 성공 조건을 두 가지로 정리하고, 성공 시 고확률 토큰에서 점진적 정렬이 일어나며 소수의 공유 토큰이 확률 질량의 97-99%를 차지함을 발견했다. 제안된 전략으로 실패한 OPD를 회복할 수 있음을 보였고, OPD의 밀집 토큰 보상이 장기 증류에 한계가 있을 수 있음을 지적했다.