What Does a Discrete Diffusion Model Learn?
Rodrigo Casado Noguerales, Bernhard Schölkopf, Thomas Hofmann, Aran Raoufi
이산 확산 모델이 학습하는 대상의 수학적 정체와 최적화 목표를 엄밀하게 규명하고, 기존 모델들을 하나의 프레임워크로 통합합니다.
이산 확산 모델에서 신경망이 실제로 학습하는 것이 무엇인지(노이즈 제거기, 점수 비율 등) 명확하지 않았고, 서로 다른 좌표계에서의 해석이 혼재하여 모델 학습과 샘플링 과정을 왜곡할 수 있었습니다.
연속 시간 마르코프 체인(CTMC)의 ELBO를 엄밀하게 유도하고, '오라클 거리' 정리를 증명하여 음의 ELBO가 데이터 엔트로피와 오라클 역방향 프로세스로부터의 경로 KL 발산과 정확히 같음을 보였습니다. 토큰 팩터화 노이즈를 가진 시퀀스에 대해 최적화 대상의 세 가지 좌표(노이즈 제거기, 캐비티, 점수)와 닫힌 형태 변환을 유도했습니다.
MDM, UDM, SEDD, GIDD 등 기존 모델들을 하나의 프레임워크로 복구하고, 왜 마스크 확산에서는 노이즈 제거기와 캐비티가 일치하지만 균일 확산에서는 그렇지 않은지 설명합니다. 또한 균일 ELBO가 초기화 시 발산하는 반면 브릿지 플러그인은 유한함을 증명하고, 모든 항등식을 정확히 풀 수 있는 모델에서 수치적으로 검증합니다.