TILDE: TILt-based Distributional Erasure for Concept Unlearning
Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji
텍스트-이미지 확산 모델에서 원치 않는 개념을 안전하게 지우면서도, 유해하지 않은 생성의 품질과 다양성을 유지하는 분포 정렬 기반 학습 방법을 제안합니다.
개념 지우기(concept unlearning)는 프라이버시, 저작권, 안전 규제 등으로 인해 학습된 모델에서 특정 개념을 제거해야 하는 실용적 요구사항입니다. 기존 방법들은 목표 개념을 제거하는 데는 효과적이지만, 지운 후 모델이 여전히 고품질·다양성·의미적 범위를 유지하는 '보존(retention)' 속성은 명시적으로 고려하지 않아 성능 저하를 초래할 수 있습니다.
TILDE는 개념 지우기를 분포 정렬(distributional alignment) 문제로 공식화합니다. 목표는 '잊기(forgetting)' 제약 하에서 사전 학습된 모델로부터 최소 편차를 가지는 조건부 분포를 설정하는 것입니다. 이는 에너지 기반의 앵커 프리(anchor-free) 목표로, 개념을 표현하는 이미지를 억제하면서 각 프롬프트에 대한 유해하지 않은 상대적 질량(mass)을 보존합니다. 구체적으로는 잔차 ∇-GFlowNet 학습을 사용하여, 사전 학습된 확산 모델 대비 잊기 에너지가 유도하는 점수 보정을 학습합니다.
개체, 예술적 스타일, 캐릭터 등 다양한 개념에 대해 실험한 결과, TILDE는 강력한 망각 성능을 달성하면서도 기존 기반 모델들 대비 보존 성능과 분포 충실도를 향상시켰습니다. 이는 개념 지우기의 새로운 이론적·실용적 프레임워크를 제시하여, 안전하고 실용적인 모델 배포에 기여합니다.