Your Privacy My Cloak: Backdoor Attacks on Differentially Private Federated Learning
Xiaolin Li, Ning Wang, Ninghui Li, Wenhai Sun
차분 프라이버시(DP)가 연합학습(FL)에서 백도어 공격을 방어하는 데 오히려 역효과를 낸다는 사실을 밝히고, DP를 악용한 새로운 백도어 공격 기법 RING을 제안한다.
기존 연구는 DP가 FL의 백도어 공격에 대한 방어력을 자연스럽게 향상시킨다고 주장했으나, 이는 DP가 공격자의 업데이트를 변형하여 방어 탐지를 회피할 수 있는 가능성을 간과했다. 실제로 DP가 적용된 환경에서 기존 방어 기법이 효과적인지 검증할 필요가 있다.
먼저 두 가지 기본 백도어 공격 전략을 실험적으로 분석하여 DP가 방어 탐지를 오히려 회피하게 만드는 '마스킹 효과'를 확인한다. 이를 바탕으로 RING 공격을 설계: 악성 클라이언트들이 협력하여 적대적 섭동(perturbation)을 생성, 집계 과정에서 강한 백도어 신호를 복원하면서도 이상 탐지를 피한다. RING은 기존 백도어 기법과 결합 가능한 플러그인 형태로 일반성을 가진다.
네 가지 이미지/텍스트 데이터셋과 비독립동일분포(non-iid) 환경에서 실험한 결과, RING은 중간 수준의 프라이버시 예산에서 여섯 가지 최신 방어 기법에 대해 평균 90.3%의 공격 성공률을 달성했으며, 이는 기본 전략 대비 최대 26.08배 향상된 수치다. 또한 기존 방어 기법으로는 이 공격을 효과적으로 막기 어렵고, 막으려면 큰 유틸리티 손실이 발생함을 보여 DP-FL의 근본적인 보안 취약점을 드러냈다.