The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation
Nicolas Dufour, Alexei A. Efros, Patrick Pérez
FID 평가의 무작위성을 계량화하고, 재현성 있는 평가를 위한 새로운 프로토콜을 제안한다.
FID는 생성 모델 평가의 표준 지표이지만, 대부분의 논문이 단일 학습 시드와 단일 샘플링 시드로 얻은 하나의 숫자만 보고한다. 이 숫자가 모델을 재학습하거나 샘플링을 다시 했을 때 얼마나 재현 가능한지 알 수 없다.
FID를 학습 시드와 생성 시드의 2축 패널에서 확률 변수로 취급하고, class-conditional ImageNet 256x256에서 학습된 수백 개의 SiT 네트워크에 대해 분산을 직접 측정한다. 요인별 변동 기여도를 분해하고, classifier-free guidance 튜닝의 효과를 분석한다.
재학습 시 FID 변동이 재샘플링보다 3.2배 크며, 이는 초기화, 데이터 순서, flow-matching 손실의 가우시안 노이즈 때문이다. 계산량이나 모델 크기를 늘려도 변동 폭(CoV 1-2%)이 줄지 않는다. Per-cell 최적 guidance 튜닝은 변동을 절반으로 줄이지만 최적 시드를 재배열하며, 운 좋은 학습 시드는 나쁜 시드보다 최대 2배 적은 계산으로 같은 FID에 도달한다. 이에 따라 per-cell 최적 guidance 하에 평가하고, 1.3% CoV 이하의 FID 차이는 불확실한 것으로 간주하며, 여러 학습 시드에 대한 오차 막대를 보고할 것을 권장한다.