한줄 요약
SGD가 평탄 최소점을 선호한다는 직관의 이론적 기반을 강화하기 위해, 재매개변수화 불변성을 만족하는 기하학적 뾰족함 측정을 제안하고 일반화 성능과의 연결을 증명한다.
풀어야 하는 문제
딥러닝에서 SGD가 평탄한 최소점을 선호하여 일반화 성능이 좋다는 통찰이 널리 퍼져 있지만, 기존의 유클리드적 뾰족함 측정(예: 손실 헤시안의 대각합 또는 최대 고유값)은 네트워크 함수를 보존하는 재매개변수화에 불변하지 않아 이 서사의 이론적 기반이 약화된다.
접근 방법
피셔 정보 행렬(FIM)이 유도하는 통계 다양체의 리만 기하학에 기반하여 '리만 뾰족함(Riemannian sharpness, SR)'을 수학적으로 정의하고, 매끄럽고 함수 보존적인 재매개변수화에 불변함을 증명한다.
미니배치 SGD의 그래디언트 노이즈를 FIM에 비례하는 공분산 구조로 공식화하고, 그 결과로 나오는 확률 미분 방정식의 정상 분포를 유도한다.
리만 평탄 최소점에 확률 질량이 지수적으로 집중됨을 보이고, SR에 의해 명시적으로 제어되는 PAC-Bayes 일반화 경계를 도출하여 이 기하학적 편향을 테스트 성능과 연결한다.
결과·기여
리만 뾰족함(SR)이 유클리드 뾰족함과 달리 재매개변수화 불변성을 가지며, 이는 Dinh et al.의 비판을 직접적으로 해결한다.
MNIST 및 CIFAR-10 실험에서 SR이 유클리드 뾰족함이 하지 못하는 방식으로 일반화 성능을 안정적으로 추적함을 확인한다.
SR의 스케일링이 η/B(학습률/배치 크기)와 이론적 예측과 일치함을 보여, 평탄 최소점이 왜 일반화에 유리한지에 대한 엄밀하고 재매개변수화 불변적인 설명을 제공한다.