Optimizing generative AI by backpropagating language model feedback
Mert Yuksekgonul, Federico Bianchi, Joseph Boen, Sheng Liu, Pan Lu, Zhi Huang, Carlos Guestrin, James Zou
언어모델의 피드백을 역전파하여 생성형 AI 모델을 최적화하는 새로운 학습 방법.
생성형 AI 모델의 출력 품질을 높이기 위해서는 보통 인간의 피드백이 필요하지만, 이는 비용이 많이 들고 확장성이 떨어진다. 언어모델 자체를 평가자로 사용할 수 있지만, 평가 점수를 생성 모델의 학습에 직접 활용하기 어렵다.
제안 방법은 언어모델이 생성된 출력에 대해 부여한 점수(예: 유용성, 정확성)를 미분 가능한 형태로 변환하여 생성 모델의 손실 함수로 사용한다. 이를 통해 생성 모델은 언어모델의 피드백을 직접 역전파 받아 학습된다. 구체적으로, 언어모델의 출력 확률을 이용해 점수를 근사하고, 생성 모델의 파라미터에 대한 그래디언트를 계산한다.
텍스트 생성 및 이미지 생성 작업에서 인간 피드백 없이도 품질이 크게 향상됨을 보였다. 특히, 기존 강화학습 기반 방법보다 샘플 효율이 높고 안정적으로 학습된다. 이 방법은 다양한 생성 모델에 적용 가능하며, 인간 평가자의 부담을 줄일 수 있는 실용적인 대안을 제시한다.