Post-training makes large language models less human-like
Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brandle, David Broska, Jason W. Burton 외
사후 훈련이 LLM을 유용한 어시스턴트로 만드는 과정에서 인간 행동 모델링 성능을 오히려 떨어뜨린다는 실증적 연구이다.
LLM이 인간의 대리물로 점점 더 많이 사용되지만, 어떤 모델이 인간 행동을 가장 잘 포착하는지, 그리고 왜 그런지 불명확하다.
Psych-201이라는 새로운 데이터셋을 도입하여 다양한 모델 패밀리, 크기, 목표에 걸쳐 인간 행동과의 정렬도를 대규모로 측정하는 실험을 수행했다.
사후 훈련은 인간 행동 정렬도를 일관되게 감소시키며, 최신 모델 세대에서 이 불일치는 심화된다. 또한, 개인별 정보를 조건으로 하는 페르소나 유도 기법은 개인 수준의 예측 정확도를 향상시키지 못한다. 이는 현재 LLM을 유용한 어시스턴트로 만드는 과정이 인간 행동의 정확한 모델링을 저해할 수 있음을 시사한다.