Explicitly unbiased large language models still form biased associations
Xuechunzi Bai, Angelina Wang, Ilia Sucholutsky, Thomas L. Griffiths
가치 정렬된 LLM들이 표준 편향 벤치마크에서는 무편향으로 보이지만, 심리학적 암묵적 연합 검사(IAT)와 유사한 방법으로 측정 시 사회적 고정관념을 강하게 학습하고 있음을 실증적으로 보여준 연구.
LLM의 편향 평가는 주로 명시적 질문이나 표준 데이터셋에 의존하는데, 이는 모델이 사회적으로 바람직한 답변을 학습하여 편향을 숨길 수 있다. 따라서 모델의 실제 행동에서 드러나는 암묵적 편향을 측정할 방법이 필요하다.
심리학의 암묵적 연합 검사(IAT)와 유사한 단어 연합 과제(Word Association)와 문장 완성 과제(Sentence Completion)를 설계하여, LLM이 특정 사회 집단(인종, 성별, 종교, 건강)과 부정적/긍정적 속성 간의 연관성을 얼마나 강하게 가지는지 측정했다. 8개의 최신 가치 정렬 LLM(GPT-4, Claude 등)을 대상으로 21개의 고정관념(예: 흑인-범죄, 여성-과학)에 대해 평가했다.
모든 모델에서 사회적 고정관념과 일치하는 암묵적 편향이 발견되었으며, 이는 표준 편향 벤치마크에서의 점수와 무관했다. 또한 이러한 편향이 모델의 차별적 의사결정(예: 가상 채용, 형량 예측)에 유의미한 영향을 미침을 확인했다. 이 연구는 LLM의 편향 평가에 심리학적 방법론을 도입하여 기존 평가의 한계를 극복하고, 실제 행동 기반의 편향 측정이 필요함을 강조한다.