Spurious alignment between large language models and brains can emerge from non-robust methods and overlooked confounds
Nima Hadidi, Ebrahim Feghhi, Bryan H. Song, I. Blank, Jonathan C Kao
LLM과 뇌 신호 간의 정렬 연구에서 흔히 사용되는 방법론적 함정과 교란변수를 체계적으로 분석하여, 일부 주요 발견이 비강건한 방법에서 비롯됨을 규명합니다.
LLM이 인간과 유사한 방식으로 언어를 처리하는지 이해하기 위해 뇌 신호 예측력 연구가 활발히 진행되고 있지만, 결과의 강건성에 대한 대규모 평가가 부족합니다. 특히 데이터 분할 방식, 모델 활성화 추출 방법, 그리고 위치 신호나 단어 속도 같은 교란변수가 결과에 미치는 영향이 과소평가되어 왔습니다.
세 가지 널리 사용되는 뇌 신호 데이터셋에 대해 광범위한 모델과 방법론적 접근법을 분석합니다. 셔플된 훈련-테스트 분할의 영향, LLM에서 활성화를 추출하는 다양한 방법의 편향성, 그리고 교란변수(특히 위치 신호와 단어 속도)의 경쟁력 있는 성능을 체계적으로 검증합니다.
셔플된 분할 사용이 비강건한 결과를 초래함을 발견하고, 활성화 추출 방법이 특정 모델 클래스에 유리하게 결과를 편향시킬 수 있음을 보여줍니다. 위치 신호와 단어 속도 같은 교란변수가 훈련된 LLM과 경쟁력 있는 성능을 보이며, 훈련되지 않은 LLM의 뇌 신호 예측력을 완전히 설명할 수 있음을 입증합니다. 이는 LLM-뇌 정렬 연구의 방법론적 강건성을 재평가하는 중요한 기여를 합니다.