Do Audio-Visual Large Language Models Really See and Hear?
Ramaneswaran Selvakumar, Kaousheik Jayakumar, Sakshi Singh, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha
시청각 거대 언어 모델(AVLLM)의 내부 메커니즘을 분석하여, 시각 정보가 오디오 정보를 억압하는 편향이 존재하며 이는 학습 데이터의 불균형에서 기인함을 밝혔다.
AVLLM은 오디오와 시각 정보를 통합하여 텍스트를 생성하는데, 실제로 두 양식을 균형 있게 활용하는지, 특히 오디오 정보가 시각 정보와 충돌할 때 제대로 반영되는지 의문이 있었다.
첫 번째 메커니즘 해석 연구로서, AVLLM의 각 층에서 오디오와 시각 특징이 어떻게 진화하고 융합되는지 분석했다. 프로빙(probing) 기법을 통해 중간층의 오디오 정보를 평가하고, 최종 출력과의 차이를 비교했다.
중간층에는 유용한 오디오 정보가 존재하지만, 깊은 융합층에서 시각 표현이 오디오를 억압하는 편향이 발견되었다. 또한 AVLLM의 오디오 동작이 시각-언어 기반 모델과 유사하여, 오디오 감독에 대한 추가 정렬이 제한적임을 시사한다. 이 연구는 멀티모달 LLM의 양식 편향에 대한 새로운 기계적 통찰을 제공한다.