Understanding Large Language Models
Yannik Keller, Thomas F. Eisenmann
대규모 언어 모델의 작동 원리, 발현 능력, 그리고 진정한 이해 여부에 대한 현재 논쟁을 종합적으로 검토하는 서베이 논문.
대규모 언어 모델(LLM)의 발전에도 불구하고, 그들의 내부 메커니즘, 능력의 한계, 그리고 인간 인지와의 관계에 대한 근본적인 질문들이 여전히 활발히 논의되고 있습니다. 특히 LLM이 보이는 능력이 진정한 인지인지 아니면 단순한 패턴 학습인지에 대한 논쟁이 지속되고 있습니다.
이 논문은 먼저 트랜스포머 아키텍처와 어텐션 메커니즘을 간략히 개괄합니다. 그 다음, 기호 추론, 마음 이론, 기만 전략 등 인간 인지와 유사해 보이는 LLM의 발현 능력을 검토합니다. 또한, 뉴런 활성화 분석이나 회로 추적과 같은 설명 가능한 AI(XAI) 접근법을 살펴봅니다. 마지막으로, LLM의 진정한 이해에 대한 현재 논쟁을 다루며, 단순한 환원론적 논쟁을 넘어선 균형 잡힌 논의를 주장합니다.
이 논문은 LLM의 능력과 한계에 대한 현재의 이해를 종합적으로 정리합니다. 특히, LLM의 인지 능력에 대한 논쟁에서 인간과 LLM의 차이를 무시하지 않으면서도 과도한 단순화로 AI 인지를 배제하지 않는 보다 정교한 논의의 틀을 제시합니다. 이는 향후 LLM 연구와 인지 과학의 교차점에서의 연구 방향을 설정하는 데 기여합니다.