LLMs Are Complicated Now
LLM 아키텍처가 점점 복잡해지며 다양한 어텐션 변형, MoE, 비전/오디오 인코더 통합 등이 도입되고 있다. 이는 추천 시스템이 겪었던 복잡성 증가와 유사하며, 성능 최적화와 연구 반복 사이의 균형이 중요해지고 있다.
LLM 아키텍처가 점점 더 복잡해지고 있다. 초기 Llama 모델이 깔끔한 트랜스포머 스택이었다면, 최신 모델들은 다양한 어텐션 변형(쿼리 그룹화, 압축, 희소, 선형, 슬라이딩 윈도우 등), Mixture-of-Experts(MoE), 비전/오디오 인코더 통합, 멀티 GPU 추론을 위한 통신 연산 등이 추가되어 복잡도가 크게 증가했다.
이러한 복잡성 증가는 추천 시스템이 겪었던 진화 과정과 유사하다. 추천 시스템은 기본적으로 단순한 투-타워 구조였지만, 지속적인 성능 향상과 효율성 유지 사이의 긴장으로 인해 복잡해졌다. LLM도 같은 길을 걷고 있으며, 연구 반복 주기에서 새로운 변형을 탐색하려면 최적화된 커널이 필요하지만, 이를 수동으로 최적화하는 데는 많은 시간이 든다.
이 문제를 해결하기 위해 에이전트가 자동으로 커널을 생성할 수 있다는 기대가 있지만, 검증 가능한 기준선이 필요하다. PyTorch의 FlexAttention처럼 처음부터 합성 가능하고 검증 가능하게 설계하는 접근이 중요하다. Andrej Karpathy가 Anthropic에 합류한 것도 이러한 복잡성을 극복하기 위한 자동 연구 루프 개발의 일환이다.
{ "ko": "댓글들은 LLM 아키텍처 비교의 타당성에 의문을 제기하며, Llama 3와 같은 최신 모델과의 비교가 부족하다고 지적합니다. 또한 AI 생성 텍스트 감지에 대한 논쟁이 벌어지는데, 일부는 특정 문체 패턴(예: 연속된 세 가지 제안, 부정 후 강한 긍정)을 AI의 특징으로 보는 반면, 다른 이들은 이러한 패턴이 인간 작가에게도 흔하다고 반박합니다. 전반적으로 AI 텍스트 감지의 주관성과 오탐지 문제가 핵심 쟁점입니다.", "en": "Comments question the validity of comparing different LLM families without including recent models like Llama 3, arguing that differences are unsurprising. A debate emerges on detecting AI-written text: some point to stylistic tics (e.g., triple propositions, negation-then-affirmation) as giveaways, while others note these patterns are common in human writing. The subjectivity and false positives of AI