Nested Learning: The Illusion of Deep Learning Architectures
Ali Behrouz, Meisam Razaviyayn, Peilin Zhong, V. Mirrokni
중첩 학습(NL)은 학습을 다중 수준 중첩 최적화 문제로 재정의하여, 기존 딥러닝의 한계를 넘는 표현력 있는 학습 알고리즘과 지속적 학습 모듈(Hope)을 제시한다.
현대 딥러닝, 특히 언어 모델은 지속적 학습, 자기 개선, 효과적 해결책 탐색에서 근본적인 도전과 미해결 질문을 안고 있다. 기존 아키텍처는 고정된 학습 규칙과 제한된 메모리 구조로 인해 새로운 지식을 흡수하거나 장기간에 걸쳐 적응하는 데 어려움을 겪는다.
NL은 모델을 각각 고유한 문맥 흐름을 가진 중첩된 다수준/병렬 최적화 문제 집합으로 표현한다. 이를 통해 기존 학습 방법이 데이터로부터 문맥 흐름을 압축하는 과정임을 밝히고, 맥락 내 학습이 대규모 모델에서 자연스럽게 발생함을 보인다. 세 가지 핵심 기여: (1) Adam, SGD 등 기울기 기반 최적화기가 사실상 연관 기억 모듈임을 보이고, 더 표현력 있는 딥 메모리 최적화기를 제시; (2) 자기 수정 학습 모듈: 자신의 갱신 알고리즘을 학습하는 순차 모델; (3) 연속 기억 시스템: 기존 단기/장기 기억을 일반화한 새로운 기억 체계. 이들을 결합한 Hope 모듈은 언어 모델링, 지식 통합, 퓨샷 일반화, 지속적 학습, 장문맥 추론에서 유망한 성능을 보인다.
NL 패러다임은 학습 알고리즘 설계에 새로운 철학을 제시하며, 더 높은 수준의 맥락 내 학습과 효과적인 지속적 학습 가능성을 열었다. Hope 모듈은 다양한 과제에서 기존 방법 대비 우수한 성능을 보여, NL의 실용적 가치를 입증했다.