DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
긴 문맥 LLM 추론의 KV 캐시 메모리 병목을 해결하기 위해, 토큰 중요도에 따라 교차 층에서 저순위 기저 분해와 잔차를 적응적으로 할당하는 압축 기법을 제안한다.
긴 문맥 추론에서 KV 캐시는 메모리 대역폭과 용량을 크게 소모한다. 기존 압축은 층이나 토큰에 균일한 예산을 적용하여, 어휘 단서와 의미 상태가 보존 수준을 달리 요구할 때 검색 성능이 저하된다.
인접 트랜스포머 층 간에 키-값 상태를 공유 저순위 채널 기저로 분해하고, 주의가 민감한 토큰에는 가벼운 토큰별 잔차를 유지한다. 토큰 조건부 깊이 라우터로 지시·검색 핵심 토큰에 더 높은 재구성 순위를 할당하고, 주의 출력 프로브의 보정 없는 온라인 오류 추적을 사용해 재학습 없이 생성 중 압축을 적응시킨다. 기저 룩업, 잔차 역양자화, 주의 투영을 융합한 CUDA 커널로 디코딩 메모리 트래픽을 줄인다.
LongBench, Needle-in-a-Haystack, L-Eval, 긴 문맥 QA 및 요약 벤치마크에서 풀 캐시에 근접하는 품질을 유지하면서 KV 메모리를 최대 8.3배 줄이고 64K 문맥에서 72.8 토큰/초를 달성한다. 기존 압축 캐시 대비 평균 점수와 검색 정확도를 향상시킨다.