한줄 요약
LMCache는 LLM 추론에서 KV 캐시를 효율적으로 관리하여 지연 시간을 줄이고 처리량을 높이는 오픈소스 프레임워크다.
핵심 기능
KV 캐시를 영구 저장하고 여러 서빙 엔진 간 재사용 가능
TTFT(Time-to-First-Token) 감소 및 처리량 향상
멀티턴 대화, RAG, 에이전트 워크로드에 최적화
벤더 중립적이며 vLLM 등과 통합 가능
분산 CPU 메모리 공유(P2P) 및 멀티모달 모델 지원
언제 쓰나
긴 컨텍스트를 다루는 LLM 서비스에서 첫 응답 시간을 줄여야 할 때
멀티턴 대화나 RAG 등 KV 캐시 재사용이 유리한 워크로드
여러 서빙 엔진 간 캐시를 공유하여 인프라 비용을 절감하고자 할 때