Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving
Liang Su
저지연 온디바이스 AI 서빙을 위해 그래프 경계에 묶인 전체 실행 상태를 캡슐로 스냅샷하고 복원하는 새로운 메커니즘을 제안한다.
기존 LLM 서빙 시스템은 주로 KV 캐시를 재사용하여 높은 처리량과 동시성을 달성하지만, 이는 KV 캐시라는 하나의 위치적 조각만 관리한다. 대화형 AI 에이전트, 음성 시스템, 로봇 정책 등에서 요구되는 저지연, 소배치, 온디바이스 서빙 환경에서는 빈번한 분기, 리셋, 중단 및 재진입이 발생하며, 기존 방식으로는 전체 실행 상태를 효과적으로 관리하기 어렵다.
그래프 경계에 묶인 전체 실행 상태를 캡슐로 정의하고, FlashRT라는 백엔드 커널 런타임을 통해 NVIDIA CUDA 백엔드에서 연속적인 정적 버퍼 위에서 그래프 계획을 실행한다. KV 캐시뿐만 아니라 순환 상태, 합성곱 상태, MTP 상태 및 메타데이터를 포함한 전체 실행 경계를 스냅샷, 복원, 포크 또는 롤백할 수 있다.
RTX 5090에서 캡슐 복원은 저장된 상태 수준에서 바이트 정확하고 탐욕 디코딩 하에서 토큰 동일성을 보장한다. GPU 상주 스냅샷 및 복원은 서브밀리초 수준이며, 2k 토큰에서 3.9배, 16k 토큰에서 27배의 TTFT 속도 향상을 달성한다. Jetson AGX Thor와 DGX Spark에서도 동일한 정확성과 구조적 특성이 유지되며, 고처리량 KV 캐시 서빙을 보완하는 지연 시간 우선 서빙 지점을 정의한다.