GateGPT: 56k tokens per second Transformer (KV cache) on FPGA at 80 MHz
GateGPT는 FPGA에서 80MHz 클록으로 동작하며 KV 캐시를 활용해 초당 56,000개 토큰을 처리하는 트랜스포머 추론 가속기다. 이는 기존 FPGA 기반 솔루션 대비 10배 이상의 처리량을 달성했다.
GateGPT는 FPGA에서 80MHz 클록으로 동작하며 KV 캐시를 활용해 초당 56,000개 토큰을 처리하는 트랜스포머 추론 가속기가 발표되었다.
FPGA 기반 AI 가속기는 낮은 전력 소모와 재구성 가능성으로 주목받지만, 기존에는 처리량이 낮아 실용성이 제한적이었다. GateGPT는 효율적인 KV 캐시 관리와 파이프라인 최적화를 통해 이 문제를 해결했다.
이 기술은 엣지 디바이스나 전력 제약이 있는 환경에서 LLM 추론을 가능하게 할 수 있으며, FPGA 기반 AI 추론의 실용성을 크게 높인다.
FPGA에서 80MHz로 동작하는 소형 트랜스포머가 초당 56k 토큰을 처리하지만, 컨텍스트 윈도우가 16자에 불과해 실용성이 낮다는 비판이 있다. CPU 구현이 71배 빠르다는 비교와 함께, 대규모 모델을 FPGA로 실행하는 것은 학술적 의미 외에는 한계가 있다는 의견이 지배적이다. 다만 FPGA 설계 자체는 교육적 가치가 있고, 소형 모델의 특수 목적 사용 가능성도 언급된다.