EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
Jiafei Song, Feng Zhou, Jinkai Qu, Wenjing Li, Tongzi Wu, Gengjian Xue, Zhikang Zhao, D. Wei 외
멀티모달 언어모델의 비전 토큰을 의미적으로 구분된 핵심 토큰만 남기도록 압축하여 추론 속도를 높이고 정확도를 유지하는 EvoComp 프레임워크를 제안한다.
고해상도 또는 다중 이미지 시나리오에서 멀티모달 대규모 언어모델(MLLM)은 비전 토큰의 수가 많아 추론 효율성이 떨어진다. 기존의 어텐션 또는 유사도 기반 휴리스틱 압축 방법은 정확도 저하를 초래하거나 충분한 압축률을 달성하지 못한다.