ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao
텍스트와 시각 정보를 하나의 이산 표현으로 통합하여 멀티모달 모델링을 단순화하고 학습 효율성을 높이는 ViQ 프레임워크를 제안한다.
기존의 이산 시각 표현은 의미와 세부 정보 사이의 균형을 맞추기 어렵다. 재구성에 초점을 맞춘 표현은 의미 정보가 부족하고, 의미가 강한 표현은 세부 정보의 손실이 크다. 또한 고정된 해상도 입력에 제한되는 경우가 많다.
ViQ는 양자화 학습을 두 단계로 구조화한다. 첫째, 사전 학습된 언어 모델의 감독 하에 시각 인코더의 의미 풍부한 사전 학습을 수행하여 원본 해상도 입력을 처리할 수 있게 한다. 둘째, 특징 이산화 단계에서 근접 표현 학습 전략과 위치 인식 헤드 단위 양자화 메커니즘을 제안하여 특징 공간을 점진적으로 압축하고 유연한 해상도 처리를 가능하게 한다.
다양한 멀티모달 태스크에서 연속적이고 고차원적인 시각 특징을 사용하는 최신 멀티모달 비전 인코더와 경쟁력 있는 성능을 달성하면서도, 저수준 재구성에서 높은 정밀도를 유지한다. 시각 이산 표현을 사용한 멀티모달 학습은 기본 LLM과 학습 방법에 따라 최대 20%-70%의 학습 가속을 달성하여 효율성을 크게 향상시킨다.