ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations
Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen 외
ARM은 이산 시맨틱 비주얼 토크나이저와 자회귀 모델을 결합하여 이미지 이해, 생성, 편집을 하나의 next-token prediction 프레임워크로 통합한 대규모 멀티모달 모델이다.
기존 멀티모달 모델은 이미지 이해와 생성에 서로 다른 아키텍처나 표현 방식을 사용하여 통합이 어렵고, 특히 생성 작업에서 선호도 정렬(preference alignment)이 부족했다.
1) 의미적 판별력, 언어 정렬, 충실한 재구성을 동시에 최적화하는 이산 시맨틱 비주얼 토크나이저를 학습한다. 2) 대규모 텍스트와 이미지 토큰 시퀀스로 7B 자회귀 모델을 학습하여 비전-언어 인식 및 생성 능력을 개발한다. 3) 강화학습(RL)을 적용하여 시각적 품질, 명령 준수, 편집 일관성 등 작업 수준의 목표를 최적화한다.
RL 적용 후 WISE 종합 점수가 0.50에서 0.56으로, GEdit-Bench-EN G_O가 5.75에서 6.68로 향상되었다. 또한 텍스트-이미지 생성과 편집 간 교차 작업 시너지가 관찰되어, 강력한 표현과 선호도 최적화를 결합한 자회귀 모델링이 확장 가능한 멀티모달 기반이 될 수 있음을 보였다.