InterleaveThinker: Reinforcing Agentic Interleaved Generation
Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li
InterleaveThinker는 기존 이미지 생성기에 텍스트-이미지 순차 생성 능력을 부여하는 다중 에이전트 파이프라인으로, 플래너와 크리틱 에이전트를 활용해 생성 과정을 계획·평가·개선한다.
최신 이미지 생성기는 단일 이미지 생성 및 편집에서 뛰어난 성능을 보이지만, 텍스트와 이미지를 번갈아 생성하는 interleaved generation(예: 시각적 내러티브, 가이드, 로봇 조작)은 아키텍처적 한계로 불가능하다. 기존 통합 멀티모달 모델(UMM)도 이 작업에서 성능이 제한적이다.
InterleaveThinker는 다양한 이미지 생성기(예: FLUX, SD3)의 interleaved 생성 성능을 향상시켰으며, 벤치마크에서 Nano Banana 및 GPT-5와 유사한 성능을 달성했다. 또한 추론 기반 벤치마크(WISE, RISE)에서도 기본 모델 대비 큰 성능 향상을 보였다.