Semantic Browsing: Controllable Diversity for Image Generation
Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or
텍스트-이미지 모델의 다양성 문제를 해결하기 위해, 텍스트 수준에서 의미 축을 구조화하여 사용자가 탐색 가능한 이미지 갤러리를 생성하는 방법을 제안한다.
최신 텍스트-이미지 모델은 프롬프트에 대한 시각적 충실도가 높지만, 이는 다양성 상실이라는 단점을 초래한다. 기존의 다양성 향상 방법들은 의미 있는 설계 선택보다 우연적 변동에 의해 출력이 결정되는 경우가 많다.
최신 텍스트-이미지 모델이 상세한 캡션으로 학습되어 의미 결정과 픽셀 생성이 분리된다는 점을 활용한다. 비전 언어 모델(VLM)을 사용하여 텍스트 수준에서 직접 다양성을 유도하고, 원래 프롬프트에 맞춘 구조화된 변형을 명시적으로 강제하는 에이전트 워크플로우를 적용한다.
사용자가 이해할 수 있는 특정 의미적 결정에 대응하는 다양하고 탐색 가능한 디자인 공간을 생성할 수 있음을 입증한다. 이는 이미지 생성에서 무작위 변동에 의존하지 않고 의미 있는 탐색을 가능하게 하는 새로운 패러다임을 제시한다.