Thinking in Boxes: 3D Editing in Real Images Made Easy
Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D. A. Forsyth, Anand Bhattad
사용자가 3D 박스로 객체의 변환을 명시하면, 깊이 정렬 바닥을 참조하여 실제 이미지에서 대규모 3D 편집을 수행하는 방법.
기존 텍스트나 2D 조건 기반 편집은 큰 객체 이동이나 카메라 변화 같은 공간 변환을 제어하기에 모호하고 약하다. 3D 프리미티브를 사용한 기존 연구도 대략적인 위치만 지정할 뿐 정확한 변환을 명시하지 못했다.
입력과 출력 3D 박스를 사용자로부터 받아 편집을 기하학적으로 명확한 문제로 정식화한다. 각 박스 면에 색상을 부여해 3D 방향을 전달한다. 깊이 정렬된 평면 바닥을 전역 참조 프레임으로 도입하고, 깊이 인식 큐로 음영 처리한다. 이 구조를 조건으로 이미지 생성기가 일관된 결과를 생성한다. 합성 다중 객체 장면과 Objectron의 실제 비디오로 2단계 학습한다.
실제 사진에 직접 작동하며, 대규모 3D 편집에서 최신 방법들을 크게 능가한다. 객체 정체성과 장면을 보존하면서 이전에 보이지 않던 영역도 복원한다.