Unified Controllable and Faithful Text-to-CAD Generation with LLMs
PR-CAD는 대규모 언어 모델을 활용해 텍스트 설명으로부터 CAD 모델을 생성하고 편집하는 통합 프레임워크다. 강화학습 기반 추론 에이전트를 통해 의도 이해, 파라미터 추정, 편집 위치 파악을 단일 에이전트로 수행하며, 공개 벤치마크에서 최고 수준의 제어 가능성과 충실도를 달성했다.
PR-CAD(Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models)라는 연구가 발표되었다. 이 연구는 텍스트 설명만으로 CAD 모델을 생성하고 편집할 수 있는 통합 프레임워크를 제안한다.
기존 텍스트-CAD 생성 연구는 생성과 편집을 별개의 작업으로 다루어 실용성이 제한적이었다. PR-CAD는 이 두 작업을 하나의 에이전트로 통합하여 사용자가 자연어로 모델을 처음부터 만들거나 수정할 수 있게 한다. 연구진은 CAD 전 생애주기를 포괄하는 고충실도 상호작용 데이터셋을 구축하고, LLM에 최적화된 CAD 표현을 설계했다. 또한 강화학습을 통해 의도 이해, 파라미터 추정, 편집 위치 파악을 단일 추론 과정으로 처리한다.
PR-CAD는 CAD 모델링의 진입 장벽을 크게 낮출 수 있는 기술이다. 전문가가 아니더라도 자연어로 복잡한 3D 모델을 생성하고 수정할 수 있게 되어, 제품 설계, 건축, 제조 분야에서 생산성을 혁신적으로 향상시킬 가능성이 있다. 공개 벤치마크에서 생성과 편집 모두에서 최고 성능을 보여 실용성이 입증되었다.
일부 사용자들은 LLM이 단순한 CAD 작업에서 충분히 유용하며, 실제로 한 번의 프롬프트로 성공적인 3D 프린팅 결과를 얻은 사례를 공유했습니다. 반면, 다른 이들은 LLM이 전반적인 형태는 잡아도 마지막 1%의 정밀도에서 실패하거나, 사용자가 오류를 인지하지 못하게 할 위험이 있다고 지적했습니다. 또한 텍스트 기반 CAD는 기계공학적 직관과 다른 추상적 용어(예: 토러스)를 사용해야 한다는 실용적 비판도 제기되었습니다.