LLMs use recurring ghost authors and personalities
연구진은 LLM이 특정 가상 인물 쌍을 반복적으로 생성하는 '유령 커플' 현상을 발견했다. 이 가상 이름들은 수백 개의 AI 생성 문서에 등장하며, Zenodo와 ResearchGate에서 실제 DOI를 가진 가짜 학술 기록을 만드는 데 악용되고 있다.
LLM이 가상의 전문가 이름을 생성할 때, 특정 이름 쌍(예: Claude 모델은 Elena Vasquez + Marcus Chen, Gemini는 Aris Thorne + Lena Petrova)이 독립적인 생성에서도 높은 상관관계로 반복 등장한다. 연구진은 이를 '유령 커플'이라 명명하고, 이러한 이름들이 Zenodo(CERN 운영 저장소)에서 1,655건의 가짜 학술 기록을 만드는 데 사용되었음을 발견했다. 이 기록들은 실제 DataCite DOI를 가지고 있으며, 일부는 고의로 날짜가 조작되었다.
LLM이 가상 인물을 생성할 때 단순히 높은 확률의 개별 이름을 선택하는 것이 아니라, 모델군별로 고정된 인물 쌍을 생성한다는 사실은 모델의 내부 편향을 드러낸다. 이러한 '유령 저자'들은 학술 출판 시스템을 오염시켜, 실제 연구자들의 신뢰성을 훼손하고 학술 데이터베이스에 쓰레기 정보를 유입시킨다. Zenodo의 사례는 AI 생성 콘텐츠가 학술 기록의 무결성을 위협할 수 있음을 보여준다.
이 연구는 LLM 생성 콘텐츠가 학술 생태계에 미치는 부정적 영향을 경고한다. 학술 출판사와 저장소는 AI 생성 저자명을 탐지하고 필터링할 방법을 마련해야 한다. 또한, 모델 제공자는 이러한 '유령 커플' 현상을 완화하기 위해 이름 생성 프롬프트를 개선할 필요가 있다. 이는 AI 안전성과 학술 윤리의 교차점에서 중요한 문제를 제기한다.