Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing
LLM이 허구의 전문가 이름을 생성할 때 특정 이름 쌍이 모델군별로 일관되게 등장하는 상관된 사전 확률을 가진다는 사실을 발견했다. 이러한 '유령 이름'이 Zenodo와 ResearchGate 등 학술 플랫폼에 실제 DOI와 함께 등록되어 학계에 확산되고 있음을 문서화했다.
LLM이 가상의 전문가를 생성할 때 무작위로 이름을 고르는 것이 아니라, 모델군(Claude, Gemini, GPT 등)과 버전에 따라 특정 이름 쌍(예: Claude의 Elena Vasquez + Marcus Chen)이 반복적으로 등장하는 '상관된 이름 사전 확률'을 가진다는 사실을 발견했다. 이러한 이름들은 실제로 존재하지 않는 인물임에도 불구하고, Zenodo(유럽입자물리연구소 CERN 운영)에 1,655건의 가짜 학술 기록으로 등록되어 실제 DOI를 부여받았으며, ResearchGate에서도 가상의 연구 그룹을 형성하고 있다.
LLM이 생성한 콘텐츠가 웹과 학술 출판물에 확산되는 문제는 지속적으로 제기되어 왔다. 이 연구는 단순히 개별 이름의 빈도가 높은 것을 넘어, 이름 간의 상관관계가 모델군별로 고유하고 버전 업데이트 시점에 의도적으로 억제되는 패턴을 발견했다. 또한 이러한 유령 이름이 실제 학술 데이터베이스에 편입되어 인용 가능한 상태로 존재함을 대규모로 증명했다.
LLM 생성 콘텐츠가 학술 기록에 침투하는 실질적인 위험을 보여준다. 특히 DataCite DOI가 부여된 기록은 학술 검색 엔진에 수집되어 연구자들이 인용할 수 있으므로, 학계의 신뢰성을 훼손할 수 있다. 이는 LLM 출력물의 검증 시스템과 학술 출판의 무결성 보호를 위한 정책 마련이 시급함을 시사한다.