Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing
LLM이 가상의 전문가 이름을 생성할 때 특정 이름 쌍이 반복적으로 등장하는 '상관된 이름 사전' 현상이 발견됐다. 이로 인해 Zenodo와 ResearchGate 등에 가짜 연구자와 논문이 대량 유입되어 학술 생태계를 오염시키고 있다.
LLM이 가상의 전문가를 생성할 때 특정 이름 쌍(예: Elena Vasquez와 Marcus Chen)이 모델 패밀리별로 일관되게 등장하는 '상관된 이름 사전' 현상이 발견됐다. 이로 인해 Zenodo에서 1,655건의 가짜 논문이 발견되었고, ResearchGate에서도 가짜 연구 그룹이 형성되었다.
LLM은 훈련 데이터의 통계적 패턴을 반영하여 이름을 생성하며, 이 과정에서 특정 이름 조합이 과도하게 나타난다. 연구자들은 이러한 이름 사전이 모델 버전별로 다르며, 모델 출시 시점에 의도적으로 억제되기도 함을 발견했다. 이는 AI 생성 콘텐츠의 식별 가능한 지문을 제공한다.
이 현상은 학술 출판의 무결성에 심각한 위협이 된다. 가짜 논문이 실제 DOI를 부여받아 학술 데이터베이스에 색인될 수 있으며, 이는 연구 평가와 메타분석을 왜곡할 수 있다. 또한, AI 생성 콘텐츠의 확산을 탐지하고 규제할 필요성을 제기한다.