ChatGPT's image generator can be manipulated to produce violent, sexual content
Mindgard 연구진이 챗GPT 이미지 생성기의 콘텐츠 필터가 무력화될 수 있음을 발견했다. 무작위 이미지 생성 프롬프트를 통해 폭력적이고 성적인 이미지가 생성될 수 있었다.
Mindgard의 레드팀 연구원이 챗GPT 이미지 생성기의 콘텐츠 필터가 무력화될 수 있음을 발견했다. 바이럴 프롬프트를 이용해 폭력적이고 성적인 이미지를 생성할 수 있었으며, 이는 사용자가 직접 요청하지 않아도 발생했다.
연구원은 이전에도 챗GPT가 누드 이미지를 생성할 수 있음을 보고했으나, OpenAI가 문제를 해결했다고 밝혔음에도 여전히 가능했다. 이번 발견은 더 심각한 수준으로, 무작위 이미지 생성 요청이 입력 필터를 우회하는 방식이다.
이번 발견은 AI 도구의 광범위한 접근성과 부족한 콘텐츠 필터가 현실적 위험을 초래할 수 있음을 보여준다. 또한 모델이 왜 이러한 이미지로 훈련되었는지에 대한 의문을 제기한다.
일부 댓글은 LLM이 본질적으로 다음 토큰 예측기이므로 안전성 문제를 완전히 해결할 수 없다고 주장한다. 다른 댓글은 생성 후 분류기를 사용한 최소한의 필터링이 필요하다고 지적하며, 프롬프트 인젝션은 근본적으로 고칠 수 없는 '고양이와 쥐' 게임이라는 의견도 있다. 전반적으로 AI 안전성에 대한 회의적인 시각이 두드러진다.