Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
Boyi Deng, Xu Wang, Yaoning Wang, Yunyang Wan, Yubo Ma, Baosong Yang, Haoran Wei, Jialong Tang 외
Qwen-Scope는 Qwen3/3.5 계열 7개 모델(밀집 및 MoE)에 대한 희소 오토인코더(SAE) 14개 그룹을 오픈소스로 공개하고, SAE 특징을 추론 중 제어, 평가 분석, 데이터 합성, 미세조정 최적화에 활용하는 방법을 제시한다.
대규모 언어 모델(LLM)의 내부 의사결정 과정은 불투명하여 검사, 제어, 체계적 개선이 어렵다. 기계적 해석성 연구에서 SAE가 유망하지만, 대부분 사후 분석에 그치고 실제 모델 개발 워크플로에 통합된 사례는 드물다.
Qwen3 및 Qwen3.5 시리즈의 7개 모델 변종(밀집 및 MoE)에 대해 SAE를 훈련하여 14개 그룹의 SAE를 구축한다. 이 SAE 특징을 네 가지 개발 방향에 활용한다: (i) 추론 중 제어: 특징 방향을 조정하여 언어, 개념, 선호도를 조작; (ii) 평가 분석: 활성화된 특징을 통해 벤치마크 중복성 및 능력 커버리지 분석; (iii) 데이터 중심 워크플로: 다국어 독성 분류 및 안전 데이터 합성; (iv) 사후 훈련 최적화: SAE 신호를 SFT 및 RL 목표에 통합하여 코드 스위칭, 반복 등 바람직하지 않은 행동 완화.
SAE가 단순한 사후 분석 도구를 넘어 LLM 진단, 제어, 평가, 개선을 위한 재사용 가능한 표현 수준 인터페이스가 될 수 있음을 입증했다. Qwen-Scope를 오픈소스로 공개하여 기계적 해석성 연구와 실용적 워크플로를 가속화한다.