VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small LLMs
VibeThinker-3B는 3B 파라미터의 소형 모델로, AIME26 94.3점, LiveCodeBench v6 80.2% 등 대형 모델에 필적하는 검증 추론 성능을 달성했다. 파라미터 압축-커버리지 가설을 제안하며 소형 모델이 추론 영역에서 최전선 성능을 낼 수 있음을 보였다.
VibeThinker-3B는 3B 파라미터의 소형 밀집 모델로, 검증 가능한 추론(verifiable reasoning) 작업에서 대형 모델에 필적하는 성능을 달성했다. AIME26에서 94.3점, LiveCodeBench v6에서 80.2% Pass@1, 최근 LeetCode 대회에서 96.1%의 승인률을 기록했다. 또한 IFEval 93.4점으로 명령 제어 능력도 유지했다.
기존에는 추론 능력이 대형 모델의 전유물로 여겨졌으나, VibeThinker-3B는 소형 모델도 적절한 훈련 파이프라인(커리큘럼 기반 지도 미세조정, 다영역 강화학습, 오프라인 자기 증류)을 통해 최전선 성능에 도달할 수 있음을 보였다. 이는 이전 1.5B 모델 연구를 확장한 결과다.
파라미터 압축-커버리지 가설(Parametric Compression-Coverage Hypothesis)을 제안: 검증 가능 추론은 소수의 추론 코어로 압축 가능하지만, 개방형 지식과 일반 능력은 광범위한 파라미터 커버리지가 필요하다. 이는 소형 모델이 단순히 배포 효율적인 대안이 아니라, 특정 영역에서 최전선 성능을 낼 수 있는 보완적 경로임을 시사한다.