한줄 요약
파이토치로 트랜스포머 LLM을 처음부터 구현하고 사전학습부터 정렬(alignment)까지 전 과정을 다루는 교육용 프레임워크.
핵심 기능
트랜스포머 모델을 PyTorch로 직접 구현 (Attention is All You Need 기반)
Pile 데이터셋을 사용한 사전학습 지원
SFT, Reward Model, PPO, DPO, GRPO 등 정렬 알고리즘을 순수 PyTorch로 구현
단일 GPU에서 수백만~수십억 파라미터 모델 학습 가능
DDP + bf16 멀티 GPU 학습 지원
실제 공개 데이터셋(Alpaca, Dolly, HH-RLHF, UltraFeedback, GSM8K) 활용
언제 쓰나
LLM의 내부 동작 원리를 학습하고 싶을 때
사전학습부터 정렬까지 전체 파이프라인을 직접 구현해보고 싶을 때
기존 라이브러리(trl, peft, transformers) 의존 없이 순수 PyTorch로 실험하고 싶을 때