Appearance
nanochat 閱讀摘要
nanochat 是 Andrej Karpathy 打造的完整 LLM 訓練框架,涵蓋從 tokenizer 訓練、pre-training、supervised fine-tuning (SFT) 到 reinforcement learning (RL / DPO) 的完整 pipeline。設計哲學是「最簡可駭實驗平台」,單一 GPU 節點即可運作。
核心亮點:
- 單一複雜度旋鈕:
--depth(transformer 層數)決定模型大小,其餘超參數自動計算。 - GPT-2 等級模型訓練成本:從 2019 年 $43,000 降至約 $48(8×H100 約 2 小時)。
- 完整三階段訓練:Pre-train(base model)→ SFT(chat model)→ RL(alignment)。
- Muon + AdamW 混合優化器:矩陣參數用 Muon,embeddings/scalars 用 AdamW。
- BPE Tokenizer:支援 HuggingFace 與自製 rustbpe 兩種實作。
檔案結構分為 nanochat/(核心模組)、scripts/(訓練/推論腳本)、tasks/(評估任務)、runs/(執行腳本)。