Skip to content

nanochat 閱讀摘要

nanochat 是 Andrej Karpathy 打造的完整 LLM 訓練框架,涵蓋從 tokenizer 訓練、pre-training、supervised fine-tuning (SFT) 到 reinforcement learning (RL / DPO) 的完整 pipeline。設計哲學是「最簡可駭實驗平台」,單一 GPU 節點即可運作。

核心亮點:

  • 單一複雜度旋鈕--depth(transformer 層數)決定模型大小,其餘超參數自動計算。
  • GPT-2 等級模型訓練成本:從 2019 年 $43,000 降至約 $48(8×H100 約 2 小時)。
  • 完整三階段訓練:Pre-train(base model)→ SFT(chat model)→ RL(alignment)。
  • Muon + AdamW 混合優化器:矩陣參數用 Muon,embeddings/scalars 用 AdamW。
  • BPE Tokenizer:支援 HuggingFace 與自製 rustbpe 兩種實作。

檔案結構分為 nanochat/(核心模組)、scripts/(訓練/推論腳本)、tasks/(評估任務)、runs/(執行腳本)。