Skip to content

nanochat 學習索引 ​

Andrej Karpathy 的完整 LLM 訓練框架——從 tokenizer 到聊天 UI。

學習目標摘要 ​

  • 掌握完整 LLM 訓練流程:Tokenizer → Pretraining → SFT → DPO/RLHF
  • 了解如何用最少預算跑通一個 ChatGPT 級別的訓練管線
  • 理解 Alignment(對齊)的核心方法論

前置知識 ​

  • microgpt 階段的 Transformer 實作基礎
  • Python 程式能力與命令列操作
  • 基本的機器學習概念(損失函數、學習率、Epoch)

關鍵概念 ​

  • Tokenizer:文字 ↔ token 的轉換(BPE 演算法)
  • Pretraining:無監督的語言模型預訓練
  • SFT(Supervised Fine-Tuning):用指令-回答對微調模型
  • DPO / RLHF:基於人類回饋的對齊訓練
  • Chat Template:對話格式化與系統提示詞

閱讀筆記 ​

翻譯 ​

原始碼 ​