Skip to content

microgpt 學習導覽 ​

microgpt — 200 行的純 Python GPT 實作,由 Andrej Karpathy 創作。

學習目標摘要 ​

  • 用純 Python(無 PyTorch)從零實現 GPT 架構
  • 理解 Self-Attention、Multi-Head Attention、Position Embedding 的運作方式
  • 掌握 Transformer 的完整前向傳播流程

前置知識 ​

  • micrograd 階段的自動微分基礎
  • Python 與 PyTorch 基本操作
  • 矩陣運算與 softmax 概念

關鍵概念 ​

  • Self-Attention:每個 token 對其他 token 計算注意力權重
  • Multi-Head Attention:多組注意力並行學習不同表示
  • Position Embedding:為序列中的位置編碼
  • Transformer Block:Attention + FFN + LayerNorm + 殘差連接

學習路徑 ​

建議從上到下依序閱讀:

1. 先讀原始碼 ​

2. 再讀筆記 ​

3. 深入理解 ​

4. 動手實驗 ​

5. 延伸學習 ​

6. 翻譯版本 ​

學習建議 ​

  1. 先直接執行 original/microgpt.py 看它跑出什麼
  2. 打開原始碼,對照 microgpt-05-程式碼逐行解讀 逐一閱讀
  3. 修改超參數(n_embd, n_layer, learning_rate),觀察變化
  4. 試著將資料集換成其他文字資料
  5. 比較 microgpt 與 assets/nanoGPT 結構比較 的差異

相關系列 ​