Appearance
延伸資源
論文
| 主題 | 論文 | 連結 |
|---|---|---|
| Scaling Laws | Scaling Laws for Neural Language Models (Kaplan et al.) | arXiv:2001.08361 |
| Chinchilla | Training Compute-Optimal Large Language Models (Hoffmann et al.) | arXiv:2203.15556 |
| Muon Optimizer | Muon: An Optimizer for Matrix Parameters (Jordan) | Blog |
| Polar Express | Polar Express: Faster Orthogonalization (Amsel et al.) | arXiv:2505.16932 |
| NorMuon | Variance-Reduced Muon (Jordan) | arXiv:2510.05491 |
| DCLM / CORE | DataComp-LM (DCLM) | arXiv:2406.11794 |
| Flash Attention 3 | FlashAttention-3: Fast and Accurate Attention (Shah et al.) | arXiv:2407.08608 |
| GQA | GQA: Training Generalized Multi-Query Transformer (Ainslie et al.) | arXiv:2305.13245 |
| DPO | Direct Preference Optimization (Rafailov et al.) | arXiv:2305.18290 |
| GRPO | DeepSeek-R1 (DeepSeek-AI) | arXiv:2501.12948 |
| μP | Tensor Programs V (Yang et al.) | arXiv:2203.03466 |
| Power Lines | Power Law Scaling (Porian et al.) | arXiv:2505.13738 |
| T_epoch | The Road to Reproducibility (Andriushchenko et al.) | arXiv:2405.13698 |
相關專案
- nanoGPT — Karpathy 的原始 GPT 訓練專案(pre-training only)
- modded-nanogpt — nanoGPT 的改良競賽版,nanochat 的前身靈感來源
- torchtitan — PyTorch 官方的 LLM 訓練參考實作
- LLM 360 — 完全開源的 LLM 訓練框架
Karpathy 的 nanochat 討論串
- Beating GPT-2 for <<$100 — 2026/2 的關鍵路線圖
- Jan 7 miniseries v1 — 第一個 miniseries 文件
- 原 nanochat 介紹 — 2025/10 原始發表
- Counting r in strawberry — 如何新增能力
- Infusing identity — 客製化個性
工具
- DeepWiki(nanochat) — AI 驅動的程式碼問答
- Lambda GPU Cloud — Karpathy 推薦的 GPU 租用服務