Skip to content

延伸資源

論文

主題論文連結
Scaling LawsScaling Laws for Neural Language Models (Kaplan et al.)arXiv:2001.08361
ChinchillaTraining Compute-Optimal Large Language Models (Hoffmann et al.)arXiv:2203.15556
Muon OptimizerMuon: An Optimizer for Matrix Parameters (Jordan)Blog
Polar ExpressPolar Express: Faster Orthogonalization (Amsel et al.)arXiv:2505.16932
NorMuonVariance-Reduced Muon (Jordan)arXiv:2510.05491
DCLM / COREDataComp-LM (DCLM)arXiv:2406.11794
Flash Attention 3FlashAttention-3: Fast and Accurate Attention (Shah et al.)arXiv:2407.08608
GQAGQA: Training Generalized Multi-Query Transformer (Ainslie et al.)arXiv:2305.13245
DPODirect Preference Optimization (Rafailov et al.)arXiv:2305.18290
GRPODeepSeek-R1 (DeepSeek-AI)arXiv:2501.12948
μPTensor Programs V (Yang et al.)arXiv:2203.03466
Power LinesPower Law Scaling (Porian et al.)arXiv:2505.13738
T_epochThe Road to Reproducibility (Andriushchenko et al.)arXiv:2405.13698

相關專案

  • nanoGPT — Karpathy 的原始 GPT 訓練專案(pre-training only)
  • modded-nanogpt — nanoGPT 的改良競賽版,nanochat 的前身靈感來源
  • torchtitan — PyTorch 官方的 LLM 訓練參考實作
  • LLM 360 — 完全開源的 LLM 訓練框架

Karpathy 的 nanochat 討論串

工具