Appearance
詞彙對照表
| 英文 | 中文 | 說明 |
|---|---|---|
| Pretraining | 預訓練 | 在大規模無標註文字上訓練 LLM 的初始階段 |
| Supervised Fine-Tuning (SFT) | 監督式微調 | 使用標註對話資料進一步訓練 |
| Reinforcement Learning (RL) | 強化學習 | 透過獎勵信號優化模型行為 |
| Direct Preference Optimization (DPO) | 直接偏好優化 | 無需 reward model 的 alignment 方法 |
| GRPO | 群組相對策略優化 | DeepSeek 提出的無 critic 的 RL 方法 |
| BPE Tokenizer | BPE 分詞器 | Byte-Pair Encoding 詞彙分割演算法 |
| Rotary Embedding (RoPE) | 旋轉位置編碼 | 透過旋轉矩陣編碼相對位置的機制 |
| Group-Query Attention (GQA) | 分組查詢注意力 | 多個 query head 共享 KV head 的注意力變體 |
| Flash Attention | 快閃注意力 | 透過 tiling 減少 memory I/O 的高效注意力實作 |
| Muon | Muon 優化器 | 結合 momentum + 正交化的矩陣優化器 |
| Scaling Laws | 規模法則 | 描述模型/資料/計算量之間關係的冪律 |
| Bits Per Byte (BPB) | 每字節位元數 | 與詞彙量無關的語言模型損失衡量 |
| MFU (Model FLOPS Utilization) | 模型 FLOPS 利用率 | 實際計算量與理論峰值的比值 |
| CORE Metric | CORE 指標 | DCLM 論文的綜合模型評估分數 |
| BOS-aligned | BOS 對齊 | 每個訓練序列以 BOS token 開頭的打包策略 |
| Sliding Window Attention | 滑動窗注意力 | 限制 attention 範圍為固定視窗大小 |
| KV Cache | KV 快取 | 推論時儲存已計算的 Key/Value 以加速生成 |
| Gradient Accumulation | 梯度累積 | 多個 micro-batch 累積梯度後再更新參數 |
| MFU | 模型 FLOPS 利用率 | 實際 FLOPS / 理論峰值 FLOPS |
| ZeRO-2 | ZeRO 第二階段 | 切分優化器狀態到各 GPU 的記憶體節省技術 |
| ResFormer / Value Residual | 值殘差 | 將 token embedding 混合到 value 中的機制 |
| Best-fit Packing | 最佳適配打包 | 從 buffer 挑選最適尺寸文件的資料打包演算法 |
| Softcap | 軟上限 | 用 tanh 將 logits 限制在 [-softcap, softcap] 範圍 |
| Muon Polar Express | 極坐標快速法 | 計算梯度矩陣最接近正交矩陣的迭代方法 |
| GrAdScaler | 梯度縮放器 | fp16 訓練中防止梯度下溢的動態縮放機制 |