Skip to content

詞彙對照表

英文中文說明
Pretraining預訓練在大規模無標註文字上訓練 LLM 的初始階段
Supervised Fine-Tuning (SFT)監督式微調使用標註對話資料進一步訓練
Reinforcement Learning (RL)強化學習透過獎勵信號優化模型行為
Direct Preference Optimization (DPO)直接偏好優化無需 reward model 的 alignment 方法
GRPO群組相對策略優化DeepSeek 提出的無 critic 的 RL 方法
BPE TokenizerBPE 分詞器Byte-Pair Encoding 詞彙分割演算法
Rotary Embedding (RoPE)旋轉位置編碼透過旋轉矩陣編碼相對位置的機制
Group-Query Attention (GQA)分組查詢注意力多個 query head 共享 KV head 的注意力變體
Flash Attention快閃注意力透過 tiling 減少 memory I/O 的高效注意力實作
MuonMuon 優化器結合 momentum + 正交化的矩陣優化器
Scaling Laws規模法則描述模型/資料/計算量之間關係的冪律
Bits Per Byte (BPB)每字節位元數與詞彙量無關的語言模型損失衡量
MFU (Model FLOPS Utilization)模型 FLOPS 利用率實際計算量與理論峰值的比值
CORE MetricCORE 指標DCLM 論文的綜合模型評估分數
BOS-alignedBOS 對齊每個訓練序列以 BOS token 開頭的打包策略
Sliding Window Attention滑動窗注意力限制 attention 範圍為固定視窗大小
KV CacheKV 快取推論時儲存已計算的 Key/Value 以加速生成
Gradient Accumulation梯度累積多個 micro-batch 累積梯度後再更新參數
MFU模型 FLOPS 利用率實際 FLOPS / 理論峰值 FLOPS
ZeRO-2ZeRO 第二階段切分優化器狀態到各 GPU 的記憶體節省技術
ResFormer / Value Residual值殘差將 token embedding 混合到 value 中的機制
Best-fit Packing最佳適配打包從 buffer 挑選最適尺寸文件的資料打包演算法
Softcap軟上限用 tanh 將 logits 限制在 [-softcap, softcap] 範圍
Muon Polar Express極坐標快速法計算梯度矩陣最接近正交矩陣的迭代方法
GrAdScaler梯度縮放器fp16 訓練中防止梯度下溢的動態縮放機制