Appearance
詞彙對照表
| 英文 | 中文 | 說明 |
|---|---|---|
| Activation | 激活值 | 神經網路中每一層的輸出值 |
| Attention | 注意力機制 | Transformer 的核心,讓模型關注序列中不同位置 |
| Backward Pass | 反向傳播 | 計算梯度(損失對參數的偏導數) |
| Batch | 批次 | 一次訓練中同時處理的多個樣本 |
| Bias | 偏置 | 線性層的偏移項 |
| Causal Mask | 因果遮罩 | 確保注意力只關注過去位置(用於語言模型) |
| Channels | 通道數 | 隱藏層維度,C |
| Cross-entropy Loss | 交叉熵損失 | 分類任務常用的損失函數 |
| CUDA Kernel | CUDA 核心函式 | 在 GPU 上執行的函式 |
| Embedding | 嵌入層 | 將離散 token 映射到連續向量空間 |
| Forward Pass | 前向傳播 | 輸入經過網路計算輸出的過程 |
| GeLU | 高斯誤差線性單元 | Transformer 常用的激活函數 |
| Gradient Accumulation | 梯度累積 | 多個 micro-batch 累加梯度後一次更新 |
| Gradient Clipping | 梯度裁剪 | 限制梯度範數防止爆炸 |
| Head Size | 注意力頭維度 | hs = C / NH |
| Kernel Fusion | 核心融合 | 合併多個 kernel 減少記憶體往返 |
| LayerNorm | 層歸一化 | 對每個樣本的通道維度做歸一化 |
| Logits | 原始輸出 | softmax 之前的未歸一化分數 |
| MFU (Model Flops Utilization) | 模型算力利用率 | 實際算力 / 理論峰值算力 |
| Padded Vocab Size | 填充詞彙量 | 填充後對齊記憶體的詞彙量 |
| Position Embedding | 位置嵌入 | 編碼 token 位置資訊的向量 |
| Residual Connection | 殘差連接 | 繞過層的跳躍連接,防止梯度消失 |
| Softmax | 軟最大化 | 將 logits 轉化為機率分佈 |
| Tensor | 張量 | 多維陣列 |
| Token | 詞元 | 文字的最小單元 |
| Transformer Block | Transformer 區塊 | 自注意力 + 前饋網路的組合 |
| Vocab Size | 詞彙量 | tokenizer 的詞彙總數 |
| Warp | 執行束 | 32 個 thread 的執行單元 |
| Weight Decay | 權重衰減 | L2 正則化的一種形式 |
| ZeRO | 零冗餘優化器 | 分散式訓練中切分狀態以節省記憶體 |