Skip to content

詞彙對照表

英文中文說明
Activation激活值神經網路中每一層的輸出值
Attention注意力機制Transformer 的核心,讓模型關注序列中不同位置
Backward Pass反向傳播計算梯度(損失對參數的偏導數)
Batch批次一次訓練中同時處理的多個樣本
Bias偏置線性層的偏移項
Causal Mask因果遮罩確保注意力只關注過去位置(用於語言模型)
Channels通道數隱藏層維度,C
Cross-entropy Loss交叉熵損失分類任務常用的損失函數
CUDA KernelCUDA 核心函式在 GPU 上執行的函式
Embedding嵌入層將離散 token 映射到連續向量空間
Forward Pass前向傳播輸入經過網路計算輸出的過程
GeLU高斯誤差線性單元Transformer 常用的激活函數
Gradient Accumulation梯度累積多個 micro-batch 累加梯度後一次更新
Gradient Clipping梯度裁剪限制梯度範數防止爆炸
Head Size注意力頭維度hs = C / NH
Kernel Fusion核心融合合併多個 kernel 減少記憶體往返
LayerNorm層歸一化對每個樣本的通道維度做歸一化
Logits原始輸出softmax 之前的未歸一化分數
MFU (Model Flops Utilization)模型算力利用率實際算力 / 理論峰值算力
Padded Vocab Size填充詞彙量填充後對齊記憶體的詞彙量
Position Embedding位置嵌入編碼 token 位置資訊的向量
Residual Connection殘差連接繞過層的跳躍連接,防止梯度消失
Softmax軟最大化將 logits 轉化為機率分佈
Tensor張量多維陣列
Token詞元文字的最小單元
Transformer BlockTransformer 區塊自注意力 + 前饋網路的組合
Vocab Size詞彙量tokenizer 的詞彙總數
Warp執行束32 個 thread 的執行單元
Weight Decay權重衰減L2 正則化的一種形式
ZeRO零冗餘優化器分散式訓練中切分狀態以節省記憶體