Skip to content

詞彙對照表

英文中文說明
Autograd / Automatic Differentiation自動微分透過 chain rule 自動計算導數的技術
Backpropagation反向傳播從 loss 向各參數傳播梯度的過程
Block Size區塊大小注意力機制的最大上下文視窗長度
Causal Attention因果注意力防止模型看到未來 token 的注意力遮罩
Computation Graph計算圖記錄所有運算節點與依賴關係的有向無環圖
Cross-Entropy Loss交叉熵損失衡量預測分佈與真實分佈差異的損失函式
Embedding嵌入將離散符號映射到連續向量空間的表示
Feed-Forward Network (FFN)前饋神經網路Transformer 區塊中的兩層 MLP
Gradient梯度損失函式對參數的偏導數
Head Dimension頭維度每個注意力頭的向量維度
Inference推論訓練完成後使用模型生成新內容
Learning Rate學習率參數更新的步長
Logits原始分數softmax 之前的未歸一化輸出
Momentum動量Adam 優化器中累積梯度方向的緩衝機制
Multi-Head Attention多頭注意力將注意力拆成多個子空間平行計算
Parameter參數模型透過訓練學習到的權重與偏差
Positional Encoding位置編碼表示 token 在序列中位置的向量
Residual Connection殘差連接將輸入直接加到輸出的捷徑(skip connection)
RMSNorm均方根歸一化使用 RMS 進行歸一化的層歸一化技術
Self-Attention自注意力序列內部各位置間的注意力機制
Softmax軟最大函數將任意實數向量轉換為機率分佈的函式
Temperature溫度控制 softmax 輸出分佈銳利度的超參數
Token權杖 / 標記文字的最小單位(字元、子詞或詞)
Token Embedding權杖嵌入將 token ID 映射為稠密向量的查找表
Tokenizer標記器將文字轉換為 token ID 序列的工具
Transformer變壓器基於注意力機制的神經網路架構
Vocabulary詞彙表所有可能 token 的集合