Appearance
詞彙對照表
| 英文 | 中文 | 說明 |
|---|---|---|
| Autograd / Automatic Differentiation | 自動微分 | 透過 chain rule 自動計算導數的技術 |
| Backpropagation | 反向傳播 | 從 loss 向各參數傳播梯度的過程 |
| Block Size | 區塊大小 | 注意力機制的最大上下文視窗長度 |
| Causal Attention | 因果注意力 | 防止模型看到未來 token 的注意力遮罩 |
| Computation Graph | 計算圖 | 記錄所有運算節點與依賴關係的有向無環圖 |
| Cross-Entropy Loss | 交叉熵損失 | 衡量預測分佈與真實分佈差異的損失函式 |
| Embedding | 嵌入 | 將離散符號映射到連續向量空間的表示 |
| Feed-Forward Network (FFN) | 前饋神經網路 | Transformer 區塊中的兩層 MLP |
| Gradient | 梯度 | 損失函式對參數的偏導數 |
| Head Dimension | 頭維度 | 每個注意力頭的向量維度 |
| Inference | 推論 | 訓練完成後使用模型生成新內容 |
| Learning Rate | 學習率 | 參數更新的步長 |
| Logits | 原始分數 | softmax 之前的未歸一化輸出 |
| Momentum | 動量 | Adam 優化器中累積梯度方向的緩衝機制 |
| Multi-Head Attention | 多頭注意力 | 將注意力拆成多個子空間平行計算 |
| Parameter | 參數 | 模型透過訓練學習到的權重與偏差 |
| Positional Encoding | 位置編碼 | 表示 token 在序列中位置的向量 |
| Residual Connection | 殘差連接 | 將輸入直接加到輸出的捷徑(skip connection) |
| RMSNorm | 均方根歸一化 | 使用 RMS 進行歸一化的層歸一化技術 |
| Self-Attention | 自注意力 | 序列內部各位置間的注意力機制 |
| Softmax | 軟最大函數 | 將任意實數向量轉換為機率分佈的函式 |
| Temperature | 溫度 | 控制 softmax 輸出分佈銳利度的超參數 |
| Token | 權杖 / 標記 | 文字的最小單位(字元、子詞或詞) |
| Token Embedding | 權杖嵌入 | 將 token ID 映射為稠密向量的查找表 |
| Tokenizer | 標記器 | 將文字轉換為 token ID 序列的工具 |
| Transformer | 變壓器 | 基於注意力機制的神經網路架構 |
| Vocabulary | 詞彙表 | 所有可能 token 的集合 |