Appearance
詞彙對照表
| English | 中文 | 說明 |
|---|---|---|
| Activation | 激活值 | 神經網路中每一層的輸出值 |
| Attention | 注意力機制 | Transformer 核心機制,計算 token 間的相關性 |
| Autoregressive | 自迴歸 | 根據已生成的 token 預測下一個 token 的生成方式 |
| Backward pass | 反向傳播 | 訓練時計算梯度的過程 |
| Batch size | 批次大小 | 每次訓練迭代使用的樣本數 |
| BOS (Beginning of Sequence) | 序列起始標記 | 標記序列開始的特殊 token |
| BPE (Byte Pair Encoding) | 位元組對編碼 | 一種次詞分詞演算法 |
| Cache | 快取 | 暫存資料以加速後續存取 |
| Checkpoint | 檢查點 | 模型權重的儲存檔案 |
| Classifier | 分類器 | 將隱藏狀態映射到詞彙表機率的線性層 |
| Decode | 解碼 | 將 token ID 轉換回文字字串 |
| Dimension | 維度 | 隱藏層的通道數 |
| DDP (Distributed Data Parallel) | 分散式資料平行 | 多 GPU 訓練的平行化策略 |
| Embedding | 嵌入 | 將離散的 token ID 映射到連續向量空間 |
| EOS (End of Sequence) | 序列結束標記 | 標記序列結束的特殊 token |
| FFN (Feed-Forward Network) | 前饋神經網路 | Transformer 中的 MLP 層 |
| Flash Attention | 快閃注意力 | 高效注意力實作,減少記憶體讀寫 |
| Forward pass | 前向傳播 | 推理時計算輸出的過程 |
| GQA (Grouped Query Attention) | 分組查詢注意力 | 多個 Q head 共享同一組 KV head 的注意力變體 |
| Gradient accumulation | 梯度累積 | 多個微批次梯度加總以模擬更大批次 |
| Greedy decoding | 貪婪解碼 | 每次選取機率最高的 token |
| Head | 頭 | 注意力機制中的一個注意力計算單元 |
| Head size | 頭維度 | 每個注意力頭的通道數 (dim / n_heads) |
| Inference | 推理 | 使用訓練好的模型進行預測 |
| KV Cache | KV 快取 | 快取歷史 Key/Value 向量以加速自迴歸生成 |
| Layer | 層 | Transformer 中的一個區塊(Attention + FFN) |
| Linear layer | 線性層 | 全連接層,y = xW^T |
| Logits | 原始輸出 | softmax 之前的未歸一化分數 |
| Matmul | 矩陣乘法 | 矩陣-向量或矩陣-矩陣乘法 |
| MFU (Model Flops Utilization) | 模型算力利用率 | 實際計算量與理論峰值的比值 |
| MHA (Multi-Head Attention) | 多頭注意力 | 多個注意力頭並行計算後拼接 |
| MLP (Multi-Layer Perceptron) | 多層感知機 | 多層全連接網路 |
| mmap (Memory Map) | 記憶體映射 | 將檔案映射到記憶體的 I/O 方式 |
| MQA (Multi-Query Attention) | 多查詢注意力 | 所有 Q head 共享同一組 KV 的注意力 |
| Nucleus sampling | 核心採樣 | 從累積機率達 p 的最小 token 集合採樣 |
| Pretokenize | 前分詞 | 預先將資料集轉換為 token ID |
| PRNG (Pseudo-Random Number Generator) | 偽隨機數產生器 | 用於採樣的隨機數演算法 |
| Quantization | 量化 | 降低權重精度以減少儲存和加速計算 |
| Residual connection | 殘差連接 | 將層輸入加到輸出,x = x + layer(x) |
| RMSNorm | 均方根歸一化 | 基於均方根的層歸一化方法 |
| RoPE | 旋轉位置編碼 | 透過旋轉矩陣注入位置資訊的編碼方式 |
| RNG (Random Number Generator) | 隨機數產生器 | 產生隨機數的函數 |
| Sampling | 採樣 | 根據機率分布選取下一個 token 的策略 |
| SentencePiece | 句子片語 | Google 開發的語言無關分詞器 |
| SiLU / Swish | SiLU 激活函數 | x * sigmoid(x) |
| Softmax | 軟最大化 | 將向量正規化為機率分布:exp(x_i) / sum(exp(x_j)) |
| SwiGLU | SwiGLU 激活 | SiLU(w1(x)) * w3(x) 的門控線性單元 |
| Temperature | 溫度 | 控制 softmax 分布平滑度的超參數 |
| Token | 符記 | 文字的最小處理單元(詞/次詞/字元) |
| Tokenizer | 分詞器 | 文字與 token ID 間的轉換器 |
| Top-p sampling | Top-p 採樣 | 同 Nucleus sampling |
| Transformer | 轉換器 | 基於注意力機制的神經網路架構 |
| Weight tying | 權重綁定 | 嵌入層與輸出層共享權重 |
| Weights | 權重 | 神經網路的可學習參數 |
| xorshift | 異或移位 | 一種高效的偽隨機數產生演算法 |