Skip to content

詞彙對照表

English中文說明
Activation激活值神經網路中每一層的輸出值
Attention注意力機制Transformer 核心機制,計算 token 間的相關性
Autoregressive自迴歸根據已生成的 token 預測下一個 token 的生成方式
Backward pass反向傳播訓練時計算梯度的過程
Batch size批次大小每次訓練迭代使用的樣本數
BOS (Beginning of Sequence)序列起始標記標記序列開始的特殊 token
BPE (Byte Pair Encoding)位元組對編碼一種次詞分詞演算法
Cache快取暫存資料以加速後續存取
Checkpoint檢查點模型權重的儲存檔案
Classifier分類器將隱藏狀態映射到詞彙表機率的線性層
Decode解碼將 token ID 轉換回文字字串
Dimension維度隱藏層的通道數
DDP (Distributed Data Parallel)分散式資料平行多 GPU 訓練的平行化策略
Embedding嵌入將離散的 token ID 映射到連續向量空間
EOS (End of Sequence)序列結束標記標記序列結束的特殊 token
FFN (Feed-Forward Network)前饋神經網路Transformer 中的 MLP 層
Flash Attention快閃注意力高效注意力實作,減少記憶體讀寫
Forward pass前向傳播推理時計算輸出的過程
GQA (Grouped Query Attention)分組查詢注意力多個 Q head 共享同一組 KV head 的注意力變體
Gradient accumulation梯度累積多個微批次梯度加總以模擬更大批次
Greedy decoding貪婪解碼每次選取機率最高的 token
Head注意力機制中的一個注意力計算單元
Head size頭維度每個注意力頭的通道數 (dim / n_heads)
Inference推理使用訓練好的模型進行預測
KV CacheKV 快取快取歷史 Key/Value 向量以加速自迴歸生成
LayerTransformer 中的一個區塊(Attention + FFN)
Linear layer線性層全連接層,y = xW^T
Logits原始輸出softmax 之前的未歸一化分數
Matmul矩陣乘法矩陣-向量或矩陣-矩陣乘法
MFU (Model Flops Utilization)模型算力利用率實際計算量與理論峰值的比值
MHA (Multi-Head Attention)多頭注意力多個注意力頭並行計算後拼接
MLP (Multi-Layer Perceptron)多層感知機多層全連接網路
mmap (Memory Map)記憶體映射將檔案映射到記憶體的 I/O 方式
MQA (Multi-Query Attention)多查詢注意力所有 Q head 共享同一組 KV 的注意力
Nucleus sampling核心採樣從累積機率達 p 的最小 token 集合採樣
Pretokenize前分詞預先將資料集轉換為 token ID
PRNG (Pseudo-Random Number Generator)偽隨機數產生器用於採樣的隨機數演算法
Quantization量化降低權重精度以減少儲存和加速計算
Residual connection殘差連接將層輸入加到輸出,x = x + layer(x)
RMSNorm均方根歸一化基於均方根的層歸一化方法
RoPE旋轉位置編碼透過旋轉矩陣注入位置資訊的編碼方式
RNG (Random Number Generator)隨機數產生器產生隨機數的函數
Sampling採樣根據機率分布選取下一個 token 的策略
SentencePiece句子片語Google 開發的語言無關分詞器
SiLU / SwishSiLU 激活函數x * sigmoid(x)
Softmax軟最大化將向量正規化為機率分布:exp(x_i) / sum(exp(x_j))
SwiGLUSwiGLU 激活SiLU(w1(x)) * w3(x) 的門控線性單元
Temperature溫度控制 softmax 分布平滑度的超參數
Token符記文字的最小處理單元(詞/次詞/字元)
Tokenizer分詞器文字與 token ID 間的轉換器
Top-p samplingTop-p 採樣同 Nucleus sampling
Transformer轉換器基於注意力機制的神經網路架構
Weight tying權重綁定嵌入層與輸出層共享權重
Weights權重神經網路的可學習參數
xorshift異或移位一種高效的偽隨機數產生演算法