Skip to content

附录 A 术语总表

附录 A | 上一章:第 10 章 生态对比 | 下一章:附录 B 结构体速查

这份术语表把全书(第 1-10 章)出现的术语按类别整理。 读其他章节遇到不懂的词,来这里查。 每个术语都标了英文 / 全称,方便对照 HuggingFace 文档和论文。


目录


A.1 模型结构术语

术语英文含义
残差流宽度hidden size / dimtoken 向量长度(Qwen2.5-0.5B 是 896)
MLP 中间宽度intermediate size前馈网络中间层(4864)
层数num layersTransformer 重复次数(24)
head注意力的并行单元
头维度head dim每个头的向量长度(64)
词表大小vocab size认识多少 token(151936)
序列长度seq len最大 token 数(2048)
词嵌入embeddingtoken → 向量的查找表
投影projection矩阵乘法 y = Wx + b
偏置bias投影后加的常数向量
残差连接residualx = x + layer(x),让信息能跳过某些层
前馈网络FFN / MLP每层里「独立思考」的子模块
解码器decoder从左往右逐词生成的 Transformer 部分
自回归autoregressive输出又变成输入,循环生成
参数量parameters所有权重矩阵的元素总数(0.5B ≈ 4.94 亿)
张量tensor多维数组
标量scalar0 维张量(单个数)
向量vector1 维张量(一排数)
矩阵matrix2 维张量(行列网格)
特征维feature dim每个 token 向量的列数(896),与行数(seq_len)无关

A.2 注意力术语

术语英文含义
QueryQ当前 token「找什么」的向量
KeyK每个 token「是什么」的向量
ValueV每个 token 的内容向量
注意力attention让每个词看其他词,决定关注谁
注意力分数attention scoreQ·Kᵀ 算出的相关程度
缩放因子scale(√d)防止点积数值过大,除以 √head_dim
softmax把分数归一化成概率(和为 1)
因果注意力causal attention只看左边不看右边(for t<=pos
GQAGrouped Query Attention多个 Q 头共享 KV(Qwen 是 14 个 Q 头共享 2 个 KV 头)
KV CacheKey-Value Cache缓存历史 K/V 避免重算,把生成复杂度从 O(N²) 降到 O(N)
RoPERotary Position Embedding旋转位置编码,用旋转编码位置信息
rope_thetaRoPE base frequency基频,越大能编码的位置越远(Qwen 是 1e6)
点积dot product两个向量对应位相乘再求和,衡量方向一致性
因果性causality当前 token 只能看到之前的 token

A.3 归一化与激活术语

术语英文含义
归一化normalization把向量拉回标准大小,防止多层累积爆炸
RMSNormRoot Mean Square Norm除以均方根(比 LayerNorm 少一步减均值)
LayerNormLayer Normalization减均值 → 除标准差 → 乘 weight(三步)
epsepsilon防除零的小常数(1e-6)
均方根RMSRoot Mean Square,√(Σx²/n)
SwiGLUSwish-Gated Linear Unit门控前馈网络,silu(gate) × up
siluSigmoid Linear Unitx · sigmoid(x),比 ReLU 平滑
gate门控动态决定哪些通道激活(软门,0 到 1)
ReLURectified Linear Unitmax(0, x),硬门(要么 0 要么原值)
激活函数activation function引入非线性的函数
激活率active ratio超过阈值的通道比例,反映 MLP 稀疏性
范数L2 norm向量的「长度」√(Σx²),日志里用来摘要向量大小

A.4 分词术语

术语英文含义
分词器tokenizer文本和 token id 之间的桥梁
token模型处理的最小单位(一个词 / 一个字 / 一块字节)
token idtoken 在词表里的整数编号
BPEByte-Pair Encoding字节对编码分词,反复合并最高频相邻对
pre-tokenBPE 前先切的文本片段(如按空格切词)
byte-level字节 → unicode 映射(GPT-2 的解法)
mergeBPE 的合并规则
vocabvocabulary词表,所有 token 的集合
BOSBeginning Of Sequence序列起始符
EOSEnd Of Sequence序列结束符(生成时遇到就停)
PADPadding填充符(batch 对齐用)
哈希表hash table用哈希函数加速「字符串 → id」查找
FNV-1a一种简单快速的字符串哈希算法
拉链法chaining哈希冲突时用链表串联的解法
哈希冲突hash collision不同字符串算出同样的哈希值
teacher forcing教师强制prefill 阶段按标准答案走,不采样

A.5 数据格式术语

术语英文含义
safetensorsHuggingFace 的二进制张量格式(安全 + mmap 友好)
dtypedata type张量数据类型
fp32float3232 位标准浮点(符号 1 + 指数 8 + 尾数 23)
bf16bfloat1616 位浮点(符号 1 + 指数 8 + 尾数 7),fp32 砍低 16 位
fp16float1616 位浮点(符号 1 + 指数 5 + 尾数 10),动态范围小
mmapmemory map内存映射文件,访问内存等于读文件
little-endian小端序低位字节存在低地址
headersafetensors 开头的 JSON 元信息表
raw buffersafetensors 头之后的连续二进制张量数据
data_offsets张量在 raw buffer 中的 [start, end) 区间
量化quantization用更少位数近似表示权重(如 int4)
int4 / int84 位 / 8 位整数表示
scale缩放因子量化时把浮点范围压到整数区间的除数

A.6 C 语言 / 工程术语

术语含义
row-major矩阵按行存储(C 默认),W[i*n+j] 是第 i 行第 j 列
strict aliasing严格别名规则,float*uint32_t* 指同一块内存是未定义行为
memcpy内存拷贝,编译器会优化成零开销(绕过 strict aliasing 的标准做法)
递归下降解析器自上而下递归(如 JSON 解析遇到 { 调 parse_object)
RFC互联网标准文档(如 RFC 8259 = JSON 标准)
反转义unescape,把 \" 还原成 "
代理对surrogate pair,UTF-16 用两个 16 位编码表示一个罕见字符
BMPBasic Multilingual Plane,Unicode 基本平面(码点 0-65535)
拉链法哈希冲突用链表串联
FNV-1a一种字符串哈希算法
xorshift一种伪随机数算法(用异或和移位)
PRNGPseudo Random Number Generator,伪随机数生成器
seed种子,PRNG 的初始状态
argmax取最大值的索引
轮盘赌roulette wheel,按概率分布采样
top-k只保留概率最大的 k 个
temperature温度,softmax 前对 logits 缩放的参数
softmax把分数归一化成概率的函数
ANSI 转义码终端颜色控制序列(\033[31m 等)
TTYTeleTYpewriter,终端
isatty判断文件描述符是不是终端
stderr标准错误流(日志走这里)
stdout标准输出流(生成文本走这里)
va_listC 可变参数机制(让 printf("a=%d", a) 工作)
va_start / va_end初始化 / 结束 va_list 遍历
vsnprintfprintf 的 va_list 版本
ASanAddressSanitizer,编译器自带的内存错误检测器
UBSanUndefinedBehaviorSanitizer,未定义行为检测器
sanitizer内存 / 行为检测工具的统称

A.7 生态与性能术语

术语英文含义
推理inference用训练好的模型算出结果(只做前向,不更新权重)
前向传播forward pass从第 1 层算到第 N 层
反向传播backward pass训练时从输出算梯度回传,本项目不做
prefill预填把 prompt 的 KV Cache 全部填满的阶段
decode解码自回归一格一格生成新 token 的阶段
TTFTtime-to-first-token生成第一个 token 的延迟(prefill 开销)
Continuous Batching连续批处理每一步把所有活跃请求拼成一个 batch,GPU 永不空转
PagedAttention分页注意力把 KV Cache 切成固定大小的页按需分配(vLLM 创新)
Prefix Caching前缀缓存缓存相同前缀的 KV Cache,复用算力
RadixAttention基数树注意力SGLang 用基数树缓存前缀,比哈希表缓存更多组合
FlashAttention闪速注意力分块计算 attention,显存从 O(seq²) 降到 O(seq)
Speculative Decoding投机解码小模型猜 + 大模型验证,一次 forward 出多个 token
Tensor Parallelism张量并行把大矩阵按行 / 列切到多卡
Pipeline Parallelism流水线并行按层切到多卡,每卡负责几层
CPU OffloadingCPU 卸载权重放内存,用到哪层搬到哪层
MoEMixture of Experts混合专家,每次只用一部分专家权重
SIMDSingle Instruction Multiple Data单指令多数据,CPU 并行(AVX / NEON)
Tensor CoreGPU 上专门做矩阵乘法的硬件单元
cuBLASNVIDIA 的线性代数库(GPU 版 BLAS)
cuDNNNVIDIA 的深度学习算子库
GGUFllama.cpp 的模型格式(含量化权重)
ggmlllama.cpp 自研的张量计算库
GQAGrouped Query Attention多个 Q 头共享 KV(见 A.2)
MLAMulti-head Latent AttentionDeepSeek 的注意力结构,替代 GQA
All-Gather多卡通信原语,每张卡拿到所有卡的部分结果拼起来
logits最后投影到词表的原始分数(softmax 之前)
reference 实现reference implementation对照基准(本项目用 PyTorch transformers)
top-5 logits分数最高的 5 个 token,用于验证前向传播
tie_word_embeddings输出头复用 embedding 权重(Qwen 是 true,没有 lm_head)

速查:本项目关键数字

数值
参数量494,032,768(≈0.49B,叫「0.5B」)
safetensors 文件大小988 MB(bf16 存储)
fp32 内存占用1.97 GB
dim(特征维)896
hidden_dim(MLP 中间宽)4864
n_layers24
n_heads(Q 头)14
n_kv_heads(KV 头)2
head_dim64
vocab_size151936
seq_len2048
rope_theta1,000,000
rms_eps1e-6
BOS / EOS id151643(`<
速度(CPU fp32)~3 tok/s
速度(vLLM A100 并发)~8000 tok/s

这份术语表是全书(第 1-10 章)的索引。读任何一章遇到不懂的词,先来这里查; 查不到的,去对应章节的正文看详解。

MIT Licensed