外观
Token 与 Embedding 分别是什么?
3 分钟速学卡
30 秒口述: Token 是 Tokenizer 按词表和规则把文本切分后的离散单元,模型实际接收的是对应的 Token ID。Embedding 是把离散 ID 映射成连续稠密向量,使模型能够在向量空间中计算语义和上下文关系。二者必须绑定具体 Tokenizer、词表和模型版本;字符数不等于 Token 数,静态输入 Embedding 也不等于最终上下文化表示。
- 本质: Token 把文本变成离散编号,Embedding 再把编号变成模型可计算的连续向量。
- 核心机制: Token 边界由具体 Tokenizer 和词表决定;Embedding 是查表得到的连续表示。
- 关键判断: 上下文化表示不等于初始 Embedding;生产中必须绑定模型、词表和 Tokenizer 版本。
- 项目落地: 示例项目:网关做长度准入时应调用目标模型对应 Tokenizer,而不是按字符估算。模型或 Tokenizer 升级要回放中英文、代码、数字、特殊字符和超长文本,记录 Token 数分布、截断位置和特殊 Token。
- 边界与坑: “一个 Token 就是一个字或单词”:切分依语言、词表和上下文字符组合;“Embedding 就是语义”:它是学习到的向量表示,语义需结合训练目标和上下文解释。
目录
面试官为什么问
这道题考输入管道、维度意识和版本边界。候选人如果把 Token 当成“单词”、把 Embedding 当成固定语义答案,通常无法排查长度、乱码、索引错位和模型切换问题。
小白先看懂
仓库先把一段地址拆成标准零件并贴编号,再从货架取出每个编号对应的多维说明卡。零件对应 Token,编号对应 Token ID,说明卡对应 Embedding。说明卡进入后续流水线后还会结合前后零件不断更新,形成上下文化表示。
类比没有体现子词算法、特殊 Token、位置编码和模型训练;“相近向量”也不保证词在所有上下文中同义。
图:教学图片|Token 与 Embedding 分别是什么?
替代文本: 16:9 中文教学信息图,地址包裹被拆成标准零件、贴 ID、从向量货架取说明卡,最后进入上下文流水线。

读图结论: Token 是离散单元,Embedding 是连续表示。两者必须绑定模型版本。
这张图片用于展示文字从 Token 到向量表示的转换链。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:文本进入模型的表示链
替代文本: 原始文本经过规范化与 Tokenizer 切成 Token,再查词表得到 Token ID,Embedding 表将 ID 映射为向量,随后模型层结合上下文形成动态表示。
图表加载中…
读图结论: Token 解决离散切分和编号,Embedding 解决连续表示;模型真正建模的是经过上下文化的向量序列。
核心原理
给定词表大小 (V)、隐藏维度 (d),Embedding 矩阵为 (E\in\mathbb{R}^{V\times d})。Token ID (i) 的输入表示是矩阵第 (i) 行 (E_i)。Tokenizer 可能采用 BPE、WordPiece 或 Unigram 等方案,切分结果依词表和实现版本变化。
Token 数影响上下文窗口、延迟和费用;Embedding 维度影响参数量和表示能力。输入 Embedding、用于检索的句向量和 Transformer 中间层表示用途不同,不能混用。
项目和生产视角
示例项目: 网关做长度准入时应调用目标模型对应 Tokenizer,而不是按字符估算。模型或 Tokenizer 升级要回放中英文、代码、数字、特殊字符和超长文本,记录 Token 数分布、截断位置和特殊 Token。
生产故障常见于 Tokenizer 与模型制品不匹配、Unicode 规范化不同、截断吞掉关键尾部。应记录模型、词表、Tokenizer 哈希与实际 Token 数;本文没有真实事故数据。
常见错误回答
- “一个 Token 就是一个字或单词”:切分依语言、词表和上下文字符组合。
- “Embedding 就是语义”:它是学习到的向量表示,语义需结合训练目标和上下文解释。
- “字符数可直接换算 Token 数”:只能在固定数据分布下近似估计。
- “换模型只替换权重”:Tokenizer 和特殊 Token 契约也必须一致。
递进追问
- BPE 如何构建子词词表?
- 为什么同一句话换模型后 Token 数会变化?
- 输入 Embedding 与句向量有什么区别?
- 特殊 Token 在训练和推理中承担什么职责?
- Tokenizer 版本错配如何被测试发现?
关联阅读
总结
一句话记忆: Token 把文本变成离散编号,Embedding 再把编号变成模型可计算的连续向量。
- Token 边界由具体 Tokenizer 和词表决定。
- Embedding 是查表得到的连续表示。
- 上下文化表示不等于初始 Embedding。
- 生产中必须绑定模型、词表和 Tokenizer 版本。