Skip to content

Token 与 Embedding 分别是什么?

3 分钟速学卡

30 秒口述: Token 是 Tokenizer 按词表和规则把文本切分后的离散单元,模型实际接收的是对应的 Token ID。Embedding 是把离散 ID 映射成连续稠密向量,使模型能够在向量空间中计算语义和上下文关系。二者必须绑定具体 Tokenizer、词表和模型版本;字符数不等于 Token 数,静态输入 Embedding 也不等于最终上下文化表示。

  • 本质: Token 把文本变成离散编号,Embedding 再把编号变成模型可计算的连续向量。
  • 核心机制: Token 边界由具体 Tokenizer 和词表决定;Embedding 是查表得到的连续表示。
  • 关键判断: 上下文化表示不等于初始 Embedding;生产中必须绑定模型、词表和 Tokenizer 版本。
  • 项目落地: 示例项目:网关做长度准入时应调用目标模型对应 Tokenizer,而不是按字符估算。模型或 Tokenizer 升级要回放中英文、代码、数字、特殊字符和超长文本,记录 Token 数分布、截断位置和特殊 Token。
  • 边界与坑: “一个 Token 就是一个字或单词”:切分依语言、词表和上下文字符组合;“Embedding 就是语义”:它是学习到的向量表示,语义需结合训练目标和上下文解释。

目录

面试官为什么问

这道题考输入管道、维度意识和版本边界。候选人如果把 Token 当成“单词”、把 Embedding 当成固定语义答案,通常无法排查长度、乱码、索引错位和模型切换问题。

小白先看懂

仓库先把一段地址拆成标准零件并贴编号,再从货架取出每个编号对应的多维说明卡。零件对应 Token,编号对应 Token ID,说明卡对应 Embedding。说明卡进入后续流水线后还会结合前后零件不断更新,形成上下文化表示。

类比没有体现子词算法、特殊 Token、位置编码和模型训练;“相近向量”也不保证词在所有上下文中同义。

图:教学图片|Token 与 Embedding 分别是什么?

替代文本: 16:9 中文教学信息图,地址包裹被拆成标准零件、贴 ID、从向量货架取说明卡,最后进入上下文流水线。

Token 与 Embedding 分别是什么?教学图片

读图结论: Token 是离散单元,Embedding 是连续表示。两者必须绑定模型版本。

这张图片用于展示文字从 Token 到向量表示的转换链。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:文本进入模型的表示链

替代文本: 原始文本经过规范化与 Tokenizer 切成 Token,再查词表得到 Token ID,Embedding 表将 ID 映射为向量,随后模型层结合上下文形成动态表示。

图表加载中…

读图结论: Token 解决离散切分和编号,Embedding 解决连续表示;模型真正建模的是经过上下文化的向量序列。

核心原理

给定词表大小 (V)、隐藏维度 (d),Embedding 矩阵为 (E\in\mathbb{R}^{V\times d})。Token ID (i) 的输入表示是矩阵第 (i) 行 (E_i)。Tokenizer 可能采用 BPE、WordPiece 或 Unigram 等方案,切分结果依词表和实现版本变化。

Token 数影响上下文窗口、延迟和费用;Embedding 维度影响参数量和表示能力。输入 Embedding、用于检索的句向量和 Transformer 中间层表示用途不同,不能混用。

项目和生产视角

示例项目: 网关做长度准入时应调用目标模型对应 Tokenizer,而不是按字符估算。模型或 Tokenizer 升级要回放中英文、代码、数字、特殊字符和超长文本,记录 Token 数分布、截断位置和特殊 Token。

生产故障常见于 Tokenizer 与模型制品不匹配、Unicode 规范化不同、截断吞掉关键尾部。应记录模型、词表、Tokenizer 哈希与实际 Token 数;本文没有真实事故数据。

常见错误回答

  • “一个 Token 就是一个字或单词”:切分依语言、词表和上下文字符组合。
  • “Embedding 就是语义”:它是学习到的向量表示,语义需结合训练目标和上下文解释。
  • “字符数可直接换算 Token 数”:只能在固定数据分布下近似估计。
  • “换模型只替换权重”:Tokenizer 和特殊 Token 契约也必须一致。

递进追问

  1. BPE 如何构建子词词表?
  2. 为什么同一句话换模型后 Token 数会变化?
  3. 输入 Embedding 与句向量有什么区别?
  4. 特殊 Token 在训练和推理中承担什么职责?
  5. Tokenizer 版本错配如何被测试发现?

关联阅读

总结

一句话记忆: Token 把文本变成离散编号,Embedding 再把编号变成模型可计算的连续向量。

  • Token 边界由具体 Tokenizer 和词表决定。
  • Embedding 是查表得到的连续表示。
  • 上下文化表示不等于初始 Embedding。
  • 生产中必须绑定模型、词表和 Tokenizer 版本。