外观
Transformer 为什么能取代大部分 RNN?
3 分钟速学卡
30 秒口述: Transformer 用 Self-Attention 让序列位置直接交互,训练时能并行处理全部 Token,长距离信息路径也比 RNN 的逐步传递更短。它因此更适合大规模数据、加速器并行和扩展训练,并通过位置编码补回顺序信息。它不是无条件取代 RNN:标准 Attention 的时间和显存随序列长度呈平方增长,流式、极低资源或超长序列场景仍要比较 RNN、状态空间模型和稀疏注意力。
- 本质: Transformer 用直接全局交互和矩阵并行换来可扩展训练,同时付出长序列平方成本。
- 核心机制: RNN 沿时间递推,Transformer 在层内直接交互;训练并行性是大规模扩展的关键优势。
- 关键判断: 位置编码承担顺序信息;选型必须同时比较质量、长度、硬件、延迟和显存。
- 项目落地: 示例项目:文本编码器选型不能只比较准确率,应在固定数据和硬件上测吞吐、P95 延迟、峰值显存、最大长度和任务质量。短文本批处理通常利于 Transformer。
- 边界与坑: “Attention 能完全并行推理”:自回归 Decode 仍逐 Token 生成;“Transformer 天生知道顺序”:需要位置编码或相对位置机制。
目录
面试官为什么问
这道题考模型架构、复杂度和硬件适配的联合理解。优秀回答要同时说明并行性、长程依赖、扩展性与平方复杂度代价。
小白先看懂
传话游戏中,每个人只能听前一个人,消息要逐站传递,像 RNN;圆桌会议中,每个人可以同时查看所有人的便签并按相关性关注,像 Self-Attention。圆桌更容易并行、远距离沟通更直接,但便签越多,两两查看的成本越高。
映射中,参与者是 Token,逐站记忆是隐藏状态,便签相关性是注意力权重。类比忽略了因果 Mask、矩阵投影、位置编码和推理时逐 Token 生成。
图:教学图片|Transformer 为什么能取代大部分 RNN?
替代文本: 16:9 中文教学对比图,左侧为排队传话,右侧为圆桌便签交流;下方映射到序列模型。

读图结论: Transformer 更易并行和建模长依赖,但标准注意力不擅长无限长序列。
这张图片用于比较 RNN 串行传递与 Transformer 全局交互。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:RNN 串行路径与 Transformer 全局交互对比
替代文本: 上方 RNN 的 Token 通过隐藏状态依次传递,关键依赖跨越多个步骤;下方 Transformer 在同一层内让多个 Token 直接建立注意力连接并并行训练。
图表加载中…
读图结论: Transformer 的优势来自直接交互和矩阵并行,但全连接注意力会带来长序列的二次方成本。
核心原理
RNN 递推 (h_t=f(h_{t-1},x_t)),序列维度难以完全并行,远距离依赖要经过多个状态。标准 Self-Attention 计算:
训练时矩阵运算适合 GPU/TPU;单层任意位置间路径长度接近常数。代价是长度 (n) 下注意力分数矩阵通常为 (O(n^2)),还需位置编码表达顺序。
项目和生产视角
示例项目: 文本编码器选型不能只比较准确率,应在固定数据和硬件上测吞吐、P95 延迟、峰值显存、最大长度和任务质量。短文本批处理通常利于 Transformer;持续流式传感器或边缘设备可能需要更小状态模型。
生产风险包括长请求 OOM、位置外推退化和推理 KV Cache 膨胀。入口应按 Token 和并发准入,监控输入长度、TTFT、吞吐及显存;本文没有基准数据。
常见错误回答
- “Attention 能完全并行推理”:自回归 Decode 仍逐 Token 生成。
- “Transformer 天生知道顺序”:需要位置编码或相对位置机制。
- “路径短所以计算更少”:标准全局 Attention 对长序列可能更贵。
- “RNN 已经没有价值”:流式、小模型和受限资源场景仍需实测。
递进追问
- Transformer 训练并行与自回归推理串行有什么区别?
- 标准 Attention 的时间和空间复杂度如何推导?
- 为什么还需要位置编码?
- KV Cache 解决了哪部分重复计算?
- 超长序列还可考虑哪些架构?
关联阅读
总结
一句话记忆: Transformer 用直接全局交互和矩阵并行换来可扩展训练,同时付出长序列平方成本。
- RNN 沿时间递推,Transformer 在层内直接交互。
- 训练并行性是大规模扩展的关键优势。
- 位置编码承担顺序信息。
- 选型必须同时比较质量、长度、硬件、延迟和显存。