外观
Temperature、Top-k 和 Top-p 如何影响生成?
3 分钟速学卡
30 秒口述: Temperature 通过缩放 Logits 改变概率分布的尖锐程度,越低越偏向高概率 Token,越高越分散。Top-k 固定保留概率最高的 k 个候选,Top-p 则保留累计概率达到 p 的最小候选集合,集合大小会随分布变化。它们只控制采样稳定性和多样性,不能修复知识缺失、错误上下文或幻觉,参数语义还要以目标模型和 SDK 版本为准。
- 本质: Temperature 调整概率形状,Top-k 和 Top-p 限制候选集合。
- 核心机制: 低温更集中,高温更分散;Top-k 固定数量,Top-p 动态累计概率。
- 关键判断: 截断后通常要重新归一化再采样;采样参数不负责事实校验和知识补全。
- 项目落地: 示例项目:结构化抽取优先使用受约束解码、Schema 校验和重试,低温只作为辅助;创意候选可增加采样多样性,但要同时统计合格率、重复率、延迟、Token 和人工审核成本。
- 边界与坑: “Temperature 为 0 就绝对确定”:实际由 API 语义、并行内核和服务实现决定;“低温能消除幻觉”:它不补充事实证据。
目录
面试官为什么问
这道题考概率分布、采样边界和生产配置意识。只回答“调高更有创造力”不足以说明候选集合、重归一化、确定性与质量评测。
小白先看懂
自动售货机按受欢迎程度摆饮料:Temperature 改变热门与冷门的差距;Top-k 只开放排名前 k 个按钮;Top-p 从最热门开始开放,直到累计受欢迎度达到阈值。最后仍要从开放按钮中抽取一个,不同机制不能保证选到“事实正确”的饮料。
映射中饮料是候选 Token,受欢迎度是概率。类比没有体现 Logits、重新归一化、随机种子和不同 SDK 的组合顺序。
图:教学图片|Temperature、Top-k 和 Top-p 如何影响生成?
替代文本: 16:9 中文教学信息图,自动售货机候选饮料按概率高低排列;三块区域分别展示温度、固定前 k、累计概率 p。

读图结论: 参数控制稳定性与多样性,不负责修复事实错误。
这张图片用于解释三类采样参数如何改变概率与候选集合。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:Logits 到下一 Token 的采样漏斗
替代文本: 模型输出 Logits 后先经 Temperature 调整分布,再由 Top-k 或 Top-p 限定候选集合,重新归一化并采样得到下一 Token;低温不是事实校验。
图表加载中…
读图结论: Temperature 改概率形状,Top-k/Top-p 改候选范围;它们不改变模型已经学到的知识。
核心原理
给定 Logit (z_i) 和 (T>0):
当 (T\to0) 时分布更尖锐;高温使分布平缓。Top-k 取固定数量,Top-p 对排序后概率取满足累计值首次达到 (p) 的最小前缀。框架对过滤顺序、极端参数和 seed 的支持可能不同,必须以固定 Logits 做测试。
项目和生产视角
示例项目: 结构化抽取优先使用受约束解码、Schema 校验和重试,低温只作为辅助;创意候选可增加采样多样性,但要同时统计合格率、重复率、延迟、Token 和人工审核成本。
配置应绑定模型版本、Prompt 版本和场景,灰度时用固定问题集重复采样比较分布。本文没有给出通用最佳参数。
常见错误回答
- “Temperature 为 0 就绝对确定”:实际由 API 语义、并行内核和服务实现决定。
- “低温能消除幻觉”:它不补充事实证据。
- “Top-k 与 Top-p 都是固定候选数”:Top-p 的集合大小动态变化。
- “参数越高越有创造力”:还可能增加噪声、违规和不一致。
递进追问
- 为什么 Temperature 作用在 Logits 而不是概率上更自然?
- Top-p 的候选数为什么会动态变化?
- Greedy、Beam Search 与随机采样有什么区别?
- 如何评估生成多样性而不牺牲合格率?
- 结构化输出为什么不能只依赖低温?
关联阅读
总结
一句话记忆: Temperature 调整概率形状,Top-k 和 Top-p 限制候选集合。
- 低温更集中,高温更分散。
- Top-k 固定数量,Top-p 动态累计概率。
- 截断后通常要重新归一化再采样。
- 采样参数不负责事实校验和知识补全。