Skip to content

Temperature、Top-k 和 Top-p 如何影响生成?

3 分钟速学卡

30 秒口述: Temperature 通过缩放 Logits 改变概率分布的尖锐程度,越低越偏向高概率 Token,越高越分散。Top-k 固定保留概率最高的 k 个候选,Top-p 则保留累计概率达到 p 的最小候选集合,集合大小会随分布变化。它们只控制采样稳定性和多样性,不能修复知识缺失、错误上下文或幻觉,参数语义还要以目标模型和 SDK 版本为准。

  • 本质: Temperature 调整概率形状,Top-k 和 Top-p 限制候选集合。
  • 核心机制: 低温更集中,高温更分散;Top-k 固定数量,Top-p 动态累计概率。
  • 关键判断: 截断后通常要重新归一化再采样;采样参数不负责事实校验和知识补全。
  • 项目落地: 示例项目:结构化抽取优先使用受约束解码、Schema 校验和重试,低温只作为辅助;创意候选可增加采样多样性,但要同时统计合格率、重复率、延迟、Token 和人工审核成本。
  • 边界与坑: “Temperature 为 0 就绝对确定”:实际由 API 语义、并行内核和服务实现决定;“低温能消除幻觉”:它不补充事实证据。

目录

面试官为什么问

这道题考概率分布、采样边界和生产配置意识。只回答“调高更有创造力”不足以说明候选集合、重归一化、确定性与质量评测。

小白先看懂

自动售货机按受欢迎程度摆饮料:Temperature 改变热门与冷门的差距;Top-k 只开放排名前 k 个按钮;Top-p 从最热门开始开放,直到累计受欢迎度达到阈值。最后仍要从开放按钮中抽取一个,不同机制不能保证选到“事实正确”的饮料。

映射中饮料是候选 Token,受欢迎度是概率。类比没有体现 Logits、重新归一化、随机种子和不同 SDK 的组合顺序。

图:教学图片|Temperature、Top-k 和 Top-p 如何影响生成?

替代文本: 16:9 中文教学信息图,自动售货机候选饮料按概率高低排列;三块区域分别展示温度、固定前 k、累计概率 p。

Temperature、Top-k 和 Top-p 如何影响生成?教学图片

读图结论: 参数控制稳定性与多样性,不负责修复事实错误。

这张图片用于解释三类采样参数如何改变概率与候选集合。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:Logits 到下一 Token 的采样漏斗

替代文本: 模型输出 Logits 后先经 Temperature 调整分布,再由 Top-k 或 Top-p 限定候选集合,重新归一化并采样得到下一 Token;低温不是事实校验。

图表加载中…

读图结论: Temperature 改概率形状,Top-k/Top-p 改候选范围;它们不改变模型已经学到的知识。

核心原理

给定 Logit (z_i) 和 (T>0):

pi=ezi/Tjezj/T

当 (T\to0) 时分布更尖锐;高温使分布平缓。Top-k 取固定数量,Top-p 对排序后概率取满足累计值首次达到 (p) 的最小前缀。框架对过滤顺序、极端参数和 seed 的支持可能不同,必须以固定 Logits 做测试。

项目和生产视角

示例项目: 结构化抽取优先使用受约束解码、Schema 校验和重试,低温只作为辅助;创意候选可增加采样多样性,但要同时统计合格率、重复率、延迟、Token 和人工审核成本。

配置应绑定模型版本、Prompt 版本和场景,灰度时用固定问题集重复采样比较分布。本文没有给出通用最佳参数。

常见错误回答

  • “Temperature 为 0 就绝对确定”:实际由 API 语义、并行内核和服务实现决定。
  • “低温能消除幻觉”:它不补充事实证据。
  • “Top-k 与 Top-p 都是固定候选数”:Top-p 的集合大小动态变化。
  • “参数越高越有创造力”:还可能增加噪声、违规和不一致。

递进追问

  1. 为什么 Temperature 作用在 Logits 而不是概率上更自然?
  2. Top-p 的候选数为什么会动态变化?
  3. Greedy、Beam Search 与随机采样有什么区别?
  4. 如何评估生成多样性而不牺牲合格率?
  5. 结构化输出为什么不能只依赖低温?

关联阅读

总结

一句话记忆: Temperature 调整概率形状,Top-k 和 Top-p 限制候选集合。

  • 低温更集中,高温更分散。
  • Top-k 固定数量,Top-p 动态累计概率。
  • 截断后通常要重新归一化再采样。
  • 采样参数不负责事实校验和知识补全。