外观
ReAct 如何形成 Thought、Action、Observation 闭环?
3 分钟速学卡
30 秒口述: ReAct 把推理与行动交替组织:模型基于目标和状态形成下一步决策,输出结构化 Action 调用工具,再把工具结果作为 Observation 更新状态并继续判断。它的价值是让决策接受外部事实反馈,而不是一次性生成整套计划;生产实现不应暴露或依赖自由文本思维链,而应保存可审计的决策摘要、工具参数和结果。闭环必须有最大步数、预算、重复检测、超时和明确完成条件,否则容易死循环或放大工具错误。
- 本质: ReAct 是“决策—行动—观察—更新”的受控循环,而不是无限制地边想边做。
- 核心机制: Action 要结构化并经权限校验;Observation 是不可信外部输入。
- 关键判断: 状态必须可追踪、可恢复;完成、预算、重复和失败都要有终止规则。
- 项目落地: 故障演练:搜索工具连续返回同一空结果,Agent 反复改写同义 Query。可用“工具+规范化参数+结果摘要”指纹检测重复,触发澄清或人工接管。
- 边界与坑: “Thought 必须完整展示给用户。” 生产上应输出可审计摘要,而非依赖私有思维链;“工具返回什么就继续推理。” Observation 是不可信输入,必须校验。
目录
面试官为什么问
这道题考察 Agent 控制循环、工具反馈、状态更新与安全终止,而不是背三个英文单词。
小白先看懂
维修师判断“可能是电源”,先测电压;看到电压正常后排除假设,再检查线路,直到找到断点。判断对应决策,测量对应 Action,仪表结果对应 Observation。
专业上 Observation 必须进入可持久化状态,下一轮决策才能利用。类比边界是模型决策可能不稳定,工具也可能返回错误或恶意内容。
主题教学图片
图:教学图片|ReAct 如何形成 Thought、Action、Observation 闭环?
替代文本: 围绕“ReAct 如何形成 Thought、Action、Observation 闭环?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

读图结论: 观察进入下一轮决策;每个循环都必须可终止。
这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:技术调用流程|ReAct 受控循环
替代文本: 目标和状态进入决策器,产生结构化工具动作,工具返回观察后更新状态;完成、重复、失败或预算耗尽都会终止循环。
图表加载中…
读图结论: ReAct 的可靠性来自外部观察进入下一轮决策,以及每一轮都有明确终止边界。
工具结果要进行 Schema、权限和不可信内容校验,不能直接当作系统指令。决策摘要用于审计,不要求保存模型隐式思维链。
核心原理
控制器应维护 step_id、状态摘要、工具名、规范化参数、执行结果、错误、耗时、Token、预算和终止原因。Action 解析失败时做有限重试;副作用工具必须使用幂等键。
项目和生产视角
故障演练: 搜索工具连续返回同一空结果,Agent 反复改写同义 Query。可用“工具+规范化参数+结果摘要”指纹检测重复,触发澄清或人工接管;这是演练建议。
常见错误回答
- “Thought 必须完整展示给用户。” 生产上应输出可审计摘要,而非依赖私有思维链。
- “工具返回什么就继续推理。” Observation 是不可信输入,必须校验。
- “设置最大步数就不会死循环。” 还需重复检测、预算和业务完成条件。
递进追问
- 如何设计 Action Schema?
- Observation 中的提示注入如何处理?
- 如何检测语义上重复的工具调用?
- 工具超时后何时重试、降级或接管?
关联阅读
总结
一句话记忆: ReAct 是“决策—行动—观察—更新”的受控循环,而不是无限制地边想边做。
- Action 要结构化并经权限校验;
- Observation 是不可信外部输入;
- 状态必须可追踪、可恢复;
- 完成、预算、重复和失败都要有终止规则。