Skip to content

ReAct 如何形成 Thought、Action、Observation 闭环?

3 分钟速学卡

30 秒口述: ReAct 把推理与行动交替组织:模型基于目标和状态形成下一步决策,输出结构化 Action 调用工具,再把工具结果作为 Observation 更新状态并继续判断。它的价值是让决策接受外部事实反馈,而不是一次性生成整套计划;生产实现不应暴露或依赖自由文本思维链,而应保存可审计的决策摘要、工具参数和结果。闭环必须有最大步数、预算、重复检测、超时和明确完成条件,否则容易死循环或放大工具错误。

  • 本质: ReAct 是“决策—行动—观察—更新”的受控循环,而不是无限制地边想边做。
  • 核心机制: Action 要结构化并经权限校验;Observation 是不可信外部输入。
  • 关键判断: 状态必须可追踪、可恢复;完成、预算、重复和失败都要有终止规则。
  • 项目落地: 故障演练:搜索工具连续返回同一空结果,Agent 反复改写同义 Query。可用“工具+规范化参数+结果摘要”指纹检测重复,触发澄清或人工接管。
  • 边界与坑: “Thought 必须完整展示给用户。” 生产上应输出可审计摘要,而非依赖私有思维链;“工具返回什么就继续推理。” Observation 是不可信输入,必须校验。

目录

面试官为什么问

这道题考察 Agent 控制循环、工具反馈、状态更新与安全终止,而不是背三个英文单词。

小白先看懂

维修师判断“可能是电源”,先测电压;看到电压正常后排除假设,再检查线路,直到找到断点。判断对应决策,测量对应 Action,仪表结果对应 Observation。

专业上 Observation 必须进入可持久化状态,下一轮决策才能利用。类比边界是模型决策可能不稳定,工具也可能返回错误或恶意内容。

主题教学图片

图:教学图片|ReAct 如何形成 Thought、Action、Observation 闭环?

替代文本: 围绕“ReAct 如何形成 Thought、Action、Observation 闭环?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

ReAct 如何形成 Thought、Action、Observation 闭环?教学图片

读图结论: 观察进入下一轮决策;每个循环都必须可终止。

这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:技术调用流程|ReAct 受控循环

替代文本: 目标和状态进入决策器,产生结构化工具动作,工具返回观察后更新状态;完成、重复、失败或预算耗尽都会终止循环。

图表加载中…

读图结论: ReAct 的可靠性来自外部观察进入下一轮决策,以及每一轮都有明确终止边界。

工具结果要进行 Schema、权限和不可信内容校验,不能直接当作系统指令。决策摘要用于审计,不要求保存模型隐式思维链。

核心原理

控制器应维护 step_id、状态摘要、工具名、规范化参数、执行结果、错误、耗时、Token、预算和终止原因。Action 解析失败时做有限重试;副作用工具必须使用幂等键。

项目和生产视角

故障演练: 搜索工具连续返回同一空结果,Agent 反复改写同义 Query。可用“工具+规范化参数+结果摘要”指纹检测重复,触发澄清或人工接管;这是演练建议。

常见错误回答

  • “Thought 必须完整展示给用户。” 生产上应输出可审计摘要,而非依赖私有思维链。
  • “工具返回什么就继续推理。” Observation 是不可信输入,必须校验。
  • “设置最大步数就不会死循环。” 还需重复检测、预算和业务完成条件。

递进追问

  1. 如何设计 Action Schema?
  2. Observation 中的提示注入如何处理?
  3. 如何检测语义上重复的工具调用?
  4. 工具超时后何时重试、降级或接管?

关联阅读

总结

一句话记忆: ReAct 是“决策—行动—观察—更新”的受控循环,而不是无限制地边想边做。

  • Action 要结构化并经权限校验;
  • Observation 是不可信外部输入;
  • 状态必须可追踪、可恢复;
  • 完成、预算、重复和失败都要有终止规则。