Skip to content

Agent 核心机制专项面试题

目录

1. 使用说明

  • 对应知识主题Agent 核心机制
  • 角色:资深面试官从 Agent 定义追问到受控面试教练,高级技术应聘者负责划清模型、运行时、工具、状态与记忆边界;
  • 回答顺序:先用 1~3 句专业短答,再用生活化解释;必须区分 Tool Calling、Workflow、Agent Loop、State、Context 和 Memory;

事实红线| 模型只能提出候选动作,没有天然执行权限;多 Agent 是可选组织方式,不保证质量更强;

  • 题目数量:7 题,严格覆盖 L1~L7。

阅读图例| L1~L2 概念与边界 · L3~L4 原理与实现 · L5 工程 · L6 架构 · L7 项目复盘

答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问

2. 递进路线

图:Agent 核心机制 L1~L7 递进路线

替代文本: L1 Agent/Tool Calling/Workflow → L2 State/Context/Memory → L3 Agent Loop 原理 → L4 受控最小实现 → L5 循环与错工具排障 → L6 形态选型与多 Agent → L7 示例面试教练复盘。

图表加载中…

读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。

题链先回答“什么才算 Agent”,再拆解信息载体和观察—行动循环,随后把白名单、Schema 与终止条件落到运行时,最后用系统选型和项目设计检验工程理解。

图:Agent 从 Goal 到受控终止的运行时闭环

替代文本: Goal 和当前 State 进入模型的规划与动作选择;工具动作必须先通过 Runtime 的 Schema、权限与预算门禁,获准后执行并产生 Observation,拒绝原因也作为 Observation;运行时更新 State 并统一判断继续、暂停或终止,等待用户时不会自动执行后续动作。

图表加载中…

读图结论: 模型只负责在 Goal 和已有 Observation 上提出下一步,Runtime 才拥有动作放行、状态推进和最终终止权;拒绝与暂停都是显式状态,不能被模型解释为“工具已经执行”。

面试时应沿图中的责任边界展开:Goal 定义任务,模型生成候选动作,工具返回真实环境证据,State 保存可恢复事实;最后由运行时同时检查模型完成信号、目标验收与步数、时间、Token/费用、重复动作等硬条件。这样才能说明 Agent Loop 不是模型自由循环,而是一个可观察、可暂停、可恢复、可强制结束的状态机。

3. 一问一答

第 1 题|L1 概念|Agent、Tool Calling 和 Workflow 的核心区别是什么?

核心考察点|动态路径、结构化动作、观察反馈和执行边界

面试官提问

请从路径决定者、中间观察和运行时职责回答,不要按框架名分类。

30 秒专业短答

Tool Calling 是模型表达一个或多个结构化动作的机制,是否继续由外层代码决定;Workflow 的节点和主要路径由代码或 DAG 预定义;Agent 则由运行时组织循环,允许模型根据中间 Observation 动态选择下一步。无论哪种形态,模型只提出动作,真正执行、授权、持久化和终止的是确定性运行时。

小白解释

Tool Calling 像写一张“请帮我查天气”的申请单;Workflow 像按固定流程办证;Agent 像导游根据每到一站的新情况决定下一站,但车钥匙、门票权限和结束时间仍由旅行社控制。

  • 合格线| 三者定义清楚,强调模型无天然执行权限;
  • 加分项| 说明固定高风险路径应优先 Workflow,Agent 只处理受控开放决策;
  • 高频误区| 认为调用一个函数就是 Agent,或只要用了 LLM 就不是 Workflow;
  • 下一问| 形态边界明确后,继续区分 Agent 运行时的状态、当前上下文和记忆。

第 2 题|L2 边界|State、Context、短期记忆和长期记忆有什么区别?

核心考察点|执行恢复、模型输入、记忆生命周期和日志边界

面试官提问

为什么不能把全部历史消息都叫长期记忆并不断塞回模型?

30 秒专业短答

State 是用于执行与恢复的结构化事实,如步骤、预算、工具结果和错误;Context 是本轮模型可见的指令、最近对话、工具 Schema 与必要观察;短期记忆保留当前任务工作信息,长期记忆跨会话复用但必须有来源、作用域、TTL、更新和删除策略。完整日志属于审计材料,不应无界进入上下文,否则会带来窗口、噪声、隐私和污染问题。

小白解释

状态像快递系统里的当前站点和签收记录,上下文像配送员今天手上的路线单,短期记忆是本单临时备注,长期记忆是经确认的常用地址;监控录像不能全塞给配送员边走边看。

  • 合格线| 四类信息的用途、持久化和可见范围无混淆;
  • 加分项| 提到来源、置信度、用户/租户隔离、压缩、过期与删除;
  • 高频误区| 把聊天历史等于记忆,或把模型上下文当可靠状态库;
  • 下一问| 信息载体清楚后,进一步解释模型动作、工具观察和状态更新如何形成循环。

第 3 题|L3 原理|Agent Loop 如何工作,谁决定继续与结束?

核心考察点|观察—行动循环、状态转移与软/硬终止

面试官提问

请解释 动作 → 工具 → Observation → 状态更新,并给出终止条件。

30 秒专业短答

模型根据目标和当前状态产生动作 a_t,运行时校验动作并执行工具得到观察 o_t,再由确定性状态转移 T(s_t,a_t,o_t) 生成下一状态并决定是否继续。模型可发出完成或求助信号,但最大步数、时间、Token/费用、重复动作、权限违规、不可重试错误和结果验收必须由运行时硬终止。

小白解释

导游提出“下一站去博物馆”,旅行社先检查门票和时间,司机执行后把闭馆信息反馈回来,再决定改路线;导游可以说“行程完成”,但最后是否超预算、是否真的到齐景点要由行程系统核验。

  • 合格线| 动作、执行、Observation、更新、循环和运行时上限;
  • 加分项| 区分可重试/不可重试错误、重复动作指纹和需要用户批准的暂停状态;
  • 高频误区| 只在 Prompt 写“不要循环”,或让模型自行管理预算与权限;
  • 下一问| 原理明确后,把循环实现为工具白名单、严格动作结构和可测试状态机。

第 4 题|L4 实现|最小可用 Agent 运行时应该实现哪些控制?

核心考察点|Agent Runtime 的最小控制面与结构化接口

面试官提问

请从工具 Schema、执行、状态和输出验收说明,不能只写一个 while 循环。

30 秒专业短答

运行时至少要有结构化动作类型、工具白名单与输入 Schema、服务端授权、工具超时和错误结构、持久化 State、Observation 回写、步数/时间/Token/费用预算、重复动作检测以及最终输出校验。未知工具和非法参数必须在副作用前拒绝;真实模型输出不能靠脆弱正则解析自由文本。

小白解释

不能只让机器人不停喊下一步,还要有可执行事项清单、表单校验、门禁、计时器、行程记录和终点验收;它说出清单外的动作时,系统应先拦住而不是试着执行。

  • 合格线| Schema、白名单、权限、状态、预算、Observation 和验收;
  • 加分项| 状态版本、检查点、工具风险分级、人工确认与可重放 Trace;
  • 高频误区| 任意执行模型生成的函数名,或只靠自然语言判断动作;
  • 下一问| 运行时具备控制后,继续处理无限循环、错工具和参数幻觉的生产排障。

第 5 题|L5 工程|Agent 持续调用同一工具或总选错工具,如何排查?

核心考察点|循环/工具选择故障的信号、止损、根因与回归

面试官提问

请给出观测信号、定位顺序、止损和防复发。

30 秒专业短答

先按 run_id 固定模型/Prompt/工具版本、动作签名、Observation、状态变化、步数和预算;循环时先取消 Run 或限流,再查硬上限、重复动作/无进展检测、工具错误是否被正确分类以及 Observation 是否进入上下文。错工具则比较候选工具描述、Schema 重叠、路由和固定标注样本的混淆对;修复后重放失败轨迹,加入重复观察、持续失败和非法参数回归。

小白解释

导游一直带人绕同一条街时,先停下行程,再查他是否没收到“此路不通”、地图上两个地点是否同名、系统是否忘了走过;修好后用同一条封路路线再演练。

  • 合格线| 动作/观察/状态/预算 Trace,硬终止与错误分类;
  • 加分项| 动作指纹、无进展次数、工具选择标注集、混淆矩阵和按版本告警;
  • 高频误区| 只改 Prompt,或无限自动重试同一失败动作;
  • 下一问| 单 Agent 可控后,需要判断任务究竟该用 Workflow、Agent 还是多 Agent。

第 6 题|L6 架构|何时选 Workflow、单 Agent 或多 Agent?

核心考察点|确定性/概率性边界、组织模式和系统复杂度

面试官提问

请比较确定性、开放性、风险、上下文和协调成本,并说明多 Agent 是否一定更强。

30 秒专业短答

路径稳定、规则明确且副作用高的任务优先 Workflow;下一步依赖中间观察且工具组合难枚举时,可在受控边界内使用单 Agent。只有专长、权限或上下文边界明确时才考虑 Manager-as-Tool 或 Handoff 等多 Agent 组织;多 Agent 不保证更强,会增加调用、延迟、上下文损失、协调错误和责任模糊,必须用基线与任务评测证明价值。

小白解释

固定报销流程用办事指南最好,开放调查可以让一名负责人灵活查资料;只有法律、财务等确实需要专科协作时才组团队。人多不一定更聪明,也可能重复开会、传错话和没人负责。

  • 合格线| 固定高风险选 Workflow,动态观察选 Agent,多 Agent 有额外成本;
  • 加分项| 给出 Handoff 控制权、Agent-as-Tool 责任回收、最小权限与独立评测;
  • 高频误区| 按角色名堆 Agent,或声称多 Agent 天然提升准确率;
  • 下一问| 最后用面试教练说明哪些节点动态、哪些节点必须由代码固定。

第 7 题|L7 项目复盘|AI 面试教练为什么适合“受控 Agent + 固定 Workflow”?

核心考察点|动态追问、确定性控制面与概率评分的边界、状态设计和证据纪律

面试官提问

请说明动态追问、受控且可审计的评分协议、状态、失败风险和验收证据;哪些环节是确定性的,哪些仍然具有概率性?当前能否声称真实效果?

30 秒专业短答

这是源文档中的示例设计:Agent 根据候选人上一轮回答中的遗漏和错误动态选择下一问,知识检索只在需要事实依据时调用;Rubric 与权重版本、严重错误硬门禁、最大轮次、问题去重、退出指令、权限和最终状态验收由 Workflow/运行时代码固定。若答案语义评分由模型或 Judge 完成,具体分数仍是概率输出,必须绑定回答证据、知识来源及模型、Prompt、Rubric 版本,并通过重复评分和人工一致性校准控制漂移,不能称为确定性评分。仓库没有真实实现或用户评测,因此不能声称准确率、延迟或学习收益。

小白解释

面试官要根据你的上一句灵活追问,但打分表、考试时间和结束规则不能随心变;查不到标准答案时应承认不知道。现在是可测试的考场设计,不是已经运营的成绩报告。

  • 合格线| Agent 负责追问决策;代码固定评分协议、硬门禁、预算、去重和终止;模型评分仍需校准和版本化;
  • 加分项| 每轮保存问题指纹、证据、评分维度、弱点摘要和终止原因,并支持重放;
  • 高频误区| 让模型既出题又自定评分和通过标准,或虚构项目结果;
  • 下一问| 本组题结束;后续进入幂等、对账、权限、Guardrail 和长任务恢复。

4. 自测与评分

  • [ ] 分别举一个普通 Tool Calling、固定 Workflow 和 Agent Loop 的例子;
  • [ ] 设计 State、Context、短期记忆和长期记忆四份字段清单;
  • [ ] 为未知工具、参数错误、重复观察和持续超时写终止测试;
  • [ ] 用同一任务比较单 Agent 与固定 Workflow 的质量、成本和风险;
  • [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
  • [ ] 第 7 题必须明确是示例设计,不得编造真实用户或效果数据。

5. 事实边界与参考资料

  • 单一事实源:Agent 核心机制
  • 源文档依据包括 ReAct、Toolformer 原始论文,以及 OpenAI Agents SDK Tools/Handoffs 官方资料;
  • 工具数量、循环预算、压缩策略、路由方式和多 Agent 价值必须按目标任务评测;

当前无法确认| 示例面试教练的真实实现、模型、用户规模、质量、延迟、成本与学习效果。

6. 总结

一句话记忆: Agent 是模型提出动态下一步、运行时受控执行并依据 Observation 更新状态的循环系统。

  • Tool Calling 是动作表达,Workflow 是代码路径,Agent 还需要动态循环与终止;
  • State 用于恢复,Context 用于本轮决策,Memory 必须有来源和生命周期;
  • 模型没有天然执行权限,授权、预算、状态和验收属于运行时;
  • 固定高风险流程优先 Workflow,多 Agent 不保证比单 Agent 更强;
  • 项目表达必须区分示例设计、验证方案和真实运行证据。