外观
Agent 核心机制专项面试题
目录
1. 使用说明
- 对应知识主题:Agent 核心机制;
- 角色:资深面试官从 Agent 定义追问到受控面试教练,高级技术应聘者负责划清模型、运行时、工具、状态与记忆边界;
- 回答顺序:先用 1~3 句专业短答,再用生活化解释;必须区分 Tool Calling、Workflow、Agent Loop、State、Context 和 Memory;
事实红线| 模型只能提出候选动作,没有天然执行权限;多 Agent 是可选组织方式,不保证质量更强;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:Agent 核心机制 L1~L7 递进路线
替代文本: L1 Agent/Tool Calling/Workflow → L2 State/Context/Memory → L3 Agent Loop 原理 → L4 受控最小实现 → L5 循环与错工具排障 → L6 形态选型与多 Agent → L7 示例面试教练复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先回答“什么才算 Agent”,再拆解信息载体和观察—行动循环,随后把白名单、Schema 与终止条件落到运行时,最后用系统选型和项目设计检验工程理解。
图:Agent 从 Goal 到受控终止的运行时闭环
替代文本: Goal 和当前 State 进入模型的规划与动作选择;工具动作必须先通过 Runtime 的 Schema、权限与预算门禁,获准后执行并产生 Observation,拒绝原因也作为 Observation;运行时更新 State 并统一判断继续、暂停或终止,等待用户时不会自动执行后续动作。
图表加载中…
读图结论: 模型只负责在 Goal 和已有 Observation 上提出下一步,Runtime 才拥有动作放行、状态推进和最终终止权;拒绝与暂停都是显式状态,不能被模型解释为“工具已经执行”。
面试时应沿图中的责任边界展开:Goal 定义任务,模型生成候选动作,工具返回真实环境证据,State 保存可恢复事实;最后由运行时同时检查模型完成信号、目标验收与步数、时间、Token/费用、重复动作等硬条件。这样才能说明 Agent Loop 不是模型自由循环,而是一个可观察、可暂停、可恢复、可强制结束的状态机。
3. 一问一答
第 1 题|L1 概念|Agent、Tool Calling 和 Workflow 的核心区别是什么?
核心考察点|动态路径、结构化动作、观察反馈和执行边界
面试官提问
请从路径决定者、中间观察和运行时职责回答,不要按框架名分类。
30 秒专业短答
Tool Calling 是模型表达一个或多个结构化动作的机制,是否继续由外层代码决定;Workflow 的节点和主要路径由代码或 DAG 预定义;Agent 则由运行时组织循环,允许模型根据中间 Observation 动态选择下一步。无论哪种形态,模型只提出动作,真正执行、授权、持久化和终止的是确定性运行时。
小白解释
Tool Calling 像写一张“请帮我查天气”的申请单;Workflow 像按固定流程办证;Agent 像导游根据每到一站的新情况决定下一站,但车钥匙、门票权限和结束时间仍由旅行社控制。
- 合格线| 三者定义清楚,强调模型无天然执行权限;
- 加分项| 说明固定高风险路径应优先 Workflow,Agent 只处理受控开放决策;
- 高频误区| 认为调用一个函数就是 Agent,或只要用了 LLM 就不是 Workflow;
- 下一问| 形态边界明确后,继续区分 Agent 运行时的状态、当前上下文和记忆。
第 2 题|L2 边界|State、Context、短期记忆和长期记忆有什么区别?
核心考察点|执行恢复、模型输入、记忆生命周期和日志边界
面试官提问
为什么不能把全部历史消息都叫长期记忆并不断塞回模型?
30 秒专业短答
State 是用于执行与恢复的结构化事实,如步骤、预算、工具结果和错误;Context 是本轮模型可见的指令、最近对话、工具 Schema 与必要观察;短期记忆保留当前任务工作信息,长期记忆跨会话复用但必须有来源、作用域、TTL、更新和删除策略。完整日志属于审计材料,不应无界进入上下文,否则会带来窗口、噪声、隐私和污染问题。
小白解释
状态像快递系统里的当前站点和签收记录,上下文像配送员今天手上的路线单,短期记忆是本单临时备注,长期记忆是经确认的常用地址;监控录像不能全塞给配送员边走边看。
- 合格线| 四类信息的用途、持久化和可见范围无混淆;
- 加分项| 提到来源、置信度、用户/租户隔离、压缩、过期与删除;
- 高频误区| 把聊天历史等于记忆,或把模型上下文当可靠状态库;
- 下一问| 信息载体清楚后,进一步解释模型动作、工具观察和状态更新如何形成循环。
第 3 题|L3 原理|Agent Loop 如何工作,谁决定继续与结束?
核心考察点|观察—行动循环、状态转移与软/硬终止
面试官提问
请解释
动作 → 工具 → Observation → 状态更新,并给出终止条件。
30 秒专业短答
模型根据目标和当前状态产生动作
a_t,运行时校验动作并执行工具得到观察o_t,再由确定性状态转移T(s_t,a_t,o_t)生成下一状态并决定是否继续。模型可发出完成或求助信号,但最大步数、时间、Token/费用、重复动作、权限违规、不可重试错误和结果验收必须由运行时硬终止。
小白解释
导游提出“下一站去博物馆”,旅行社先检查门票和时间,司机执行后把闭馆信息反馈回来,再决定改路线;导游可以说“行程完成”,但最后是否超预算、是否真的到齐景点要由行程系统核验。
- 合格线| 动作、执行、Observation、更新、循环和运行时上限;
- 加分项| 区分可重试/不可重试错误、重复动作指纹和需要用户批准的暂停状态;
- 高频误区| 只在 Prompt 写“不要循环”,或让模型自行管理预算与权限;
- 下一问| 原理明确后,把循环实现为工具白名单、严格动作结构和可测试状态机。
第 4 题|L4 实现|最小可用 Agent 运行时应该实现哪些控制?
核心考察点|Agent Runtime 的最小控制面与结构化接口
面试官提问
请从工具 Schema、执行、状态和输出验收说明,不能只写一个 while 循环。
30 秒专业短答
运行时至少要有结构化动作类型、工具白名单与输入 Schema、服务端授权、工具超时和错误结构、持久化 State、Observation 回写、步数/时间/Token/费用预算、重复动作检测以及最终输出校验。未知工具和非法参数必须在副作用前拒绝;真实模型输出不能靠脆弱正则解析自由文本。
小白解释
不能只让机器人不停喊下一步,还要有可执行事项清单、表单校验、门禁、计时器、行程记录和终点验收;它说出清单外的动作时,系统应先拦住而不是试着执行。
- 合格线| Schema、白名单、权限、状态、预算、Observation 和验收;
- 加分项| 状态版本、检查点、工具风险分级、人工确认与可重放 Trace;
- 高频误区| 任意执行模型生成的函数名,或只靠自然语言判断动作;
- 下一问| 运行时具备控制后,继续处理无限循环、错工具和参数幻觉的生产排障。
第 5 题|L5 工程|Agent 持续调用同一工具或总选错工具,如何排查?
核心考察点|循环/工具选择故障的信号、止损、根因与回归
面试官提问
请给出观测信号、定位顺序、止损和防复发。
30 秒专业短答
先按 run_id 固定模型/Prompt/工具版本、动作签名、Observation、状态变化、步数和预算;循环时先取消 Run 或限流,再查硬上限、重复动作/无进展检测、工具错误是否被正确分类以及 Observation 是否进入上下文。错工具则比较候选工具描述、Schema 重叠、路由和固定标注样本的混淆对;修复后重放失败轨迹,加入重复观察、持续失败和非法参数回归。
小白解释
导游一直带人绕同一条街时,先停下行程,再查他是否没收到“此路不通”、地图上两个地点是否同名、系统是否忘了走过;修好后用同一条封路路线再演练。
- 合格线| 动作/观察/状态/预算 Trace,硬终止与错误分类;
- 加分项| 动作指纹、无进展次数、工具选择标注集、混淆矩阵和按版本告警;
- 高频误区| 只改 Prompt,或无限自动重试同一失败动作;
- 下一问| 单 Agent 可控后,需要判断任务究竟该用 Workflow、Agent 还是多 Agent。
第 6 题|L6 架构|何时选 Workflow、单 Agent 或多 Agent?
核心考察点|确定性/概率性边界、组织模式和系统复杂度
面试官提问
请比较确定性、开放性、风险、上下文和协调成本,并说明多 Agent 是否一定更强。
30 秒专业短答
路径稳定、规则明确且副作用高的任务优先 Workflow;下一步依赖中间观察且工具组合难枚举时,可在受控边界内使用单 Agent。只有专长、权限或上下文边界明确时才考虑 Manager-as-Tool 或 Handoff 等多 Agent 组织;多 Agent 不保证更强,会增加调用、延迟、上下文损失、协调错误和责任模糊,必须用基线与任务评测证明价值。
小白解释
固定报销流程用办事指南最好,开放调查可以让一名负责人灵活查资料;只有法律、财务等确实需要专科协作时才组团队。人多不一定更聪明,也可能重复开会、传错话和没人负责。
- 合格线| 固定高风险选 Workflow,动态观察选 Agent,多 Agent 有额外成本;
- 加分项| 给出 Handoff 控制权、Agent-as-Tool 责任回收、最小权限与独立评测;
- 高频误区| 按角色名堆 Agent,或声称多 Agent 天然提升准确率;
- 下一问| 最后用面试教练说明哪些节点动态、哪些节点必须由代码固定。
第 7 题|L7 项目复盘|AI 面试教练为什么适合“受控 Agent + 固定 Workflow”?
核心考察点|动态追问、确定性控制面与概率评分的边界、状态设计和证据纪律
面试官提问
请说明动态追问、受控且可审计的评分协议、状态、失败风险和验收证据;哪些环节是确定性的,哪些仍然具有概率性?当前能否声称真实效果?
30 秒专业短答
这是源文档中的示例设计:Agent 根据候选人上一轮回答中的遗漏和错误动态选择下一问,知识检索只在需要事实依据时调用;Rubric 与权重版本、严重错误硬门禁、最大轮次、问题去重、退出指令、权限和最终状态验收由 Workflow/运行时代码固定。若答案语义评分由模型或 Judge 完成,具体分数仍是概率输出,必须绑定回答证据、知识来源及模型、Prompt、Rubric 版本,并通过重复评分和人工一致性校准控制漂移,不能称为确定性评分。仓库没有真实实现或用户评测,因此不能声称准确率、延迟或学习收益。
小白解释
面试官要根据你的上一句灵活追问,但打分表、考试时间和结束规则不能随心变;查不到标准答案时应承认不知道。现在是可测试的考场设计,不是已经运营的成绩报告。
- 合格线| Agent 负责追问决策;代码固定评分协议、硬门禁、预算、去重和终止;模型评分仍需校准和版本化;
- 加分项| 每轮保存问题指纹、证据、评分维度、弱点摘要和终止原因,并支持重放;
- 高频误区| 让模型既出题又自定评分和通过标准,或虚构项目结果;
- 下一问| 本组题结束;后续进入幂等、对账、权限、Guardrail 和长任务恢复。
4. 自测与评分
- [ ] 分别举一个普通 Tool Calling、固定 Workflow 和 Agent Loop 的例子;
- [ ] 设计 State、Context、短期记忆和长期记忆四份字段清单;
- [ ] 为未知工具、参数错误、重复观察和持续超时写终止测试;
- [ ] 用同一任务比较单 Agent 与固定 Workflow 的质量、成本和风险;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 第 7 题必须明确是示例设计,不得编造真实用户或效果数据。
5. 事实边界与参考资料
- 单一事实源:Agent 核心机制;
- 源文档依据包括 ReAct、Toolformer 原始论文,以及 OpenAI Agents SDK Tools/Handoffs 官方资料;
- 工具数量、循环预算、压缩策略、路由方式和多 Agent 价值必须按目标任务评测;
当前无法确认| 示例面试教练的真实实现、模型、用户规模、质量、延迟、成本与学习效果。
6. 总结
一句话记忆: Agent 是模型提出动态下一步、运行时受控执行并依据 Observation 更新状态的循环系统。
- Tool Calling 是动作表达,Workflow 是代码路径,Agent 还需要动态循环与终止;
- State 用于恢复,Context 用于本轮决策,Memory 必须有来源和生命周期;
- 模型没有天然执行权限,授权、预算、状态和验收属于运行时;
- 固定高风险流程优先 Workflow,多 Agent 不保证比单 Agent 更强;
- 项目表达必须区分示例设计、验证方案和真实运行证据。