外观
AI 面试教练项目专项面试题
目录
1. 使用说明
- 对应知识主题:AI 面试教练项目;
- 角色:资深面试官从产品核心问题追问到版本化评测平台,高级技术应聘者负责讲清状态、证据、评分、有限动作和事实边界;
- 回答顺序:先用 1~3 句专业短答,再用生活化解释;评分、追问与项目亮点都必须能回到回答 Span、知识来源、Rubric 和版本;
事实红线| 当前只有设计与伪代码,没有可执行代码、真实表/接口、测试、Trace 或实测指标,不得包装成上线经历;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:AI 面试教练项目 L1~L7 递进路线
替代文本: L1 核心产品问题 → L2 普通问答边界 → L3 状态机/RAG/Rubric/受控 Agent → L4 Session/Round/Outbox/Lease 实现 → L5 漂移与安全恢复 → L6 有限动作与版本化评测 → L7 项目证据复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先说明为什么“会聊天”不等于“会面试”,再拆分确定性流程和动态追问,随后深入异步一致性、评分证据和安全,最后严格审计项目是否真的实现。
图:一轮 AI 面试的 Outbox-Worker 异步受控调用链
替代文本: 用户提交带 session、round 和 expected_version 的回答后,会话 API 与状态机只在短事务中校验合法迁移、唯一占位 Round、记录 answer_hash、将任务置为 PENDING 并写 Outbox。Outbox Consumer 至少一次投递事件,Worker 通过条件更新原子完成 PENDING→RUNNING 并获得 lease_token、lease_until 与 session_version 快照;慢模型调用全部由 Worker 在事务外执行,期间按 token 条件续租。提交前 Worker 再请求状态机校验有限动作,并在同一事务中同时校验 RUNNING、lease_token 和 session version,只有校验成功才能保存证据、评分、动作并推进 Session;状态机不直接承担异步模型执行。
图表加载中…
读图结论: 状态机只拥有合法迁移与策略校验权,Outbox Consumer 负责可靠触发,Worker 以原子 PENDING→RUNNING、lease/续租和提交前 lease/version 双校验获得一次性提交权;慢模型链不由状态机直接执行。
这条调用链的关键不是组件数量,而是触发权、执行权和提交权分离:接收事务保证同一 Round 不被重复接收并可靠写出 Outbox,Consumer 只做至少一次投递,Worker 只有原子认领成功后才执行慢模型链,并在长调用期间续租。最终提交同时验证 status=RUNNING、lease token 和接收时的 session version,任一不匹配都丢弃旧结果且不得推进 Session。持久化层保存用户答案、回答与知识 Span、评分、动作、版本和事件,不把模型内部推理或临时检索上下文当作长期会话状态;RAG 证据不足时只能降低事实结论强度,不能由 Agent 用参数记忆补造依据。
3. 一问一答
第 1 题|L1 概念|AI 面试教练真正要解决的核心问题是什么?
核心考察点|业务目标、用户价值、失败模式和验收定义
面试官提问
请说明它与固定题库和普通聊天机器人的差异,以及怎样算成功。
30 秒专业短答
核心问题是根据岗位与候选人实时回答,一次提出一道题,从正确点、遗漏、错误和项目证据中选择下一次递进追问,并给出有来源、可解释、可复测的多维反馈。固定题库缺少动态追问,普通聊天模型容易多问、泄露答案、重复或凭直觉评分;成功要由题目匹配、追问相关、评分证据、恢复、安全、延迟和成本共同验证。
小白解释
好教练不是把答案册念一遍,也不是随便聊天;他听完你这一句,找到真正没懂的地方只追问一个点,并能指出为什么扣分、下一次怎样练。
- 合格线| 一次一题、动态缺口追问、证据评分和复习闭环;
- 加分项| 区分系统成功与质量成功,加入暂停恢复、用户隔离和申诉修订;
- 高频误区| 把项目说成“LLM 加题库”,或用回答看起来不错作为验收;
- 下一问| 目标明确后,继续判断哪些能力不能由一次普通问答或自由 Agent 独立承担。
第 2 题|L2 边界|为什么不能只做普通 LLM 问答,也不能完全放给自由 Agent?
核心考察点|Workflow、RAG、Rubric 与 Agent 的职责边界
面试官提问
请从状态、事实、评分、预算和终止说明确定性与动态边界。
30 秒专业短答
普通单次问答没有跨轮状态、能力覆盖、证据评分和恢复;完全自由 Agent 又可能重复、越级、多问、提前讲答案、修改分数或无法结束。外层应由状态机控制一次一题、轮次、预算、评分规则和终止,RAG 提供可引用事实,Agent 只根据结构化缺口在有限动作中建议追问、澄清、提示、讲解、切题或结束。
小白解释
聊天朋友可以随意发挥,但正式面试要有考场计时、题目顺序和评分表;面试官能灵活追问,却不能临时改满分、偷偷多考三题或自己宣布越权通过。
- 合格线| 外层确定性、内层受控动态,事实和评分不交给自由模型;
- 加分项| 证据不足时只评结构或请求澄清,不用模型记忆冒充来源;
- 高频误区| 固定 Workflow 完全无法动态,或自由 Agent 同时掌握分数、权限和终止;
- 下一问| 边界明确后,完整说明一次回答从状态校验到下一题的调用链。
第 3 题|L3 原理|状态机、RAG、Rubric 和受控 Agent 如何协作完成一轮面试?
核心考察点|端到端职责、证据流、评分与动作控制
面试官提问
请按回答分析、事实证据、评分和下一动作的顺序说明。
30 秒专业短答
状态机先校验 session/round/version,用短事务唯一占位 Round、写
PENDING与 Outbox,但不直接执行慢模型。Outbox Consumer 至少一次投递后,Worker 原子认领任务,再依次完成回答分析、带权限和版本的 RAG 检索、Rubric 评分与有限动作 Agent 建议;状态机只校验重复、难度、预算和终止,Worker 最后凭有效 lease 与未变化的 session version 事务提交 Round 和 Session。
小白解释
考务先确认你答的是当前题,助教标出你说对和漏掉的句子,资料员找标准依据,评分员按固定量表打分,主考官再从允许的动作里挑一个追问,最后考务确认没有超时或重复。
- 合格线| 状态校验与 Outbox→Worker 认领→分析→RAG→Rubric→受控动作→带所有权校验的状态提交;
- 加分项| 不确定 Claim 显式保留、严重错误硬门禁、问题指纹和知识/回答引用双证据;
- 高频误区| RAG 直接决定通过,或 Agent 可以修改 Rubric 和最大轮次;
- 下一问| 概念调用链清楚后,继续落到 Session、Round、版本实体和异步 Worker 的一致性实现。
第 4 题|L4 实现|Session、Round、QuestionVersion、Evidence、Outbox 和 Lease 如何设计?
核心考察点|数据模型、幂等接收、Outbox、租约所有权和事务边界
面试官提问
请覆盖重复提交、不同答案冲突、至少一次投递、租约丢失和状态推进。
30 秒专业短答
InterviewSession用 version 乐观锁保存状态与当前 Round,Round(session_id,round_id)唯一且保存 answer_hash、分析修订和租约,QuestionVersion/RubricVersion不可变,Evidence回指回答与文档 Span。接收答案的短事务校验状态,同 Payload 重放返回已有 Round,不同 Payload 冲突并要求显式 revision,同时原子写PENDINGRound 与 Outbox;Consumer 至少一次投递后,Worker 用条件更新原子完成PENDING→RUNNING,写入 lease token、到期时间和 attempt,并在事务外调用模型、按 token 续租。提交事务必须同时校验RUNNING、lease token 与接收时的 session version,成功后才保存结果并推进 Session,失败则丢弃旧结果;不能承诺跨模型供应商 exactly-once。
小白解释
每场考试和每道题都有唯一编号,同一答案重复上传只收一次,想改答案必须开修订版;发件箱消费者可以重复通知,但只有从“待处理”原子认领为“处理中”的阅卷员拿到限时工牌,并持续续期,交卷时工牌和考场版本仍有效,结果才会推进考试。
- 合格线| 唯一 Round、answer hash、显式 revision、Outbox 至少一次消费、原子
PENDING→RUNNING、续租、lease/version 提交校验; - 加分项| 续租、看门狗、最大 attempt/预算、稳定供应商调用 ID、租约丢失整事务回滚;
- 高频误区| 让状态机同步执行慢模型、把模型调用放在长事务内,或旧 Worker 丢失 lease 后仍推进 Session;
- 下一问| 实现能抵抗重复后,继续处理评分漂移、恶意证据、跨租户数据和中断恢复。
第 5 题|L5 工程|评分漂移、提示注入、权限泄露和恢复失败如何排查与治理?
核心考察点|质量止损、版本归因、注入隔离、租户权限与状态恢复
面试官提问
请选评分漂移为主线,并说明其他风险应在哪些边界阻断。
30 秒专业短答
评分漂移先暂停新分数展示并保留历史,固定 answer_hash、回答 Span、模型/Prompt/Rubric/权重/语料/索引版本和发布批次,用冻结答案集做新旧盲评,单变量回退并创建显式 revision;修复后加入门禁和漂移告警。检索文本按不可信数据处理,以来源/版本/权限过滤和引用 Schema 防注入;tenant/user 作用域在 Repo、缓存、RAG、对象存储和异步上下文中由服务端强制;恢复只依赖事件、resume/checkpoint_state 和 version,不依赖页面或模型记忆。
小白解释
同一答卷突然从 4 分变 2 分时,先冻结新成绩,查评分表、阅卷员和参考资料哪项换了,再用同一批答卷盲测;别人的答卷不能夹纸条改评分规则,每位考生档案也必须用门禁隔离,断电后从正式考务记录恢复。
- 合格线| 冻结/回退、固定证据与版本、服务端作用域、持久检查点;
- 加分项| 严重错误门禁反转、人工一致性区间、跨租户缓存碰撞、暂停/流式中断故障注入;
- 高频误区| 覆盖历史分数、只改 Prompt,或从模型生成的 user_id 决定数据范围;
- 下一问| 单类故障能闭环后,需要建设限制动作、版本化评测、影子灰度与失败回流的架构。
第 6 题|L6 架构|如何构建有限动作空间与版本化评测发布架构?
核心考察点|受控 Agent、全链版本、评测门禁、灰度和质量感知降级
面试官提问
请说明能力图谱、动作策略、评测集、Trace、灰度和降级如何联动。
30 秒专业短答
题目以能力图谱定义前置、难度、覆盖、Rubric 和最大追问深度,Agent 动作限制为
ASK_FOLLOWUP/CLARIFICATION/HINT/EXPLAIN/MOVE/FINISH等枚举,策略层校验 capability、问题指纹、预算和终止。模型、Prompt、题目、Rubric、权重、语料、索引与 Workflow 共同版本化;发布先在含正确/错误/口语/代码/注入/承认不知道的人工标注集做影子评测,再小流量灰度,按质量、延迟、成本和安全决定扩量或回滚。RAG/评分失败时降级到固定题或结构反馈,并明确降低结论强度。
小白解释
面试官只能从规定动作菜单选下一步,题库还记录能力地图和最大追问层数;新评分员先批改标准卷但不公开成绩,再小范围试用。资料不足时可以继续练表达,却不能假装已经核实技术事实。
- 合格线| 有限动作、策略校验、固定人工集、Trace、灰度/回滚和降级标记;
- 加分项| 追问相关/重复/门禁指标、失败 EvalCase、申诉 revision 和单变量因果归因;
- 高频误区| 让 Agent 自由生成任意动作,或只看接口成功率决定扩量;
- 下一问| 最后必须审计当前仓库到底有哪些项目证据,避免把方案写成经历。
第 7 题|L7 项目复盘|当前能否把 AI 面试教练讲成已上线项目?
核心考察点|项目真实性、证据清单、个人贡献与未知止步
面试官提问
请逐项说明代码、表、接口、测试、Trace、标注集、指标、事故和个人贡献证据。
30 秒专业短答
不能。当前仓库只有项目设计、概念数据模型、伪代码与关联知识文档;没有本项目可执行代码、真实数据库表或迁移、可调用接口、自动化测试、运行 Trace、人工标注集、灰度报告、实测质量/延迟/成本指标或线上事故记录,也没有可验证的个人实现贡献。因此只能说“设计了状态机 + RAG 证据 + Rubric + 受控 Agent 的实现与验证方案”,绝不能包装成上线经历;未来必须用提交记录、接口契约、迁移、测试、Trace 和评测报告逐项升级证据。
小白解释
目前有考场设计图、评分规则和阅卷伪流程,但还没有真正搭建教室、数据库、考试录像或学生成绩;可以讲方案与风险,不能说已经办过考试或取得效果。
- 合格线| 明确当前仅为设计,逐项列出缺失代码、数据、运行和评测证据;
- 加分项| 给出固定题库/状态机→RAG/评分→受控 Agent→个性化报告的实施与证据路线;
- 高频误区| 把概念表当真实数据库,把伪代码当实现,或虚构指标、事故和个人贡献;
- 下一问| 本组题结束;下一步应先实现固定题库、状态机和可回归 Rubric 基线,再逐步引入 RAG 与 Agent。
4. 自测与评分
- [ ] 用一分钟讲清“状态机 + RAG + Rubric + 受控 Agent”的职责;
- [ ] 为 Round 重复提交、不同 Payload、Lease 过期和 Outbox 重投写状态测试;
- [ ] 构造正确、部分正确、自信错误、注入和主动承认不知道的评分集;
- [ ] 为评分漂移、跨租户泄露和暂停恢复写故障闭环;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 第 7 题不得把设计表、伪代码或故障演练包装成实际实现。
5. 事实边界与参考资料
- 单一事实源:AI 面试教练项目;
- 源文档依据包括 OpenAI Agents SDK、OpenTelemetry 与 OWASP LLM 安全官方资料,并关联本仓库 RAG、Agent 和系统设计主题;
- Rubric 阈值、Judge 模型、追问动作、租约时长、预算和质量目标必须由人工标注、目标负载和实际实现验证;
当前无法确认| 项目代码、真实表/接口、测试、Trace、标注集、实测指标、线上事故、用户结果和个人实现贡献。
6. 总结
一句话记忆: AI 面试教练用状态机守流程、RAG 给证据、Rubric 约束评分、受控 Agent 选择下一问,并由版本化评测证明质量。
- 一次一题、状态、预算、评分门禁和终止属于确定性运行时;
- 每个分数要回到回答 Span、知识证据、Rubric 和完整版本;
- Round 唯一约束、Outbox Consumer、Worker 原子认领、Lease 续租与乐观锁共同处理重复和异步并发;
- 漂移、注入、权限、隐私和恢复都必须进入故障演练与发布门禁;
- 当前只有设计与伪代码,不能声称已有实现、指标、事故或上线经验。