外观
AI 应用系统设计专项面试题
目录
1. 使用说明
- 对应知识主题:AI 应用系统设计;
- 角色:资深面试官从需求澄清追问到可回滚生产架构,高级技术应聘者负责给出容量假设、状态、版本、质量和安全边界;
- 回答顺序:先用 1~3 句专业短答,再用生活化解释;先定义任务、SLO 和规模,再讨论模型、RAG、Agent 与基础设施;
事实红线| Little's Law 只用于稳态平均量级估算,Prefill 输入与 Decode 输出 Token 分开;供应商吞吐、配额和价格必须查目标版本官方资料并实测;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:AI 应用系统设计 L1~L7 递进路线
替代文本: L1 需求/SLO/规模 → L2 模型与确定性服务、同步异步边界 → L3 容量估算 → L4 接口/状态/队列/版本实现 → L5 生产治理 → L6 网关/缓存/降级/回滚架构 → L7 证据化项目复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先判断“系统为什么存在、怎样算成功”,再拆分三类链路并做量级估算,随后把 Run 和版本落到实现,最后要求用测试、Trace 和评测证明架构决策。
图:AI 应用在线服务与候选版本安全发布闭环
替代文本: 在线请求由接入层和确定性编排协调 RAG、模型网关、受控工具及状态层,并把运行信号送入评测观测。每个 candidate_id 必须依次经过离线门禁、小流量灰度和逐级扩流:离线失败立即阻断且不进入在线,灰度或扩流失败立即把在线版本指针回滚到最近健康版本;失败样本只经脱敏复核进入固定回归集,修复后生成新的候选版本重新走门禁,原失败候选没有通往在线版本指针的路径。
图表加载中…
读图结论: 候选版本只有沿“离线门禁 → 小流量灰度 → 逐级扩流”连续通过才会晋升;离线失败被阻断,灰度或扩流失败只触发健康版本回滚和样本回流,绝不能把失败候选接到在线版本指针。
在线服务面中,状态机拥有唯一合法的 Run 迁移,RAG、模型和工具只能返回带证据或审计信息的能力结果;发布面则把系统 SLO 与质量 SLO 绑定到同一 Run、candidate_id 和版本指纹。离线失败候选没有任何在线路由,灰度或扩流失败候选也不得继续放量;失败证据只能进入脱敏复核与固定回归集,完成修复并产生新的 candidate_id 后才可重新从离线门禁开始。
3. 一问一答
第 1 题|L1 概念|设计 AI 应用时,第一步应该澄清什么?
核心考察点|需求澄清、两类 SLO、工作负载与风险边界
面试官提问
请从用户任务、质量、SLO、规模、成本和安全回答,不要第一句就选模型。
30 秒专业短答
先明确用户是谁、核心任务、输入输出、成功与失败标准,再定义系统 SLO 与质量 SLO,包括请求率和峰值、输入/输出长度、延迟、可用性、新鲜度、成本、数据保留、权限和合规。还要确认模型是在建议、生成、决策还是执行真实动作,以及超时、错答和供应商不可用时允许怎样降级。
小白解释
盖房前先问住几个人、要几层、多久交付、预算多少和地震标准,而不是先挑瓷砖品牌;AI 模型只是材料之一,需求决定房子的结构。
- 合格线| 任务/成功标准、质量、延迟、吞吐、成本、安全与降级;
- 加分项| 区分可回答/不可回答、高风险动作、引用、人工批准、多租户和地区约束;
- 高频误区| 从模型或向量库开始,或只定义接口成功率而没有答案质量;
- 下一问| 需求明确后,继续划分模型能力与确定性服务,以及同步、异步、离线三条链路。
第 2 题|L2 边界|模型、确定性业务服务、同步链路和异步链路如何划分?
核心考察点|概率能力与确定性职责、在线/异步/离线边界
面试官提问
请用问答、视频生成、索引构建和高风险工具说明边界。
30 秒专业短答
模型适合概率性理解、生成与候选决策,鉴权、业务状态、金额计算、权限、预算和最终验收应由确定性服务负责。短问答可走支持取消和流式返回的同步链路;视频、批量评测和长研究应创建可恢复异步 Run;索引和评测集构建属于版本化离线数据链路。高风险副作用即使由 Agent 建议,也必须经过服务端校验与批准。
小白解释
顾问可以写方案和建议下一步,但财务记账、门禁开锁和验收签字要由正式系统完成;几秒能完成的咨询当面回答,几个小时的施工要发工单,仓库盘点则另走夜间批处理。
- 合格线| 模型可替换且无授权权力,三类链路按时长、恢复和新鲜度划分;
- 加分项| 同步转异步共享同一 Run ID,取消、检查点、幂等和降级结果有明确状态;
- 高频误区| 把长任务塞入 HTTP 请求,或让 Agent 直接持有生产最高权限;
- 下一问| 链路划分后,需要基于明确假设估算并发、Token、存储与成本量级。
第 3 题|L3 原理|如何估算 LLM 应用的容量与单请求成本?
核心考察点|稳态平均估算、输入/输出 Token、峰值与压测边界
面试官提问
请说明 Little's Law 的假设,并把输入与输出 Token 分开。
30 秒专业短答
在到达率与完成率长期平衡的稳态系统中,平均在途请求数可粗估为
L≈λW,即平均请求率乘平均停留时间;它不代表峰值或尾部容量。输入速率为QPS×平均输入 Token,输出速率为QPS×平均输出 Token,两者分别对应 Prefill 与 Decode 的不同计算、Batching 和 KV Cache 行为,不能相加后直接当模型吞吐。成本可按输入/输出单价加检索与工具成本估算,但价格、配额和硬件吞吐必须用目标版本官方资料和压测刷新。
小白解释
平均每分钟来 10 位顾客、每人停留 3 分钟,店里平均约有 30 人,但午间突发排队仍可能爆满;读一份长菜单和慢慢写一篇回答也不是同一种工作,必须分开测。
- 合格线| 明确
L=λW假设、平均非峰值、Prefill/Decode 分开; - 加分项| 长度分布、p95/p99、队列、突发、缓存、Batching、KV Cache 和重试放大;
- 高频误区| 用日活代替容量,或把总 Token/s 直接等同 GPU 服务能力;
- 下一问| 量级估算完成后,要把统一 Run、接口、队列、状态与版本指纹落到可恢复实现。
第 4 题|L4 实现|AI 应用的接口、Run 状态机、队列和版本如何设计?
核心考察点|能力接口、统一生命周期、异步一致性与因果版本
面试官提问
请说明同步转异步、重复请求、审批、取消和可重放输出。
30 秒专业短答
外部使用业务接口创建、查询、取消和批准 Run,供应商错误与状态由模型网关归一化;同步与异步共享稳定 Run ID,状态包含创建、运行、等待输入/批准、转异步、取消、失败和完成,并通过版本号、幂等命令和合法迁移推进。业务事务与异步启动用 Outbox/队列衔接,Worker 用租约或条件更新认领;每个 Run 绑定模型、Prompt、语料、索引、Rubric、Workflow 和工具版本指纹以及必要证据。
小白解释
每项工作只有一张工单,无论当场处理还是转后台都沿用同一编号;重复点击不会另开新单,审批和取消写进状态,交接单通过可靠投递给工人,最后能查到用了哪套材料和规则。
- 合格线| Run ID、状态机、幂等、队列/Outbox、取消/审批和版本指纹;
- 加分项| 事件序号、检查点、租约回收、死信、外部结果对账和重放边界;
- 高频误区| 直接暴露供应商状态,或超时后另建一个无法关联的新 Run;
- 下一问| 实现可恢复后,继续处理稳定性、质量、成本、观测和安全的联合故障。
第 5 题|L5 工程|生产 AI 系统如何同时治理可靠性、质量、成本和安全?
核心考察点|系统/质量双 SLO、分层 Trace、止损与防回归
面试官提问
请给出一个“接口成功但质量失败”的排障闭环和主要观测信号。
30 秒专业短答
我会把系统 SLI(TTFT、p95/p99、完成率、超时、队列)与质量 SLI(事实、引用、评分、拒答、降级质量)关联到同一 Run,同时记录模型/检索/工具各 Span、Token、成本、权限决策和版本。若灰度或扩流阶段出现“接口成功但质量回归”,先停止候选流量并回滚最近健康版本,再固定失败 Run 与 candidate_id,按网关→编排→检索→模型→工具重放;失败样本加入固定回归集,修复后生成新的候选版本,从离线门禁重新验证,不能把原失败候选直接送回在线。
小白解释
餐厅按时上菜不代表菜能吃;要同时看出餐时间、食材批次、厨师版本、顾客是否完成用餐和是否用了备用菜单。出问题先停新配方,找到具体订单复做,再把这道失败菜加入以后必检清单。
- 合格线| Run 级关联、版本归因、回滚、评测和失败入库;
- 加分项| 限流/背压、熔断、有界重试、成本预算、提示注入、权限缓存和敏感数据策略;
- 高频误区| 请求返回 200 就算成功,或质量差时不取证直接调 Prompt;
- 下一问| 各类风险可观测后,需要设计模型网关、缓存、降级与回滚的整体架构。
第 6 题|L6 架构|如何设计可替换、可缓存、可降级、可回滚的 AI 平台?
核心考察点|能力解耦、分层缓存、质量感知降级、灰度与回滚
面试官提问
请说明模型网关、业务编排、RAG/Agent、缓存键和降级阶梯。
30 秒专业短答
API 网关负责鉴权、租户与限流,业务编排依赖
generate_answer等内部能力接口,经模型网关完成供应商路由、错误归一化、超时、配额和成本;RAG 与 Agent Runtime 分别管理证据和受控动作。精确、语义、检索、前缀和工具缓存都要绑定影响输出的权限、时效和版本;降级可依次切模型、缩上下文、固定 Workflow/题库、只读缓存或转异步,并明确标记能力变化。候选版本必须依次通过离线门禁、灰度和扩流,任一失败都阻断或原子回滚最近健康版本,失败样本只能进入回归集,不能让失败候选绕过门禁上线。
小白解释
总调度台按任务选择不同供应商,仓库缓存必须写清客户权限和批次;主供应商故障时可换备用、减少服务范围或改为稍后交付,但不能把简化服务冒充原服务,且随时能切回旧方案。
- 合格线| 网关/编排/RAG/Agent 分工,缓存含权限版本,降级可解释且可回退;
- 加分项| 契约测试、双模型切换演练、配额感知路由、取消传播和降级结果独立 SLO;
- 高频误区| 业务代码散落具体模型名,或语义缓存只按相似问题跨用户复用;
- 下一问| 最后要说明如何证明架构决策,而不是把设计目标写成已实现成果。
第 7 题|L7 项目复盘|如何用证据证明一个 AI 应用系统设计是有效的?
核心考察点|证据化亮点、故障验证、供应商动态事实与诚实复盘
面试官提问
以示例 AI 面试教练说明难点、亮点、故障演练和未知边界。
30 秒专业短答
这是源文档中的示例设计:采用会话 API、统一 Run 状态机、RAG、受控 Agent、模型网关、版本指纹和异步复盘。难点是系统/质量 SLO 联动、多版本归因、同步转异步与权限隔离;候选亮点必须用契约测试、固定回归集、降级矩阵、重复请求/Worker 重启/跨租户故障注入、Run Trace 和回滚演练证明。当前没有真实部署与实测,因此不能声称供应商无感切换、既定吞吐、价格、SLO 或业务收益;实际供应商能力与价格要查目标版本官方资料并压测。
小白解释
设计图上写“防火”不等于建筑真的安全,要看材料检验、消防演练和故障记录;现在能列出怎样测试这套面试系统,不能把计划中的容量和成绩当成已经取得的结果。
- 合格线| 明确设计、验证材料和真实实测之间的边界;
- 加分项| 一次一变量灰度、固定工作负载/数据集、原始失败样本、版本指纹和回滚结果;
- 高频误区| 用几个 Demo 证明架构,或虚构供应商吞吐、单价和个人贡献;
- 下一问| 本组题结束;可继续用同一方法深挖 AI 视频和面试教练两个长任务项目。
4. 自测与评分
- [ ] 为一个 AI 应用写功能需求、系统 SLO、质量 SLO 和安全边界;
- [ ] 用明确假设计算平均并发、输入/输出 Token 速率,并列出不能由公式回答的问题;
- [ ] 画出在线同步、异步 Run 和离线索引/评测三条链路;
- [ ] 为模型、检索、工具和质量回归设计降级与回滚演练;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 第 7 题不得虚构供应商价格、吞吐、SLO 或项目收益。
5. 事实边界与参考资料
- 单一事实源:AI 应用系统设计;
- 源文档依据包括 OpenAI Production Best Practices、OpenTelemetry、Temporal 与 Google SRE SLO 官方资料;
- Little's Law 估算依赖稳态与平均量级假设,真实容量需覆盖峰值、长尾、长度分布、缓存、Batching 和重试压测;
当前无法确认| 示例系统的供应商能力、吞吐、配额、当前价格、真实负载、质量、SLO、成本和业务效果。
6. 总结
一句话记忆: AI 系统设计先定义任务、两类 SLO 与工作负载,再把概率模型放进可恢复、可评测、可降级的确定性系统。
- 模型负责概率能力,身份、状态、预算、权限与验收由确定性服务掌握;
- 同步、异步和离线链路使用不同状态、指标与恢复机制;
- Little's Law 只给稳态平均量级,输入和输出 Token 必须分开估算;
- 模型网关、版本指纹、分层缓存和质量感知降级支撑灰度与回滚;
- 架构亮点必须由测试、Trace、评测和演练证明,不能虚构动态供应商数据。