外观
AI 应用系统设计 极简一问一答
定位|
AI 应用系统设计一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。
1. 怎么使用
本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。
- 正式主题: 01-AI应用系统设计
- 深度题库: AI 应用系统设计专项面试题
- 阅读方式: 先遮住答案口述;答不出机制、边界或证据,再进入深度材料。
图:AI 应用系统设计 十题极简脑图
替代文本: AI 应用系统设计从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。
图表加载中…
读图结论: 掌握 AI 应用系统设计 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。
2. 极简一问一答
Q001|设计 AI 应用时,第一步应该澄清什么?
先明确用户是谁、核心任务、输入输出、成功与失败标准,再定义系统 SLO 与质量 SLO,包括请求率和峰值、输入/输出长度、延迟、可用性、新鲜度、成本、数据保留、权限和合规。还要确认模型是在建议、生成、决策还是执行真实动作,以及超时、错答和供应商不可用时允许怎样降级。
Q002|模型、确定性业务服务、同步链路和异步链路如何划分?
模型适合概率性理解、生成与候选决策,鉴权、业务状态、金额计算、权限、预算和最终验收应由确定性服务负责。短问答可走支持取消和流式返回的同步链路;视频、批量评测和长研究应创建可恢复异步 Run;索引和评测集构建属于版本化离线数据链路。高风险副作用即使由 Agent 建议,也必须经过服务端校验与批准。
Q003|如何估算 LLM 应用的容量与单请求成本?
在到达率与完成率长期平衡的稳态系统中,平均在途请求数可粗估为
L≈λW,即平均请求率乘平均停留时间;它不代表峰值或尾部容量。输入速率为QPS×平均输入 Token,输出速率为QPS×平均输出 Token,两者分别对应 Prefill 与 Decode 的不同计算、Batching 和 KV Cache 行为,不能相加后直接当模型吞吐。成本可按输入/输出单价加检索与工具成本估算,但价格、配额和硬件吞吐必须用目标版本官方资料和压测刷新。
Q004|AI 应用的接口、Run 状态机、队列和版本如何设计?
外部使用业务接口创建、查询、取消和批准 Run,供应商错误与状态由模型网关归一化;同步与异步共享稳定 Run ID,状态包含创建、运行、等待输入/批准、转异步、取消、失败和完成,并通过版本号、幂等命令和合法迁移推进。业务事务与异步启动用 Outbox/队列衔接,Worker 用租约或条件更新认领;每个 Run 绑定模型、Prompt、语料、索引、Rubric、Workflow 和工具版本指纹以及必要证据。
Q005|生产 AI 系统如何同时治理可靠性、质量、成本和安全?
我会把系统 SLI(TTFT、p95/p99、完成率、超时、队列)与质量 SLI(事实、引用、评分、拒答、降级质量)关联到同一 Run,同时记录模型/检索/工具各 Span、Token、成本、权限决策和版本。若灰度或扩流阶段出现“接口成功但质量回归”,先停止候选流量并回滚最近健康版本,再固定失败 Run 与 candidate_id,按网关→编排→检索→模型→工具重放;失败样本加入固定回归集,修复后生成新的候选版本,从离线门禁重新验证,不能把原失败候选直接送回在线。
Q006|如何设计可替换、可缓存、可降级、可回滚的 AI 平台?
API 网关负责鉴权、租户与限流,业务编排依赖
generate_answer等内部能力接口,经模型网关完成供应商路由、错误归一化、超时、配额和成本;RAG 与 Agent Runtime 分别管理证据和受控动作。精确、语义、检索、前缀和工具缓存都要绑定影响输出的权限、时效和版本;降级可依次切模型、缩上下文、固定 Workflow/题库、只读缓存或转异步,并明确标记能力变化。候选版本必须依次通过离线门禁、灰度和扩流,任一失败都阻断或原子回滚最近健康版本,失败样本只能进入回归集,不能让失败候选绕过门禁上线。
Q007|如何用证据证明一个 AI 应用系统设计是有效的?
这是源文档中的示例设计:采用会话 API、统一 Run 状态机、RAG、受控 Agent、模型网关、版本指纹和异步复盘。难点是系统/质量 SLO 联动、多版本归因、同步转异步与权限隔离;候选亮点必须用契约测试、固定回归集、降级矩阵、重复请求/Worker 重启/跨租户故障注入、Run Trace 和回滚演练证明。当前没有真实部署与实测,因此不能声称供应商无感切换、既定吞吐、价格、SLO 或业务收益;实际供应商能力与价格要查目标版本官方资料并压测。
Q008|这个专题最常见的误区是什么?
常见误区有三类:从模型或向量库开始,或只定义接口成功率而没有答案质量;直接暴露供应商状态,或超时后另建一个无法关联的新 Run;业务代码散落具体模型名,或语义缓存只按相似问题跨用户复用。
Q009|怎样做最小自测?
最小自测分三步:为一个 AI 应用写功能需求、系统 SLO、质量 SLO 和安全边界;用明确假设计算平均并发、输入/输出 Token 速率,并列出不能由公式回答的问题;画出在线同步、异步 Run 和离线索引/评测三条链路。
Q010|回答这个专题时,证据边界是什么?
Little's Law 只用于稳态平均量级估算,Prefill 输入与 Decode 输出 Token 分开;供应商吞吐、配额和价格必须查目标版本官方资料并实测。
3. 总结
一句话记忆: 先明确用户是谁、核心任务、输入输出、成功与失败标准,再定义系统 SLO 与质量 SLO,包括请求率和峰值、输入/输出长度、延迟、可用性、新鲜度、成本、数据保留、权限和合规。
- 先明确用户是谁、核心任务、输入输出、成功与失败标准,再定义系统 SLO 与质量 SLO,包括请求率和峰值、输入/输出长度、延迟、可用性、新鲜度、成本、数据保留、权限和合规。
- 我会把系统 SLI(TTFT、p95/p99、完成率、超时、队列)与质量 SLI(事实、引用、评分、拒答、降级质量)关联到同一 Run,同时记录模型/检索/工具各 Span、Token、成本、权限决策和版本。
- 常见误区有三类:从模型或向量库开始,或只定义接口成功率而没有答案质量。
- Little's Law 只用于稳态平均量级估算,Prefill 输入与 Decode 输出 Token 分开。