外观
AI 全栈极简一问一答
定位| 一页式 AI 全栈速查入口。只保留定义、机制、边界、选型、指标和排障关键词;每个问答卡应在 10~60 秒内读完。本文不替代正式主题、公式推导、代码实验、项目证据和专项题库。
目录
- 1. 怎么使用
- 2. 一张脑图看全栈
- 3. AI 基础与机器学习
- 4. 深度学习与多模态生成
- 5. Transformer 与 LLM
- 6. RAG 与知识库
- 7. Agent 与工作流
- 8. AI 工程与系统设计
- 9. 项目表达与生产排障
- 10. 一分钟检查清单
- 11. 深挖入口与事实边界
- 12. 总结
1. 怎么使用
阅读优先级| 扫读只看目录与“本章重点”;自测先遮住答案,只读
Qxxx;深挖再进入对应正式主题或专项题库。
Q001|这份专题解决什么问题?
快速总览、闭卷复习、面试热身、定位知识缺口;不负责完整教学。
Q002|怎样阅读?
先看脑图;再按模块闭卷答题;答不出、说不清边界或没有项目证据,就进入对应正式主题。
Q003|什么叫“一分钟内”?
单个问答卡 10~60 秒;先说结论、机制、边界;需要追问时再展开。
Q004|什么叫“掌握”?
能解释、能画链路、能实现最小实验、能说失败模式、能给验证证据;不是只认得名词。
2. 一张脑图看全栈
总纲| 数据可信 → 模型能力 → 外部证据 → 受控行动 → 工程交付。任何一段缺失,都不能称为生产级 AI 闭环。
图:AI 全栈极简知识脑图
替代文本: AI 全栈从数据与数学开始,经机器学习、深度学习、多模态和 LLM 获得模型能力;RAG 提供外部证据,Agent 提供受控行动,AI 工程与系统设计负责质量、可靠性、成本、安全和交付;项目与排障用真实证据验收全部能力。
图表加载中…
读图结论: 模型能力只是中段;生产级 AI 必须把数据、证据、行动、工程治理和项目验证连成闭环。
3. AI 基础与机器学习
本章重点| 先保证数据切分、指标口径和基线可信,再讨论模型复杂度;评测失真时,模型越复杂,错误越隐蔽。
3.1 数据、数学与评测
Q005|AI、ML、DL、生成式 AI 什么关系?
AI 是总集;ML 从数据学习;DL 用深层神经网络;生成式 AI 学习分布并生成新内容。
Q006|训练集、验证集、测试集分别做什么?
训练集拟合参数;验证集选超参数与方案;测试集只做最终无偏评估。
Q007|什么是数据泄漏?
训练阶段获得推理时不应知道的信息;结果虚高、上线失效;先按用户、时间、实体或业务事件隔离。
Q008|为什么要固定随机种子?
降低随机波动、便于复现;不能保证跨硬件、算子、版本完全一致。
Q009|向量和矩阵在 AI 中做什么?
向量表示样本或特征;矩阵表示批量数据、线性变换和参数;核心运算是乘加。
Q010|梯度是什么?
损失对参数的偏导;方向表示局部变化最快方向;负梯度用于降低损失。
Q011|学习率过大或过小会怎样?
过大:震荡、发散;过小:收敛慢、易停在平台;配合调度、Warmup、归一化观察。
Q012|损失函数与评测指标有何区别?
损失函数用于可微优化;评测指标对齐业务目标;二者可以不同但不能目标冲突。
Q013|Accuracy 何时失真?
类别极不平衡、错误成本不同;改看 Precision、Recall、F1、PR-AUC、分桶错误成本。
Q014|Precision 与 Recall 怎么选?
误报代价高看 Precision;漏报代价高看 Recall;最终用阈值和业务成本共同定。
Q015|F1 与 AUC 各看什么?
F1 是固定阈值下 Precision/Recall 调和均值;AUC 看跨阈值排序能力;都不能替代业务验收。
Q016|交叉验证解决什么问题?
小数据下估计泛化均值与方差;时间序列必须按时间滚动,不能随机打乱未来信息。
3.2 机器学习核心
Q017|监督、无监督、半监督、强化学习是什么?
监督用标签;无监督找结构;半监督混合少量标签与大量无标签;强化学习从奖励学习策略。
Q018|分类与回归的区别?
分类预测离散类别或概率;回归预测连续值;看输出空间与损失,不看模型名字。
Q019|过拟合与欠拟合是什么?
过拟合:训练好、泛化差;欠拟合:训练与验证都差;分别从数据、容量、正则、优化排查。
Q020|偏差与方差是什么?
高偏差:模型假设过强;高方差:对样本扰动敏感;目标是在数据规模与复杂度下平衡。
Q021|L1 与 L2 正则有什么区别?
L1 倾向稀疏;L2 平滑缩小权重;都通过限制复杂度降低过拟合。
Q022|为什么先做简单基线?
建立可解释下限、暴露数据问题、量化复杂方案增益;没有基线就无法证明复杂度值得。
Q023|特征工程还有价值吗?
有;小数据、结构化数据、业务规则、可解释性场景仍关键;深度模型只是自动学习更多表示。
Q024|树模型与神经网络怎么选?
结构化中小数据优先树模型基线;高维非结构化与大规模表示学习优先神经网络;用同集实测。
Q025|Go、Python、Java 在 AI 工程中怎么分工?
Python:模型与数据生态;Go:高并发服务与工具;Java:企业系统集成;按团队、生态、延迟、维护选。
4. 深度学习与多模态生成
本章重点| 神经网络靠可微计算与反向传播学习表示;多模态生成额外增加跨模态对齐和时间连续性约束。
4.1 神经网络
Q026|神经网络本质是什么?
可微函数的层叠;通过参数化变换学习输入到输出的复杂映射。
Q027|前向传播做什么?
输入逐层变换得到预测与损失;保存反向传播需要的中间量。
Q028|反向传播做什么?
沿计算图用链式法则计算每个参数梯度;分支梯度相加;优化器负责更新。
Q029|激活函数为什么必要?
引入非线性;否则多层线性变换仍等价于一层线性;常用 ReLU、GELU、SiLU。
Q030|梯度消失与爆炸怎么处理?
残差连接、归一化、合理初始化、激活函数、梯度裁剪、学习率与深度控制。
Q031|BatchNorm 与 LayerNorm 区别?
BatchNorm 按批次统计,受 batch 影响;LayerNorm 按样本特征归一化,更适合序列与 Transformer。
Q032|Dropout 做什么?
训练时随机屏蔽神经元,降低共适应;推理时关闭;过强会欠拟合。
Q033|CNN 的核心优势?
局部连接、权重共享、平移归纳偏置;适合图像局部模式与高效特征提取。
4.2 生成模型与多模态
Q034|VAE 的核心机制?
编码为概率潜变量,重参数化采样,重构损失加 KL 正则;潜空间连续,但图像可能偏平滑。
Q035|GAN 的核心机制?
生成器与判别器对抗训练;图像锐利,但训练不稳、可能模式坍塌。
Q036|Diffusion 的核心机制?
前向逐步加噪;反向学习去噪;质量与可控性强,代价是多步采样与算力。
Q037|VAE、GAN、Diffusion 怎么选?
VAE 重潜空间与重构;GAN 重快速锐利生成;Diffusion 重质量与条件控制;按任务实测。
Q038|CLIP 解决什么问题?
用对比学习把图像与文本映射到共享语义空间;支持检索、零样本分类和跨模态对齐。
Q039|多模态对齐不等于什么?
不等于精确定位、事实理解或因果推理;共享向量接近只说明训练目标下语义相似。
Q040|图像生成的关键控制条件?
Prompt、参考图、ControlNet/结构条件、随机种子、采样器、步数、CFG、分辨率。
Q041|视频生成比图像生成难在哪?
增加时间维;要同时保证身份、动作、空间、物体、光照与运动连续性。
Q042|视频连续性怎样治理?
continuity_state、参考帧、首尾帧、短镜头、镜头路由、剪辑余量、失败样本回灌。
Q043|如何评估多模态生成?
自动指标加人工验收;语义、质量、一致性、事实、可用率、成本、延迟、合规分开评。
5. Transformer 与 LLM
本章重点| 按表示 → 架构 → 训练 → 对齐 → 推理 → 可靠输出记忆;Prompt、RAG 和微调解决的是不同层次的问题。
5.1 表示与架构
Q044|Token 是什么?
模型处理文本的离散单位;可能是字、子词、字节片段;Token 数影响上下文、延迟和成本。
Q045|Embedding 是什么?
把离散对象映射为稠密向量;距离表达训练目标下的关系,不等于人类完整理解。
Q046|位置编码解决什么问题?
Attention 本身不含顺序;位置编码注入绝对或相对位置信息;常见 Learned、RoPE、ALiBi。
Q047|Self-Attention 做什么?
每个 Token 按相关性聚合其他 Token 信息;核心是
softmax(QKᵀ/√d)V。
Q048|Q、K、V 怎么理解?
Q 表示我在找什么;K 表示我能被怎样匹配;V 表示匹配后提供什么内容。
Q049|为什么除以 √d?
控制点积方差,避免维度增大导致 Softmax 饱和、梯度过小。
Q050|多头注意力有什么价值?
在不同子空间并行学习不同关系;增加表达能力,也增加计算与参数开销。
Q051|残差连接有什么价值?
保留原信息、改善梯度传播、支持更深网络;不是自动消除训练不稳定。
Q052|Transformer 为什么取代多数 RNN?
训练可并行、长程依赖路径短、扩展性强;代价是标准 Attention 随序列长度近似二次增长。
Q053|Encoder、Decoder、Encoder-Decoder 区别?
Encoder 擅长理解;Decoder 自回归生成;Encoder-Decoder 适合输入输出转换;边界取决于训练方式。
5.2 训练、微调与对齐
Q054|预训练在学什么?
从大规模数据学习通用统计规律与表示;常见目标是下一 Token 预测或掩码预测。
Q055|SFT 做什么?
用指令—回答样本学习任务格式与行为;提高可用性,不自动保证事实正确。
Q056|RLHF 的基本链路?
收集偏好数据、训练奖励模型、用强化学习优化策略;复杂、昂贵、易奖励偏移。
Q057|PPO 与 DPO 区别?
PPO 在线优化策略并显式用奖励;DPO 直接从偏好对训练,链路更简;效果依赖数据与约束。
Q058|LoRA 为什么省参数?
冻结原权重,只学习低秩增量
ΔW=BA;显存与存储低,但推理、合并和任务干扰仍需评测。
Q059|QLoRA 比 LoRA 多什么?
基座权重量化后再训练 LoRA;进一步省显存;代价是量化误差与实现复杂度。
Q060|何时全量微调?
数据充分、预算足、需要深度改变模型能力且能完整评测;否则优先 Prompt、RAG、PEFT。
Q061|数据去重为什么重要?
减少记忆、污染、权重偏斜和算力浪费;需做精确去重、近似去重、跨分割污染检查。
Q062|数据配比怎样影响模型?
决定能力、语言、领域与安全倾向;不能只看总量,要按来源、质量、任务和阶段配比。
Q063|混合精度训练解决什么?
用 FP16/BF16 降显存、提吞吐;关键累加保留高精度;FP16 常需 Loss Scaling。
Q064|数据并行、张量并行、流水线并行区别?
数据并行分 batch;张量并行拆单层矩阵;流水线并行拆层;组合取决于模型与集群。
5.3 推理、Prompt 与可靠输出
Q065|Prefill 与 Decode 区别?
Prefill 并行处理输入,偏计算密集;Decode 逐 Token 生成,偏内存带宽与调度。
Q066|KV Cache 为什么加速?
缓存历史 K/V,避免每步重复计算;换来显存占用,长上下文和高并发更明显。
Q067|Temperature、Top-k、Top-p 各做什么?
Temperature 调概率平滑;Top-k 留固定个数;Top-p 留累计概率集合;共同控制随机性。
Q068|量化解决什么?
降低权重与激活精度,节省显存、提高吞吐;需评估精度、算子支持、延迟和硬件收益。
Q069|吞吐与延迟为什么冲突?
更大 Batch 提吞吐,但增加排队和单请求延迟;用动态批处理、优先级、SLO 做平衡。
Q070|Prompt 的关键组成?
角色、目标、上下文、约束、输出 Schema、示例、拒答条件、工具说明;版本化并评测。
Q071|Structured Output 等于结果正确吗?
不等于;只约束形状;服务端仍需 Schema、业务语义、权限、事实与状态校验。
Q072|大模型为什么会幻觉?
目标是生成高概率 Token,不是查询真值;训练知识有限、上下文不足、解码随机、工具失败都可触发。
Q073|Prompt、RAG、Fine-tuning 怎么选?
Prompt 改任务表达;RAG 注入动态事实;Fine-tuning 改稳定行为或领域能力;可组合但先做最小方案。
Q074|上下文越长越好吗?
不是;成本、延迟、注意力稀释、截断风险上升;只保留任务相关且可追溯的信息。
6. RAG 与知识库
本章重点| 按数据治理 → 候选召回 → 融合重排 → 上下文 → 生成引用 → 分层评测排查;Reranker 不能补回漏召回证据。
6.1 数据与索引
Q075|RAG 本质是什么?
检索增强生成;推理时取回外部证据放入上下文,降低知识陈旧与无依据回答。
Q076|RAG 完整链路?
接入、解析、清洗、切块、元数据/ACL、Embedding、索引、召回、融合、重排、上下文、生成、引用、评测。
Q077|数据清洗只去空格吗?
不是;还要结构恢复、去噪去重、表格/OCR、权限、有效期、版本、来源和解析失败处理。
Q078|Chunk Size 怎么定?
语义完整性、检索粒度、模型窗口、文档结构、问题类型共同决定;用标注集实测。
Q079|Overlap 有什么作用与代价?
减少边界信息断裂;代价是索引膨胀、重复召回和上下文浪费。
Q080|父子块解决什么?
子块负责精准召回,父块提供完整上下文;需维护稳定 ID 与层级关系。
Q081|Metadata 必须包含什么?
来源、文档/Chunk ID、租户、ACL、时间、语言、类型、解析器、切片器、Embedding、索引版本。
Q082|为什么 ACL 必须检索前生效?
先召回再隐藏仍可能泄露分数、缓存或上下文;权限过滤应进入候选生成与服务端复核。
Q083|为什么需要稳定 Chunk ID?
支持增量更新、去重、引用、撤权、回滚、评测重放与版本追踪。
6.2 召回、融合与重排
Q084|BM25 擅长什么?
词面精确匹配、编号、专名、可解释;弱点是同义表达与跨语言语义。
Q085|Dense Retrieval 擅长什么?
语义近邻、改写与跨表达;弱点是专名/OOV、不可解释、Embedding 漂移与成本。
Q086|为什么常用混合检索?
BM25 保词面,Dense 保语义;两路互补;融合后再重排,避免无条件二选一。
Q087|异构分数能直接相加吗?
通常不能;量纲与分布不同;优先 RRF 秩融合,或在标注集上校准后学习权重。
Q088|余弦、点积、欧氏距离区别?
余弦看方向;点积兼顾方向与模长;欧氏看绝对距离;向量归一化后排序关系才可能等价。
Q089|ANN 为什么必要?
大规模向量精确全扫成本高;ANN 牺牲少量 Recall 换延迟与吞吐;索引参数需基准测试。
Q090|k_recall、k_rerank、k_context 区别?
候选召回量、进入重排量、最终上下文量;通常
k_recall > k_rerank >= k_context。
Q091|阈值与 Top-k 区别?
Top-k 保固定数量;阈值保达到质量线的候选;可组合,必须用分数分布和标注集校准。
Q092|Reranker 能补回漏召回吗?
不能;只能重排已有候选;漏召回先查 Query、过滤、索引、Embedding 和召回通道。
Q093|Cross-Encoder 为什么更准但更慢?
Query 与文档联合编码,交互充分;每对候选都要推理,成本随候选数增长。
6.3 上下文、评测与生产
Q094|上下文构造要做什么?
去重、排序、父子合并、证据覆盖、Token 预算、来源标注、截断策略、冲突处理。
Q095|召回正确但回答跑偏先查什么?
final_context、重复块、重排分数、Token 截断、Prompt、模型版本、引用与拒答策略。
Q096|偶发检索为空怎样排查?
原始/改写 Query、租户/ACL、过滤、索引与 Embedding 版本、候选数、阈值、超时、降级。
Q097|Recall@K、Precision@K、MRR、NDCG 各看什么?
召全、召准、首个正确结果位置、整体排序质量;按任务选择,不机械全上。
Q098|RAG 答案层评什么?
正确性、完整性、引用支持率、无依据断言率、拒答质量、延迟、成本、人工接管率。
Q099|RAG Trace 至少记录什么?
原始/改写 Query、过滤、各路候选、分数、重排、最终 Chunk、截断、版本、Token、答案与引用。
Q100|实时业务真值应从哪里来?
受控 SQL 或业务 API;历史向量库只提供语义证据,不能猜库存、订单、余额等实时状态。
Q101|向量数据库怎样选?
比较关系库扩展、搜索引擎、专用向量引擎、托管服务;看规模、过滤、混合检索、事务、运维、合规、成本。
Q102|Milvus 适合什么场景?
大规模向量、分布式扩展、复杂索引与过滤;小规模或强事务场景先比较 pgvector 等更简单方案。
Q103|LangChain、LlamaIndex、自研 RAG 怎么选?
LangChain 重编排;LlamaIndex 重数据与检索抽象;自研重控制;按复杂度、可观测、锁定成本选。
Q104|多模态 RAG 多了什么?
OCR/ASR/Caption、页面区域与时间片、多模态路由、分路召回、融合、媒体预算、可定位引用。
7. Agent 与工作流
本章重点| 模型提出候选动作,Runtime 掌握执行权;权限、状态、副作用、终止、恢复和审计必须由确定性系统控制。
7.1 核心机制与控制边界
Q105|Agent 本质是什么?
LLM 在受控 Runtime 中根据目标、状态和观察选择动作;Runtime 管权限、副作用、终止、恢复与审计。
Q106|Agent 与固定工作流区别?
Agent 动态决策下一步;工作流路径预定义;稳定流程优先工作流,不确定任务再引入 Agent。
Q107|ReAct 是什么?
Reason/Act/Observe 循环;思考提出动作,工具返回观察,再更新决策;必须有终止与预算。
Q108|Planning 的价值与风险?
分解复杂目标、协调工具;风险是错误计划、过度规划、上下文膨胀;需分步验证和重规划。
Q109|Tool Calling 与普通 JSON 区别?
Tool Calling 有工具 Schema 与调用语义;普通 JSON 只是文本格式;两者都需服务端校验。
Q110|模型决定调用工具等于模型有权限吗?
不等于;模型只提候选动作;Runtime 做鉴权、参数校验、预算、审批、执行和审计。
Q111|工具 Schema 应包含什么?
名称、用途、参数类型、必填项、枚举、返回契约、错误码、超时、副作用、权限和幂等语义。
Q112|为什么写操作要幂等?
超时可能“已执行但响应丢失”;稳定业务键防重复副作用;结果未知先对账再重试。
Q113|Agent 为什么死循环?
目标模糊、观察无进展、工具持续失败、终止条件缺失、模型重复策略;用步数、时间、成本、状态去重终止。
Q114|失败重试应遵循什么?
先分类:可重试、不可重试、结果未知;只对瞬时且幂等错误限次退避;其余降级、对账或人工处理。
7.2 状态、记忆与框架
Q115|Context 与 Memory 区别?
Context 是本次模型可见输入;Memory 是跨步骤或跨会话可检索状态;Memory 进入模型前仍要筛选。
Q116|短期、长期、情景、语义记忆分别是什么?
当前任务状态、持久偏好、历史事件、抽象事实;不同记忆用不同存储、检索和过期策略。
Q117|Checkpoint 解决什么?
持久化状态、支持中断恢复、重放、人工介入;外部副作用仍需幂等和对账。
Q118|Human-in-the-loop 放在哪?
高风险动作前审批、低置信结果复核、异常恢复与最终验收;不能替代权限和自动校验。
Q119|多 Agent 何时有价值?
角色边界清晰、上下文隔离、任务可并行、独立验收;否则增加通信、冲突、延迟与成本。
Q120|多 Agent 的关键难点?
任务分解、共享状态、协议、冲突仲裁、终止、预算、可观测和最终责任归属。
Q121|LangChain 适合什么?
快速组合模型、Prompt、工具、检索与回调;复杂持久状态和恢复需更明确 Runtime。
Q122|LangGraph 适合什么?
显式状态图、循环、Checkpoint、中断与人工介入;简单线性调用可能过重。
Q123|MCP 解决什么问题?
标准化模型客户端与工具/资源服务的发现和调用;不自动解决鉴权、业务权限和工具正确性。
Q124|MCP Server 的工程边界?
Schema、能力声明、协议传输、错误与生命周期;业务鉴权、配额、审计、隔离仍由服务端治理。
7.3 Coding Agent、安全与评测
Q125|Coding Agent 的基本闭环?
理解任务、检索代码、计划、修改、运行测试、读取反馈、迭代、交付差异与证据。
Q126|Claude Code 与 Codex 应比较什么?
仓库理解、工具协议、沙箱、编辑方式、并行能力、上下文治理、验证闭环;版本能力以实测为准。
Q127|Vibe Coding 的核心风险?
需求漂移、盲信生成、跨层误改、测试缺失、秘密泄露;用任务契约、隔离、Diff、测试、审查、回滚治理。
Q128|Prompt Injection 怎样防?
不信任外部内容;指令与数据分离;工具白名单、最小权限、服务端策略、审批、输出过滤、审计。
Q129|Agent 评测看什么?
任务完成率、步骤正确率、工具成功率、越权率、重复副作用、恢复率、延迟、成本、人工接管。
Q130|Agent Trace 至少记录什么?
目标、状态、模型/Prompt、候选动作、工具参数摘要、观察、错误、重试、Checkpoint、成本、最终状态。
Q131|LangSmith 类工具解决什么?
Trace、数据集、评测、版本对比与调试;不替代业务真值、权限控制和自有监控。
8. AI 工程与系统设计
本章重点| 把概率模型放进确定性工程边界:用 SLO、网关、Trace、评测、安全、成本、降级和回滚约束不确定性。
8.1 服务、可靠性与任务系统
Q132|为什么 AI 服务常用异步 I/O?
模型与外部 API 多为 I/O 等待;异步提升并发连接利用率;CPU 密集任务仍需进程或专用服务。
Q133|流式输出怎样实现?
模型逐 Token 产生事件,经 SSE/WebSocket/HTTP Chunk 转发;需处理断连、取消、背压、错误与最终状态。
Q134|模型网关负责什么?
统一鉴权、路由、限流、超时、重试、熔断、降级、缓存、观测、成本与版本策略。
Q135|超时怎么定?
连接、首 Token、空闲、总时长分开;依据下游分位延迟和上游 SLO,保留降级预算。
Q136|熔断与限流区别?
限流保护容量;熔断隔离持续失败依赖;一个管流量,一个管故障传播。
Q137|降级策略有哪些?
备用模型、缩短上下文、关闭非关键步骤、缓存结果、只返回证据、部分结果、拒答、人工接管。
Q138|长任务为什么要持久化?
进程会重启、外部调用会失败;状态、事件、Checkpoint、幂等键支持断点恢复与重放。
Q139|消息队列重复消费怎么处理?
At-least-once 下用业务幂等键、去重表、状态机、Outbox/Inbox、可重入处理和对账。
8.2 可观测、评测、成本与安全
Q140|日志、指标、Trace 各解决什么?
日志看事件细节;指标看趋势与告警;Trace 看跨组件因果链;三者用
trace_id关联。
Q141|AI 应用版本要追什么?
代码、模型、Prompt、语料、解析器、切片器、Embedding、索引、工具、工作流、评测集与配置。
Q142|离线、在线、人工评测区别?
离线可重复比较;在线看真实行为与业务;人工处理主观、复杂和高风险标准;三者互补。
Q143|怎样定义“成功率”?
先定义成功门槛、分子、分母、窗口、分桶、排除项;技术 200 不等于业务完成。
Q144|单位成功任务成本怎么算?
模型、检索、工具、基础设施、重试、人工总成本 ÷ 通过成功标准的任务数。
Q145|LLM 缓存分几类?
精确响应、语义、Prompt/前缀、Embedding、检索、工具结果;必须管租户、权限、版本、TTL 与失效。
Q146|容量估算看什么?
请求率、并发、输入/输出 Token、TTFT、TPOT、模型吞吐、显存、Batch、峰值、SLO 与降级容量。
Q147|GPU OOM 怎样排查?
权重、KV Cache、激活、Batch、上下文、碎片、并发;先止损限流,再量化、分页、调度或扩容。
Q148|AI 安全核心风险?
Prompt Injection、越权、敏感数据、供应链、模型滥用、数据投毒、输出伤害、资源耗尽与审计缺失。
Q149|最小权限怎样落地?
模型不持凭据;工具按租户、资源、动作授权;短期令牌、白名单、审批、审计、网络与沙箱隔离。
Q150|红队测试测什么?
越狱、注入、数据外泄、工具越权、资源攻击、恶意文件、多轮诱导;失败样本进入回归集。
8.3 系统设计
Q151|生产级 AI 系统设计第一步?
定义用户、任务、真值、成功标准、SLO、风险、数据与成本约束;先定边界再选模型。
Q152|概率模型与确定性系统怎样分工?
模型负责理解、生成、候选决策;服务端负责权限、规则、执行、校验、状态、审计和最终验收。
Q153|什么时候查知识库,什么时候查数据库/API?
静态解释性资料走 RAG;实时业务真值与动作走受控数据库/API;两者可组合但职责不混淆。
Q154|SLO 应包含什么?
可用性、端到端延迟、质量、工具成功、恢复、成本与安全门槛;按任务与租户分桶。
Q155|怎样设计可替换模型?
统一模型接口、能力标签、路由策略、回归集、影子流量、版本指纹、降级与回滚。
Q156|怎样证明架构选型合理?
同约束候选横评;明确数据、规模、SLO、预算、运维、合规;用基准、故障演练和业务实验验证。
9. 项目表达与生产排障
本章重点| 项目表达看约束、决策、证据和边界;生产排障按现象、版本、数据、Trace、止损、修复、回归、防复发闭环。
9.1 项目表达
Q157|项目介绍最短结构?
背景目标、约束难点、关键决策、技术链路、验证结果、生产问题、个人贡献、边界与演进。
Q158|怎样讲技术难点?
难点不是技术名;说清约束冲突、失败位置、拆解方法、验证证据和当前结论边界。
Q159|怎样讲方案亮点?
原基线、关键决策、相比备选的价值、证据、代价、适用边界;禁用“效果更好”空话。
Q160|没有真实指标怎么办?
明确“设计/演练/待实测”;给出指标定义、测试集和取得证据的下一步;不虚构数字。
Q161|AI 知识库项目主链路?
数据治理、权限、混合检索、重排、上下文、引用、评测、Trace、版本、降级与回滚。
Q162|AI 面试教练项目主链路?
能力图谱、题目路由、逐题状态、RAG 证据、评分规则、受控追问、复盘与学习计划。
Q163|AI 视频项目主链路?
脚本、最终音频、时间线、分镜、模型路由、生成、连续性、合成、质检、平台派生、业务实验。
Q164|只有最终音频怎样恢复 Timeline?
ffprobe、规范化、VAD、有稿强制对齐/无稿 ASR 后对齐、语义分段、低置信人工确认。
Q165|口播不一致分哪三类?
文案对语音、语音对字幕/切镜、语音对口型;分别用 ASR Diff、重对齐、按需 Lip Sync。
Q166|视频首轮可用率怎样定义?
首轮无需重生成的合格镜头数 ÷ 首轮总镜头数;同时看合格镜头成本、生成次数、人工时间与拒绝原因。
Q167|AI 游戏项目的核心边界?
LLM 负责候选剧情与对话;游戏引擎负责规则、状态、资源、物理、存档、安全和最终执行。
9.2 生产排障
Q168|通用排障顺序?
现象、范围、版本、指标、日志/Trace、数据真值、假设排序、止损、修复、回归、监控、防复发。
Q169|为什么先查版本?
代码、模型、Prompt、索引、配置混用会制造随机假象;先确认请求实际命中的版本组合。
Q170|模型网关级联故障怎样止损?
限流、隔离、熔断、缩短超时、关闭重试风暴、降级模型/功能;再查分位延迟与错误分类。
Q171|Agent 重复副作用怎样止损?
暂停写工具、按业务键对账、阻断重复调用;长期用幂等、结果未知状态、补偿与审计。
Q172|异步任务卡死怎样排查?
队列、租约/心跳、状态机、重试计数、幂等、死信、外部任务 ID;不能只重启消费者。
Q173|权限过滤失效怎样处理?
立即阻断入口、撤销缓存与索引访问、确认影响范围、审计访问;长期做服务端 ACL、测试与撤权传播监控。
Q174|GPU 推理雪崩怎样处理?
限流、排队、降上下文/Batch、关闭非关键模型、回收异常实例;再查显存、KV Cache、调度和重试放大。
Q175|修复后怎样证明有效?
固定失败样本重放、契约/回归/故障注入、关键指标对比、灰度、监控、回滚验证;代码通过不等于线上闭环。
10. 一分钟检查清单
本章重点| 每次选型或上线前,用一分钟检查质量、延迟、成本、安全、可观测、降级与回滚,避免只验证成功路径。
10.1 选模型
Q176|一分钟怎样选模型?
任务与模态、质量基准、上下文、结构化/工具能力、延迟吞吐、价格、区域、合规、可用性、降级;固定集实测。
10.2 做 RAG
Q177|一分钟检查 RAG?
数据/ACL/版本、Chunk、Sparse+Dense、融合、分阶段 K、Rerank、上下文、引用、评测、Trace、降级。
10.3 做 Agent
Q178|一分钟检查 Agent?
目标、工具 Schema、最小权限、状态、幂等、超时、终止、Checkpoint、人工介入、Trace、评测、预算。
10.4 上生产
Q179|一分钟检查上线?
SLO、回归集、版本指纹、灰度、限流、超时、重试、熔断、降级、监控、告警、回滚、安全、成本。
10.5 讲项目
Q180|一分钟讲项目?
我负责什么;目标和约束;最难冲突;为何选该方案;证据;故障与修复;贡献边界;下一步。
11. 深挖入口与事实边界
阅读边界| 本节只负责路由。动态能力查官方资料,完整机制看正式主题,连续追问进专项题库,项目结论必须回到真实证据。
Q181|想看全局结构去哪里?
Q182|想读 3 分钟版本去哪里?
AI 面试高频问题博客;按基础、LLM、RAG、Agent、工程、系统设计分类。
Q183|想做连续追问去哪里?
Q184|想系统学习去哪里?
知识库总目录;从正式主题进入原理、技术选型、双图、实现、项目和生产证据。
Q185|本文的事实边界是什么?
关键词是导航,不是完整结论;动态模型/API/价格需查官方资料;项目数字必须来自实测;框架选型必须在同约束下比较。
12. 总结
一句话记忆: AI 全栈不是“会调用模型”,而是把数据、模型、证据、工具、工程治理和项目验证连成可测、可查、可控、可恢复的闭环。
- 基础与模型回答能力从哪里来;
- RAG 回答证据从哪里来;
- Agent 回答动作怎样安全执行;
- AI 工程回答系统怎样稳定、经济、合规地运行;
- 项目与排障必须用真实证据证明,而不是堆技术名词。