Skip to content

AI 全栈极简一问一答

定位| 一页式 AI 全栈速查入口。只保留定义、机制、边界、选型、指标和排障关键词;每个问答卡应在 10~60 秒内读完。本文不替代正式主题、公式推导、代码实验、项目证据和专项题库。

目录

1. 怎么使用

阅读优先级| 扫读只看目录与“本章重点”;自测先遮住答案,只读 Qxxx深挖再进入对应正式主题或专项题库。

Q001|这份专题解决什么问题?

快速总览、闭卷复习、面试热身、定位知识缺口;不负责完整教学。

Q002|怎样阅读?

先看脑图;再按模块闭卷答题;答不出、说不清边界或没有项目证据,就进入对应正式主题。

Q003|什么叫“一分钟内”?

单个问答卡 10~60 秒;先说结论、机制、边界;需要追问时再展开。

Q004|什么叫“掌握”?

能解释、能画链路、能实现最小实验、能说失败模式、能给验证证据;不是只认得名词。

2. 一张脑图看全栈

总纲| 数据可信 → 模型能力 → 外部证据 → 受控行动 → 工程交付。任何一段缺失,都不能称为生产级 AI 闭环。

图:AI 全栈极简知识脑图

替代文本: AI 全栈从数据与数学开始,经机器学习、深度学习、多模态和 LLM 获得模型能力;RAG 提供外部证据,Agent 提供受控行动,AI 工程与系统设计负责质量、可靠性、成本、安全和交付;项目与排障用真实证据验收全部能力。

图表加载中…

读图结论: 模型能力只是中段;生产级 AI 必须把数据、证据、行动、工程治理和项目验证连成闭环。

3. AI 基础与机器学习

本章重点| 先保证数据切分、指标口径和基线可信,再讨论模型复杂度;评测失真时,模型越复杂,错误越隐蔽。

3.1 数据、数学与评测

Q005|AI、ML、DL、生成式 AI 什么关系?

AI 是总集;ML 从数据学习;DL 用深层神经网络;生成式 AI 学习分布并生成新内容。

Q006|训练集、验证集、测试集分别做什么?

训练集拟合参数;验证集选超参数与方案;测试集只做最终无偏评估。

Q007|什么是数据泄漏?

训练阶段获得推理时不应知道的信息;结果虚高、上线失效;先按用户、时间、实体或业务事件隔离。

Q008|为什么要固定随机种子?

降低随机波动、便于复现;不能保证跨硬件、算子、版本完全一致。

Q009|向量和矩阵在 AI 中做什么?

向量表示样本或特征;矩阵表示批量数据、线性变换和参数;核心运算是乘加。

Q010|梯度是什么?

损失对参数的偏导;方向表示局部变化最快方向;负梯度用于降低损失。

Q011|学习率过大或过小会怎样?

过大:震荡、发散;过小:收敛慢、易停在平台;配合调度、Warmup、归一化观察。

Q012|损失函数与评测指标有何区别?

损失函数用于可微优化;评测指标对齐业务目标;二者可以不同但不能目标冲突。

Q013|Accuracy 何时失真?

类别极不平衡、错误成本不同;改看 Precision、Recall、F1、PR-AUC、分桶错误成本。

Q014|Precision 与 Recall 怎么选?

误报代价高看 Precision;漏报代价高看 Recall;最终用阈值和业务成本共同定。

Q015|F1 与 AUC 各看什么?

F1 是固定阈值下 Precision/Recall 调和均值;AUC 看跨阈值排序能力;都不能替代业务验收。

Q016|交叉验证解决什么问题?

小数据下估计泛化均值与方差;时间序列必须按时间滚动,不能随机打乱未来信息。

3.2 机器学习核心

Q017|监督、无监督、半监督、强化学习是什么?

监督用标签;无监督找结构;半监督混合少量标签与大量无标签;强化学习从奖励学习策略。

Q018|分类与回归的区别?

分类预测离散类别或概率;回归预测连续值;看输出空间与损失,不看模型名字。

Q019|过拟合与欠拟合是什么?

过拟合:训练好、泛化差;欠拟合:训练与验证都差;分别从数据、容量、正则、优化排查。

Q020|偏差与方差是什么?

高偏差:模型假设过强;高方差:对样本扰动敏感;目标是在数据规模与复杂度下平衡。

Q021|L1 与 L2 正则有什么区别?

L1 倾向稀疏;L2 平滑缩小权重;都通过限制复杂度降低过拟合。

Q022|为什么先做简单基线?

建立可解释下限、暴露数据问题、量化复杂方案增益;没有基线就无法证明复杂度值得。

Q023|特征工程还有价值吗?

有;小数据、结构化数据、业务规则、可解释性场景仍关键;深度模型只是自动学习更多表示。

Q024|树模型与神经网络怎么选?

结构化中小数据优先树模型基线;高维非结构化与大规模表示学习优先神经网络;用同集实测。

Q025|Go、Python、Java 在 AI 工程中怎么分工?

Python:模型与数据生态;Go:高并发服务与工具;Java:企业系统集成;按团队、生态、延迟、维护选。

4. 深度学习与多模态生成

本章重点| 神经网络靠可微计算与反向传播学习表示;多模态生成额外增加跨模态对齐和时间连续性约束。

4.1 神经网络

Q026|神经网络本质是什么?

可微函数的层叠;通过参数化变换学习输入到输出的复杂映射。

Q027|前向传播做什么?

输入逐层变换得到预测与损失;保存反向传播需要的中间量。

Q028|反向传播做什么?

沿计算图用链式法则计算每个参数梯度;分支梯度相加;优化器负责更新。

Q029|激活函数为什么必要?

引入非线性;否则多层线性变换仍等价于一层线性;常用 ReLU、GELU、SiLU。

Q030|梯度消失与爆炸怎么处理?

残差连接、归一化、合理初始化、激活函数、梯度裁剪、学习率与深度控制。

Q031|BatchNorm 与 LayerNorm 区别?

BatchNorm 按批次统计,受 batch 影响;LayerNorm 按样本特征归一化,更适合序列与 Transformer。

Q032|Dropout 做什么?

训练时随机屏蔽神经元,降低共适应;推理时关闭;过强会欠拟合。

Q033|CNN 的核心优势?

局部连接、权重共享、平移归纳偏置;适合图像局部模式与高效特征提取。

4.2 生成模型与多模态

Q034|VAE 的核心机制?

编码为概率潜变量,重参数化采样,重构损失加 KL 正则;潜空间连续,但图像可能偏平滑。

Q035|GAN 的核心机制?

生成器与判别器对抗训练;图像锐利,但训练不稳、可能模式坍塌。

Q036|Diffusion 的核心机制?

前向逐步加噪;反向学习去噪;质量与可控性强,代价是多步采样与算力。

Q037|VAE、GAN、Diffusion 怎么选?

VAE 重潜空间与重构;GAN 重快速锐利生成;Diffusion 重质量与条件控制;按任务实测。

Q038|CLIP 解决什么问题?

用对比学习把图像与文本映射到共享语义空间;支持检索、零样本分类和跨模态对齐。

Q039|多模态对齐不等于什么?

不等于精确定位、事实理解或因果推理;共享向量接近只说明训练目标下语义相似。

Q040|图像生成的关键控制条件?

Prompt、参考图、ControlNet/结构条件、随机种子、采样器、步数、CFG、分辨率。

Q041|视频生成比图像生成难在哪?

增加时间维;要同时保证身份、动作、空间、物体、光照与运动连续性。

Q042|视频连续性怎样治理?

continuity_state、参考帧、首尾帧、短镜头、镜头路由、剪辑余量、失败样本回灌。

Q043|如何评估多模态生成?

自动指标加人工验收;语义、质量、一致性、事实、可用率、成本、延迟、合规分开评。

5. Transformer 与 LLM

本章重点|表示 → 架构 → 训练 → 对齐 → 推理 → 可靠输出记忆;Prompt、RAG 和微调解决的是不同层次的问题。

5.1 表示与架构

Q044|Token 是什么?

模型处理文本的离散单位;可能是字、子词、字节片段;Token 数影响上下文、延迟和成本。

Q045|Embedding 是什么?

把离散对象映射为稠密向量;距离表达训练目标下的关系,不等于人类完整理解。

Q046|位置编码解决什么问题?

Attention 本身不含顺序;位置编码注入绝对或相对位置信息;常见 Learned、RoPE、ALiBi。

Q047|Self-Attention 做什么?

每个 Token 按相关性聚合其他 Token 信息;核心是 softmax(QKᵀ/√d)V

Q048|Q、K、V 怎么理解?

Q 表示我在找什么;K 表示我能被怎样匹配;V 表示匹配后提供什么内容。

Q049|为什么除以 √d

控制点积方差,避免维度增大导致 Softmax 饱和、梯度过小。

Q050|多头注意力有什么价值?

在不同子空间并行学习不同关系;增加表达能力,也增加计算与参数开销。

Q051|残差连接有什么价值?

保留原信息、改善梯度传播、支持更深网络;不是自动消除训练不稳定。

Q052|Transformer 为什么取代多数 RNN?

训练可并行、长程依赖路径短、扩展性强;代价是标准 Attention 随序列长度近似二次增长。

Q053|Encoder、Decoder、Encoder-Decoder 区别?

Encoder 擅长理解;Decoder 自回归生成;Encoder-Decoder 适合输入输出转换;边界取决于训练方式。

5.2 训练、微调与对齐

Q054|预训练在学什么?

从大规模数据学习通用统计规律与表示;常见目标是下一 Token 预测或掩码预测。

Q055|SFT 做什么?

用指令—回答样本学习任务格式与行为;提高可用性,不自动保证事实正确。

Q056|RLHF 的基本链路?

收集偏好数据、训练奖励模型、用强化学习优化策略;复杂、昂贵、易奖励偏移。

Q057|PPO 与 DPO 区别?

PPO 在线优化策略并显式用奖励;DPO 直接从偏好对训练,链路更简;效果依赖数据与约束。

Q058|LoRA 为什么省参数?

冻结原权重,只学习低秩增量 ΔW=BA;显存与存储低,但推理、合并和任务干扰仍需评测。

Q059|QLoRA 比 LoRA 多什么?

基座权重量化后再训练 LoRA;进一步省显存;代价是量化误差与实现复杂度。

Q060|何时全量微调?

数据充分、预算足、需要深度改变模型能力且能完整评测;否则优先 Prompt、RAG、PEFT。

Q061|数据去重为什么重要?

减少记忆、污染、权重偏斜和算力浪费;需做精确去重、近似去重、跨分割污染检查。

Q062|数据配比怎样影响模型?

决定能力、语言、领域与安全倾向;不能只看总量,要按来源、质量、任务和阶段配比。

Q063|混合精度训练解决什么?

用 FP16/BF16 降显存、提吞吐;关键累加保留高精度;FP16 常需 Loss Scaling。

Q064|数据并行、张量并行、流水线并行区别?

数据并行分 batch;张量并行拆单层矩阵;流水线并行拆层;组合取决于模型与集群。

5.3 推理、Prompt 与可靠输出

Q065|Prefill 与 Decode 区别?

Prefill 并行处理输入,偏计算密集;Decode 逐 Token 生成,偏内存带宽与调度。

Q066|KV Cache 为什么加速?

缓存历史 K/V,避免每步重复计算;换来显存占用,长上下文和高并发更明显。

Q067|Temperature、Top-k、Top-p 各做什么?

Temperature 调概率平滑;Top-k 留固定个数;Top-p 留累计概率集合;共同控制随机性。

Q068|量化解决什么?

降低权重与激活精度,节省显存、提高吞吐;需评估精度、算子支持、延迟和硬件收益。

Q069|吞吐与延迟为什么冲突?

更大 Batch 提吞吐,但增加排队和单请求延迟;用动态批处理、优先级、SLO 做平衡。

Q070|Prompt 的关键组成?

角色、目标、上下文、约束、输出 Schema、示例、拒答条件、工具说明;版本化并评测。

Q071|Structured Output 等于结果正确吗?

不等于;只约束形状;服务端仍需 Schema、业务语义、权限、事实与状态校验。

Q072|大模型为什么会幻觉?

目标是生成高概率 Token,不是查询真值;训练知识有限、上下文不足、解码随机、工具失败都可触发。

Q073|Prompt、RAG、Fine-tuning 怎么选?

Prompt 改任务表达;RAG 注入动态事实;Fine-tuning 改稳定行为或领域能力;可组合但先做最小方案。

Q074|上下文越长越好吗?

不是;成本、延迟、注意力稀释、截断风险上升;只保留任务相关且可追溯的信息。

6. RAG 与知识库

本章重点|数据治理 → 候选召回 → 融合重排 → 上下文 → 生成引用 → 分层评测排查;Reranker 不能补回漏召回证据。

6.1 数据与索引

Q075|RAG 本质是什么?

检索增强生成;推理时取回外部证据放入上下文,降低知识陈旧与无依据回答。

Q076|RAG 完整链路?

接入、解析、清洗、切块、元数据/ACL、Embedding、索引、召回、融合、重排、上下文、生成、引用、评测。

Q077|数据清洗只去空格吗?

不是;还要结构恢复、去噪去重、表格/OCR、权限、有效期、版本、来源和解析失败处理。

Q078|Chunk Size 怎么定?

语义完整性、检索粒度、模型窗口、文档结构、问题类型共同决定;用标注集实测。

Q079|Overlap 有什么作用与代价?

减少边界信息断裂;代价是索引膨胀、重复召回和上下文浪费。

Q080|父子块解决什么?

子块负责精准召回,父块提供完整上下文;需维护稳定 ID 与层级关系。

Q081|Metadata 必须包含什么?

来源、文档/Chunk ID、租户、ACL、时间、语言、类型、解析器、切片器、Embedding、索引版本。

Q082|为什么 ACL 必须检索前生效?

先召回再隐藏仍可能泄露分数、缓存或上下文;权限过滤应进入候选生成与服务端复核。

Q083|为什么需要稳定 Chunk ID?

支持增量更新、去重、引用、撤权、回滚、评测重放与版本追踪。

6.2 召回、融合与重排

Q084|BM25 擅长什么?

词面精确匹配、编号、专名、可解释;弱点是同义表达与跨语言语义。

Q085|Dense Retrieval 擅长什么?

语义近邻、改写与跨表达;弱点是专名/OOV、不可解释、Embedding 漂移与成本。

Q086|为什么常用混合检索?

BM25 保词面,Dense 保语义;两路互补;融合后再重排,避免无条件二选一。

Q087|异构分数能直接相加吗?

通常不能;量纲与分布不同;优先 RRF 秩融合,或在标注集上校准后学习权重。

Q088|余弦、点积、欧氏距离区别?

余弦看方向;点积兼顾方向与模长;欧氏看绝对距离;向量归一化后排序关系才可能等价。

Q089|ANN 为什么必要?

大规模向量精确全扫成本高;ANN 牺牲少量 Recall 换延迟与吞吐;索引参数需基准测试。

Q090|k_recallk_rerankk_context 区别?

候选召回量、进入重排量、最终上下文量;通常 k_recall > k_rerank >= k_context

Q091|阈值与 Top-k 区别?

Top-k 保固定数量;阈值保达到质量线的候选;可组合,必须用分数分布和标注集校准。

Q092|Reranker 能补回漏召回吗?

不能;只能重排已有候选;漏召回先查 Query、过滤、索引、Embedding 和召回通道。

Q093|Cross-Encoder 为什么更准但更慢?

Query 与文档联合编码,交互充分;每对候选都要推理,成本随候选数增长。

6.3 上下文、评测与生产

Q094|上下文构造要做什么?

去重、排序、父子合并、证据覆盖、Token 预算、来源标注、截断策略、冲突处理。

Q095|召回正确但回答跑偏先查什么?

final_context、重复块、重排分数、Token 截断、Prompt、模型版本、引用与拒答策略。

Q096|偶发检索为空怎样排查?

原始/改写 Query、租户/ACL、过滤、索引与 Embedding 版本、候选数、阈值、超时、降级。

Q097|Recall@K、Precision@K、MRR、NDCG 各看什么?

召全、召准、首个正确结果位置、整体排序质量;按任务选择,不机械全上。

Q098|RAG 答案层评什么?

正确性、完整性、引用支持率、无依据断言率、拒答质量、延迟、成本、人工接管率。

Q099|RAG Trace 至少记录什么?

原始/改写 Query、过滤、各路候选、分数、重排、最终 Chunk、截断、版本、Token、答案与引用。

Q100|实时业务真值应从哪里来?

受控 SQL 或业务 API;历史向量库只提供语义证据,不能猜库存、订单、余额等实时状态。

Q101|向量数据库怎样选?

比较关系库扩展、搜索引擎、专用向量引擎、托管服务;看规模、过滤、混合检索、事务、运维、合规、成本。

Q102|Milvus 适合什么场景?

大规模向量、分布式扩展、复杂索引与过滤;小规模或强事务场景先比较 pgvector 等更简单方案。

Q103|LangChain、LlamaIndex、自研 RAG 怎么选?

LangChain 重编排;LlamaIndex 重数据与检索抽象;自研重控制;按复杂度、可观测、锁定成本选。

Q104|多模态 RAG 多了什么?

OCR/ASR/Caption、页面区域与时间片、多模态路由、分路召回、融合、媒体预算、可定位引用。

7. Agent 与工作流

本章重点| 模型提出候选动作,Runtime 掌握执行权;权限、状态、副作用、终止、恢复和审计必须由确定性系统控制。

7.1 核心机制与控制边界

Q105|Agent 本质是什么?

LLM 在受控 Runtime 中根据目标、状态和观察选择动作;Runtime 管权限、副作用、终止、恢复与审计。

Q106|Agent 与固定工作流区别?

Agent 动态决策下一步;工作流路径预定义;稳定流程优先工作流,不确定任务再引入 Agent。

Q107|ReAct 是什么?

Reason/Act/Observe 循环;思考提出动作,工具返回观察,再更新决策;必须有终止与预算。

Q108|Planning 的价值与风险?

分解复杂目标、协调工具;风险是错误计划、过度规划、上下文膨胀;需分步验证和重规划。

Q109|Tool Calling 与普通 JSON 区别?

Tool Calling 有工具 Schema 与调用语义;普通 JSON 只是文本格式;两者都需服务端校验。

Q110|模型决定调用工具等于模型有权限吗?

不等于;模型只提候选动作;Runtime 做鉴权、参数校验、预算、审批、执行和审计。

Q111|工具 Schema 应包含什么?

名称、用途、参数类型、必填项、枚举、返回契约、错误码、超时、副作用、权限和幂等语义。

Q112|为什么写操作要幂等?

超时可能“已执行但响应丢失”;稳定业务键防重复副作用;结果未知先对账再重试。

Q113|Agent 为什么死循环?

目标模糊、观察无进展、工具持续失败、终止条件缺失、模型重复策略;用步数、时间、成本、状态去重终止。

Q114|失败重试应遵循什么?

先分类:可重试、不可重试、结果未知;只对瞬时且幂等错误限次退避;其余降级、对账或人工处理。

7.2 状态、记忆与框架

Q115|Context 与 Memory 区别?

Context 是本次模型可见输入;Memory 是跨步骤或跨会话可检索状态;Memory 进入模型前仍要筛选。

Q116|短期、长期、情景、语义记忆分别是什么?

当前任务状态、持久偏好、历史事件、抽象事实;不同记忆用不同存储、检索和过期策略。

Q117|Checkpoint 解决什么?

持久化状态、支持中断恢复、重放、人工介入;外部副作用仍需幂等和对账。

Q118|Human-in-the-loop 放在哪?

高风险动作前审批、低置信结果复核、异常恢复与最终验收;不能替代权限和自动校验。

Q119|多 Agent 何时有价值?

角色边界清晰、上下文隔离、任务可并行、独立验收;否则增加通信、冲突、延迟与成本。

Q120|多 Agent 的关键难点?

任务分解、共享状态、协议、冲突仲裁、终止、预算、可观测和最终责任归属。

Q121|LangChain 适合什么?

快速组合模型、Prompt、工具、检索与回调;复杂持久状态和恢复需更明确 Runtime。

Q122|LangGraph 适合什么?

显式状态图、循环、Checkpoint、中断与人工介入;简单线性调用可能过重。

Q123|MCP 解决什么问题?

标准化模型客户端与工具/资源服务的发现和调用;不自动解决鉴权、业务权限和工具正确性。

Q124|MCP Server 的工程边界?

Schema、能力声明、协议传输、错误与生命周期;业务鉴权、配额、审计、隔离仍由服务端治理。

7.3 Coding Agent、安全与评测

Q125|Coding Agent 的基本闭环?

理解任务、检索代码、计划、修改、运行测试、读取反馈、迭代、交付差异与证据。

Q126|Claude Code 与 Codex 应比较什么?

仓库理解、工具协议、沙箱、编辑方式、并行能力、上下文治理、验证闭环;版本能力以实测为准。

Q127|Vibe Coding 的核心风险?

需求漂移、盲信生成、跨层误改、测试缺失、秘密泄露;用任务契约、隔离、Diff、测试、审查、回滚治理。

Q128|Prompt Injection 怎样防?

不信任外部内容;指令与数据分离;工具白名单、最小权限、服务端策略、审批、输出过滤、审计。

Q129|Agent 评测看什么?

任务完成率、步骤正确率、工具成功率、越权率、重复副作用、恢复率、延迟、成本、人工接管。

Q130|Agent Trace 至少记录什么?

目标、状态、模型/Prompt、候选动作、工具参数摘要、观察、错误、重试、Checkpoint、成本、最终状态。

Q131|LangSmith 类工具解决什么?

Trace、数据集、评测、版本对比与调试;不替代业务真值、权限控制和自有监控。

8. AI 工程与系统设计

本章重点| 把概率模型放进确定性工程边界:用 SLO、网关、Trace、评测、安全、成本、降级和回滚约束不确定性。

8.1 服务、可靠性与任务系统

Q132|为什么 AI 服务常用异步 I/O?

模型与外部 API 多为 I/O 等待;异步提升并发连接利用率;CPU 密集任务仍需进程或专用服务。

Q133|流式输出怎样实现?

模型逐 Token 产生事件,经 SSE/WebSocket/HTTP Chunk 转发;需处理断连、取消、背压、错误与最终状态。

Q134|模型网关负责什么?

统一鉴权、路由、限流、超时、重试、熔断、降级、缓存、观测、成本与版本策略。

Q135|超时怎么定?

连接、首 Token、空闲、总时长分开;依据下游分位延迟和上游 SLO,保留降级预算。

Q136|熔断与限流区别?

限流保护容量;熔断隔离持续失败依赖;一个管流量,一个管故障传播。

Q137|降级策略有哪些?

备用模型、缩短上下文、关闭非关键步骤、缓存结果、只返回证据、部分结果、拒答、人工接管。

Q138|长任务为什么要持久化?

进程会重启、外部调用会失败;状态、事件、Checkpoint、幂等键支持断点恢复与重放。

Q139|消息队列重复消费怎么处理?

At-least-once 下用业务幂等键、去重表、状态机、Outbox/Inbox、可重入处理和对账。

8.2 可观测、评测、成本与安全

Q140|日志、指标、Trace 各解决什么?

日志看事件细节;指标看趋势与告警;Trace 看跨组件因果链;三者用 trace_id 关联。

Q141|AI 应用版本要追什么?

代码、模型、Prompt、语料、解析器、切片器、Embedding、索引、工具、工作流、评测集与配置。

Q142|离线、在线、人工评测区别?

离线可重复比较;在线看真实行为与业务;人工处理主观、复杂和高风险标准;三者互补。

Q143|怎样定义“成功率”?

先定义成功门槛、分子、分母、窗口、分桶、排除项;技术 200 不等于业务完成。

Q144|单位成功任务成本怎么算?

模型、检索、工具、基础设施、重试、人工总成本 ÷ 通过成功标准的任务数。

Q145|LLM 缓存分几类?

精确响应、语义、Prompt/前缀、Embedding、检索、工具结果;必须管租户、权限、版本、TTL 与失效。

Q146|容量估算看什么?

请求率、并发、输入/输出 Token、TTFT、TPOT、模型吞吐、显存、Batch、峰值、SLO 与降级容量。

Q147|GPU OOM 怎样排查?

权重、KV Cache、激活、Batch、上下文、碎片、并发;先止损限流,再量化、分页、调度或扩容。

Q148|AI 安全核心风险?

Prompt Injection、越权、敏感数据、供应链、模型滥用、数据投毒、输出伤害、资源耗尽与审计缺失。

Q149|最小权限怎样落地?

模型不持凭据;工具按租户、资源、动作授权;短期令牌、白名单、审批、审计、网络与沙箱隔离。

Q150|红队测试测什么?

越狱、注入、数据外泄、工具越权、资源攻击、恶意文件、多轮诱导;失败样本进入回归集。

8.3 系统设计

Q151|生产级 AI 系统设计第一步?

定义用户、任务、真值、成功标准、SLO、风险、数据与成本约束;先定边界再选模型。

Q152|概率模型与确定性系统怎样分工?

模型负责理解、生成、候选决策;服务端负责权限、规则、执行、校验、状态、审计和最终验收。

Q153|什么时候查知识库,什么时候查数据库/API?

静态解释性资料走 RAG;实时业务真值与动作走受控数据库/API;两者可组合但职责不混淆。

Q154|SLO 应包含什么?

可用性、端到端延迟、质量、工具成功、恢复、成本与安全门槛;按任务与租户分桶。

Q155|怎样设计可替换模型?

统一模型接口、能力标签、路由策略、回归集、影子流量、版本指纹、降级与回滚。

Q156|怎样证明架构选型合理?

同约束候选横评;明确数据、规模、SLO、预算、运维、合规;用基准、故障演练和业务实验验证。

9. 项目表达与生产排障

本章重点| 项目表达看约束、决策、证据和边界;生产排障按现象、版本、数据、Trace、止损、修复、回归、防复发闭环。

9.1 项目表达

Q157|项目介绍最短结构?

背景目标、约束难点、关键决策、技术链路、验证结果、生产问题、个人贡献、边界与演进。

Q158|怎样讲技术难点?

难点不是技术名;说清约束冲突、失败位置、拆解方法、验证证据和当前结论边界。

Q159|怎样讲方案亮点?

原基线、关键决策、相比备选的价值、证据、代价、适用边界;禁用“效果更好”空话。

Q160|没有真实指标怎么办?

明确“设计/演练/待实测”;给出指标定义、测试集和取得证据的下一步;不虚构数字。

Q161|AI 知识库项目主链路?

数据治理、权限、混合检索、重排、上下文、引用、评测、Trace、版本、降级与回滚。

Q162|AI 面试教练项目主链路?

能力图谱、题目路由、逐题状态、RAG 证据、评分规则、受控追问、复盘与学习计划。

Q163|AI 视频项目主链路?

脚本、最终音频、时间线、分镜、模型路由、生成、连续性、合成、质检、平台派生、业务实验。

Q164|只有最终音频怎样恢复 Timeline?

ffprobe、规范化、VAD、有稿强制对齐/无稿 ASR 后对齐、语义分段、低置信人工确认。

Q165|口播不一致分哪三类?

文案对语音、语音对字幕/切镜、语音对口型;分别用 ASR Diff、重对齐、按需 Lip Sync。

Q166|视频首轮可用率怎样定义?

首轮无需重生成的合格镜头数 ÷ 首轮总镜头数;同时看合格镜头成本、生成次数、人工时间与拒绝原因。

Q167|AI 游戏项目的核心边界?

LLM 负责候选剧情与对话;游戏引擎负责规则、状态、资源、物理、存档、安全和最终执行。

9.2 生产排障

Q168|通用排障顺序?

现象、范围、版本、指标、日志/Trace、数据真值、假设排序、止损、修复、回归、监控、防复发。

Q169|为什么先查版本?

代码、模型、Prompt、索引、配置混用会制造随机假象;先确认请求实际命中的版本组合。

Q170|模型网关级联故障怎样止损?

限流、隔离、熔断、缩短超时、关闭重试风暴、降级模型/功能;再查分位延迟与错误分类。

Q171|Agent 重复副作用怎样止损?

暂停写工具、按业务键对账、阻断重复调用;长期用幂等、结果未知状态、补偿与审计。

Q172|异步任务卡死怎样排查?

队列、租约/心跳、状态机、重试计数、幂等、死信、外部任务 ID;不能只重启消费者。

Q173|权限过滤失效怎样处理?

立即阻断入口、撤销缓存与索引访问、确认影响范围、审计访问;长期做服务端 ACL、测试与撤权传播监控。

Q174|GPU 推理雪崩怎样处理?

限流、排队、降上下文/Batch、关闭非关键模型、回收异常实例;再查显存、KV Cache、调度和重试放大。

Q175|修复后怎样证明有效?

固定失败样本重放、契约/回归/故障注入、关键指标对比、灰度、监控、回滚验证;代码通过不等于线上闭环。

10. 一分钟检查清单

本章重点| 每次选型或上线前,用一分钟检查质量、延迟、成本、安全、可观测、降级与回滚,避免只验证成功路径。

10.1 选模型

Q176|一分钟怎样选模型?

任务与模态、质量基准、上下文、结构化/工具能力、延迟吞吐、价格、区域、合规、可用性、降级;固定集实测。

10.2 做 RAG

Q177|一分钟检查 RAG?

数据/ACL/版本、Chunk、Sparse+Dense、融合、分阶段 K、Rerank、上下文、引用、评测、Trace、降级。

10.3 做 Agent

Q178|一分钟检查 Agent?

目标、工具 Schema、最小权限、状态、幂等、超时、终止、Checkpoint、人工介入、Trace、评测、预算。

10.4 上生产

Q179|一分钟检查上线?

SLO、回归集、版本指纹、灰度、限流、超时、重试、熔断、降级、监控、告警、回滚、安全、成本。

10.5 讲项目

Q180|一分钟讲项目?

我负责什么;目标和约束;最难冲突;为何选该方案;证据;故障与修复;贡献边界;下一步。

11. 深挖入口与事实边界

阅读边界| 本节只负责路由。动态能力查官方资料,完整机制看正式主题,连续追问进专项题库,项目结论必须回到真实证据。

Q181|想看全局结构去哪里?

AI 知识体系记忆脑图AI 知识图谱专题

Q182|想读 3 分钟版本去哪里?

AI 面试高频问题博客;按基础、LLM、RAG、Agent、工程、系统设计分类。

Q183|想做连续追问去哪里?

专项题库生产级 AI 应用连环追问专题

Q184|想系统学习去哪里?

知识库总目录;从正式主题进入原理、技术选型、双图、实现、项目和生产证据。

Q185|本文的事实边界是什么?

关键词是导航,不是完整结论;动态模型/API/价格需查官方资料;项目数字必须来自实测;框架选型必须在同约束下比较。

12. 总结

一句话记忆: AI 全栈不是“会调用模型”,而是把数据、模型、证据、工具、工程治理和项目验证连成可测、可查、可控、可恢复的闭环。

  • 基础与模型回答能力从哪里来;
  • RAG 回答证据从哪里来;
  • Agent 回答动作怎样安全执行;
  • AI 工程回答系统怎样稳定、经济、合规地运行;
  • 项目与排障必须用真实证据证明,而不是堆技术名词。