外观
AI 知识图谱专题
定位| 本专题是 AI 知识库的视觉画廊和复习入口,集中展示全景、依赖、机制、工程与面试证据图谱。它不计入正式技术主题,也不替代各主题正文、代码实验、项目证据和专项面试题。
目录
- 1. 专题目标
- 2. 怎样理解这里的知识图谱
- 3. 全景图:AI 知识体系
- 4. 依赖图谱:从基础到工程实战
- 5. 机制图谱:RAG 证据链
- 6. 机制图谱:Agent 受控行动链
- 7. 工程图谱:生产治理六条主线
- 8. 面试图谱:从会背到可验证表达
- 9. 图谱索引与使用方法
- 10. 维护与验收规则
- 11. 实践任务
- 12. 相关知识与证据边界
- 13. 总结
1. 专题目标
完成本专题后,应能够:
- 用一张全景图说出 AI 应用工程的八条主干;
- 区分学习依赖、运行机制、工程治理和面试证据四类关系;
- 沿图谱定位到 RAG、Agent、AI Engineering 和系统设计的正式主题;
- 发现图中缺失的权限、版本、状态、失败与验证边界;
- 用闭卷重画和口述验证自己是否真正掌握,而不是只觉得“看懂了”。
2. 怎样理解这里的知识图谱
2.1 30 秒说明
这里的“知识图谱”是用于学习和复习的 Knowledge Map:节点表示知识、机制、证据或工程能力,连线表示依赖、输入输出、控制或验证关系。它解决的是“知识怎样连接、应该沿哪条链路追问”,而不是把目录重新排成一张好看的图。图谱适合建立全局结构,但精确公式、接口语义、版本能力和项目结论仍要回到正文、代码、日志和测试中验证。
2.2 与语义知识图谱的边界
本专题不是以实体、关系、属性和三元组为核心的语义知识图谱系统,也不提供本体建模、图数据库查询或自动推理能力。这里的节点与边主要服务人工学习导航;除非正式主题另有定义,图上的连线不能被解释为严格的因果关系、完整调用时序或可计算规则。
2.3 小白先这样理解:先看城市地图,再进入具体建筑
小林第一次来到一座很大的 AI 城。如果他只拿到一串建筑名单,就知道有“模型楼、资料室、调度中心”,却不知道应该先去哪、道路怎样相连、哪里需要门禁。全景图像城市总图,先告诉他城区和主干道;RAG、Agent 图像单栋建筑的楼层图;工程治理图像消防、监控和供电图;面试证据图则像验收单,证明他不仅参观过,还能解释怎样运行、哪里会失败。
对应到技术学习:城市区域是知识领域,建筑是具体主题,道路是依赖或数据流,门禁是权限边界,消防和监控是降级与可观测性,验收单是测试、评测和项目证据。这个类比能解释“为什么需要多种图”,但真实系统中的依赖可能并行、循环或随项目改变,不能把地图上的单一路线当成唯一实现。
3. 全景图:AI 知识体系
图:AI 知识体系全景图
替代文本: 横向全景图分为理论底座、智能应用和工程实战三个区域。理论底座包含基础、机器学习和深度学习;智能应用包含 LLM、RAG 和 Agent;工程实战包含工程治理和实战面试。底部工程闭环以评测、证据、权限、状态和验证贯穿三个区域。

读图结论: AI 能力不是从 LLM 单点开始,而是由理论底座、智能应用和工程交付逐层连接,并由评测、证据、权限、状态和验证形成闭环。
这张图按用户指定的 gpt-image-2 视觉生成流程制作,适合建立空间记忆。图中的八条主干来自 AI 知识体系记忆脑图;生成图片只承担全景直觉,精确依赖和失败边界以下方 Mermaid 及正式主题正文为准。
3.1 图中三组结构
| 区域 | 主干 | 主要问题 | 应回到哪里验证 |
|---|---|---|---|
| 理论底座 | 基础、机器学习、深度学习 | 数据和指标是否可信,参数怎样学习表示 | 基础、ML、DL 正式主题与最小实验 |
| 智能应用 | LLM、RAG、Agent | 模型怎样生成、获得外部知识并受控行动 | LLM、RAG、Agent 正式主题与调用链 |
| 工程实战 | 工程治理、实战面试 | 系统怎样稳定上线,能力怎样被证据化验收 | AI Engineering、系统设计、项目和题库 |
3.2 生成图片的证据边界
- 已核验全景图、三张区域子图、三张独立专题图和生产高可用架构总览均为
1672 × 941的 PNG,中文主标签和编号主干可读; - 颜色只用于分组,区域名称、编号和箭头仍承担语义;
- 图片没有表达所有前置条件、循环依赖和失败分支,不能替代精确机制图;
- 模型生成图片中的文字不作为仓库统计、版本和能力结论的来源。
3.3 区域一子集:理论底座
图:子集|区域一理论底座知识图谱
替代文本: 理论底座从 01 基础进入 02 机器学习,再进入 03 深度学习并连接下一站 LLM。基础覆盖数据、数学、Python 和评测;机器学习覆盖学习范式、特征到优化的核心流程、典型模型和泛化验证;深度学习覆盖网络结构、前向与反向训练、表示学习和稳定性。底部用数据版本、实验配置、模型版本和评测证据贯穿三层。

读图结论: 理论底座的递进不是“会用更多模型”,而是先保证数据和评测可信,再建立可比较基线,最后理解参数怎样通过反向传播学到表示。
图中 01 → 02 → 03 → 04 表示推荐学习依赖,不代表真实项目只能串行推进。数据版本、实验配置和评测证据必须贯穿机器学习与深度学习,否则模型效果无法复现,也无法判断提升来自数据、代码、参数还是评测口径变化。
3.4 区域二子集:智能应用
图:子集|区域二智能应用知识图谱
替代文本: 智能应用由 04 LLM、05 RAG 和 06 Agent 组成。LLM 覆盖表示、Transformer、训练、推理和结构化输出;RAG 分为解析、切块、Metadata 与 ACL、Embedding、索引发布的离线链路,以及 Query 改写、混合召回、融合、Rerank 和上下文构造的在线链路;Agent 覆盖 Context、决策循环、Runtime 权限和恢复。LLM 为 RAG 与 Agent 提供能力底座,RAG 为 Agent 提供外部证据。

读图结论: LLM 负责语言生成与候选决策,RAG 负责外部证据,Agent Runtime 负责受控行动;三者职责不同,不能用一个“智能”节点混在一起。
底部 Query → State → Version → Trace → Evaluation 是运行证据主线。超时、证据不足和越权对应不同故障语义:分别进入服务降级、拒答或人工处理,不能统一为无条件重试。
3.5 区域三子集:工程实战
图:子集|区域三工程实战知识图谱
替代文本: 工程实战主链从 07 工程治理依次进入发布门禁、项目证据、08 实战面试和缺口反馈,再用虚线反馈到工程治理。工程治理包含服务化、可靠性、可观测性、性能与容量、成本治理和安全;发布门禁区分固定集回归、灰度发布、指标通过后放量的成功规则,以及指标失败、回滚、失败样本回灌和再评测的失败规则;实战面试包含系统设计、项目表达、故障复盘和分层回答。

读图结论: 工程实战的产出不是一张架构图,而是能通过发布门禁、形成项目证据、经受故障追问,并把暴露出的缺口送回下一轮工程改进。
区域三最终版使用简化发布门禁,避免在生成图片中用复杂回路线表达精确时序。成功规则是“固定集回归 → 灰度发布 → 指标通过 → 放量”,失败规则是“指标失败 → 回滚 → 失败样本回灌 → 再评测”;具体回归、灰度和回滚控制仍以正式系统设计文档及下方 Mermaid 为准。
3.6 LLM 独立图谱:从 Token 到生产推理
图:专题|LLM 从 Token 到生产推理知识图谱
替代文本: LLM 图谱从文本、Tokenizer、Token IDs 和 Embedding 的表示层开始,进入 Attention、FFN、残差归一化、Logits 和下一 Token 预测;训练区连接数据治理、预训练、SFT、偏好优化与评测反馈;推理区区分 Prefill、KV Cache、Decode、采样和结构化输出;服务区补充网关、调度、缓存、量化并行和可观测性,底部列出知识时效、幻觉、上下文窗口、延迟成本与安全边界。

读图结论: LLM 的生成能力来自 Token 表示、Transformer 和分阶段训练;生产可用性还取决于 Prefill/Decode、KV Cache、调度、评测与安全边界。
图中的五列是概念导航,不表示训练和在线推理发生在同一次请求中。Tokenizer 只负责把文本映射为离散 ID;模型通过训练后的参数和上下文进行下一 Token 预测。Prefill 处理已有上下文并建立缓存,Decode 则逐步生成新 Token;精确机制见 Token 与 Embedding、Attention 与 Transformer、LLM 预训练、微调与对齐和 LLM 推理与服务优化。
3.7 RAG 独立图谱:从数据治理到证据化回答
图:专题|RAG 从数据治理到证据化回答知识图谱
替代文本: RAG 图谱上半部分是离线索引链,覆盖数据源、解析与结构恢复、清洗去重、切块与父子块、Metadata、ACL、有效期、Embedding、稀疏与稠密索引和版本化发布;下半部分是在线问答链,覆盖 Query 改写、检索前置硬过滤、BM25 与 Dense ANN 分路召回、RRF 融合、Rerank、去重与多样性、上下文预算、LLM 和引用或拒答;右侧列出检索、答案、引用、系统和版本证据,底部给出检索为空与回答跑偏的排查路径。

读图结论: RAG 正确性由数据、权限、召回、重排、上下文、生成和引用共同决定;Reranker 只能重排已召回候选,不能补回漏召回证据。
图中显式区分 k_recall、k_rerank 和 k_context,推荐关系是 k_recall > k_rerank >= k_context,但具体数值必须由标注集、Token 预算、延迟和成本共同确定。ACL 是检索前置硬过滤;异构通道先独立召回再融合。详细实现、横向选型与生产排障仍以 RAG 基础链路、RAG 检索优化和 RAG 评测与生产工程为准。
3.8 Agent 独立图谱:从模型决策到受控执行
图:专题|Agent 从模型决策到受控执行知识图谱
替代文本: Agent 图谱从目标和用户输入进入 Context,Context 汇集指令、工具 Schema、Checkpoint 状态和检索到的记忆;LLM 提出 Plan、Action 或 Final,确定性 Runtime 对 Schema、权限、预算和终止条件进行校验,合法动作才进入工具执行器和外部系统;Observation 更新状态与 Checkpoint,下一轮 Context 再读取该状态。最终答案走验证与引用路径,未授权、超时或结果未知走核对权威状态后再重试、降级或人工审批的恢复路径;底部列出安全治理与可观测证据。

读图结论: 模型只提出候选动作,真正掌握权限、状态、副作用、恢复和终止的是确定性 Runtime。
图中的长期记忆是受治理的外部存储,不是模型参数本身;检索结果进入 Context,写入则必须经过去重、权限、脱敏和元数据校验。结果未知时先核对外部权威状态,不能直接重放可能产生副作用的动作。精确循环与安全边界见 Agent 核心机制和 Agent 工程化与安全。
4. 依赖图谱:从基础到工程实战
图:AI 学习主干的依赖与反馈图谱
替代文本: 数据、数学和编程基础进入机器学习,机器学习和深度学习形成模型底座,Transformer 与 LLM 连接 RAG 和 Agent;RAG 为 Agent 提供证据,LLM 为两者提供生成与决策能力;所有应用能力进入工程治理、系统设计、项目和面试,复盘结果再反馈到基础、数据和评测。
图表加载中…
读图结论: 学习路线有主方向,但不是一次性瀑布流程;项目和面试暴露的缺口必须反馈到数据、机制与评测,而不是只补一段话术。
这幅图比全景图片更强调依赖方向。RAG 与 Agent 不是 LLM 的替代品:RAG 负责外部证据,Agent 负责在受控运行时中选择行动,工程治理则横跨模型、检索、工具和项目交付。
5. 机制图谱:RAG 证据链
图:RAG 从数据治理到证据化回答的知识图谱
替代文本: 离线链路将数据源经过解析、结构恢复、切块、元数据与 ACL、Embedding 和索引发布;在线链路将 Query 经过改写和权限过滤,分别进入词法与向量召回,再融合、重排、选择上下文并生成带引用答案。版本清单连接离线与在线,证据不足进入拒答或受控降级。
图表加载中…
读图结论: RAG 的正确性由数据、权限、召回、重排、上下文、生成和引用共同决定;Reranker 只能重排已召回候选,不能补回漏召回证据。
更完整的公式、代码、候选选型和故障排查见 RAG 基础链路、RAG 检索优化与 RAG 评测与生产工程。
6. 机制图谱:Agent 受控行动链
图:Agent 从目标到受控终止的知识图谱
替代文本: 用户目标与当前状态组成上下文,模型提出候选动作,确定性 Runtime 校验 Schema、权限、预算和终止条件;合法工具调用进入执行器并产生观察,观察写回状态和 Checkpoint 后进入下一轮;最终答案经过验证返回,失败则进入受控重试、降级或人工审批。
图表加载中…
读图结论: 模型只提出候选动作,真正拥有工具权限、状态写入、副作用控制和终止权的是可审计的确定性 Runtime。
这幅图刻意把 LLM 与执行权限分开。Tool Calling 只是动作表达方式,完整 Agent 还需要循环控制、状态、恢复和终止;详细边界见 Agent 核心机制与 Agent 工程化与安全。
7. 工程图谱:生产治理六条主线
图:生产级 AI 应用的工程治理知识图谱
替代文本: 生产级 AI 应用连接质量、可靠性、可观测性、性能、成本和安全六条治理主线;每条主线都对应可验证证据,版本与发布治理把模型、Prompt、语料、索引和工作流变化连接到回归、灰度与回滚。
图表加载中…
读图结论: “模型能回答”只覆盖质量的一小部分;生产可用性必须同时拿出可靠性、观测、性能、成本、安全和版本发布证据。
六条主线不是六个独立部门,而是同一次 Run 的不同证据视角。系统设计时应能从一个 request_id 追到输入、模型、Prompt、检索、工具、状态、成本和最终验收结果;详细实践见 AI 应用可观测性与 LLMOps与 AI 应用系统设计。
7.1 Agent + RAG + LLM 生产高可用参考架构
架构结论| 生产高可用不是简单复制一个 Agent 服务,而是把无状态计算、持久状态、RAG 索引、模型调用和真实副作用拆成不同故障域:无状态服务跨可用区扩展,状态与索引按一致性要求复制,LLM 通过模型网关受控切换,工具副作用通过幂等、Outbox 和对账恢复。
图:教学总览|Agent + RAG + LLM 生产高可用架构
替代文本: 生产高可用架构按五层展开:流量入口通过 Global DNS、WAF、负载均衡和 API Gateway 将请求分发到可用区 A、B 的 API 与 Agent Runtime;跨可用区服务共享持久化工作流、Session、Checkpoint、Memory DB 和版本化配置;Agent 分别调用 RAG 检索、LLM 模型和工具执行三个能力平面;离线数据经过解析、切块、ACL、Embedding、评测和版本化索引别名发布;OpenTelemetry 与跨区域灾备横跨状态、配置、对象和索引。RAG 在召回前执行 ACL,模型网关并行选择主、备用或受控本地模型,工具链在结果未知时先对账再恢复。

读图结论: 单个 Pod、节点、可用区、模型端点或索引版本失败时都需要明确接管路径;高可用的关键不是多画几个副本,而是让状态、证据、模型路由和真实副作用分别具备可验证的恢复策略。
这张 gpt-image-2 图片用于快速建立五层空间结构,已人工检查主标签、ACL 前置关系、模型并行候选路由、结果未知先对账和跨区域灾备边界。由于生成图片不适合承载全部精确连线,组件依赖和回写方向以下方 Mermaid 为准。
图:架构|Agent + RAG + LLM 生产高可用组件边界
替代文本: 用户流量经过全局 DNS、WAF 和负载均衡进入两个可用区的 API 与 Agent Runtime 副本。Agent Runtime 依赖跨可用区的持久化工作流、Checkpoint、配置和缓存,分别调用 RAG 检索平面、LLM 模型网关和受控工具网关。RAG 在检索前执行租户、ACL 和 Metadata 硬过滤,再进行词法与向量召回、融合、重排和证据门禁;模型网关按健康度、能力和预算在主模型、备用模型与受控本地模型间路由;工具网关通过权限、幂等键、Outbox 和权威状态对账控制副作用。离线索引链以版本化别名原子发布,观测与灾备横跨所有平面。
图表加载中…
读图结论: 高可用的核心是让任何单个 Pod、节点、可用区、模型端点或索引版本失败时都存在明确接管路径,同时避免重试把故障放大为重复副作用、请求风暴或跨租户数据泄漏。
这是一张厂商中立的生产参考架构,不是已经压测通过的项目事实。落地时至少补齐以下验收证据:跨可用区副本和 PodDisruptionBudget、工作流与数据库仲裁恢复、索引版本原子切换、模型端点熔断降级、工具副作用幂等与结果对账、按 request_id + tenant + model/prompt/index/workflow version 串联的 Trace,以及按业务定义并演练的 RPO、RTO 和降级能力集。
这里的高可用边界也必须说清:PodDisruptionBudget 只约束自愿中断,不能防止全部故障;多可用区不等于跨区域容灾;双模型路由只能提高调用可用性,不能保证答案质量等价;RAG 主索引不可用时可切只读副本、词法检索或拒答,但不能绕过 ACL;外部工具返回“结果未知”时先查权威状态,不能盲目重试。
8. 面试图谱:从会背到可验证表达
图:AI 面试回答的层级与证据图谱
替代文本: 一个主题先形成定义、机制和边界三句 30 秒回答;面试官随后从原理、实现、工程、架构和项目复盘继续追问。每层回答都要连接代码、数据、日志、Trace、评测或项目产物,答不清的节点进入复习与实践,再回到闭卷复测。
图表加载中…
读图结论: 面试深度不是把答案说得更长,而是每次追问都能下钻到真实机制、工程证据和适用边界。
复习时不要顺着图背节点。先闭卷输出三句短答,再让专项题的 L1~L7 追问暴露缺口;具体训练入口见 AI 知识专项面试题库。
9. 图谱索引与使用方法
| 图谱 | 最适合解决的问题 | 使用时机 | 详细单一事实源 |
|---|---|---|---|
| AI 知识体系全景图 | 我现在学的内容位于哪里 | 初学、周复盘、选学习入口 | AI 知识体系记忆脑图 |
| 学习依赖图谱 | 前置知识和后续应用怎样连接 | 制定路线、定位知识断层 | 16 周 AI 面试导向学习计划 |
| LLM 独立图谱 | 从表示、训练到在线推理怎样衔接 | LLM 总复习、推理服务分析 | LLM 推理与服务优化 |
| RAG 证据链图谱 | 回答错误可能在哪一层产生 | 学习 RAG、线上排障 | RAG 系列 |
| Agent 受控行动图谱 | 模型决策和真实权限怎样分开 | Agent 设计、安全审查 | Agent 核心机制 |
| 工程治理图谱 | Demo 距离生产还缺什么证据 | 上线评审、系统设计 | AI 应用系统设计 |
| 面试证据图谱 | 怎样从短答进入原理和项目追问 | 模拟面试、项目复盘 | 专项题库 |
建议按以下方式使用:
- 先选图: 明确当前要解决的是定位、机制、工程还是表达问题;
- 再闭卷: 遮住图,先画主节点和关键边;
- 补证据: 为每个关键节点补一个公式、代码、日志、指标或项目产物;
- 查边界: 主动寻找权限、版本、失败、降级、成本和不适用条件;
- 回正文: 打开正式主题核对,不用图谱替代细节学习;
- 做复测: 在第 1、3、7、14、30 天重新画图并口述。
10. 维护与验收规则
新增图谱时执行以下检查:
- 图必须回答一个明确的理解难点,不能只换标题复用通用拓扑;
- 节点使用短标签,复杂定义、公式和边界放在图下正文;
- 连线要能说明是依赖、数据流、控制、反馈还是证据关系;
- 每张图都有图题、替代文本、读图结论和正文解释;
- 生成图片人工检查中文、箭头、组件和技术事实,精确关系优先用 Mermaid;
- 新图链接回正式主题的单一事实源,不在本专题复制完整正文;
- 主题或路径变化后同步检查相对链接、索引、渲染和事实边界;
- 交付前运行仓库插图、样式及其回归门禁。
11. 实践任务
- [ ] 用 90 秒口述全景图的三组结构、八条主干和五项工程闭环;
- [ ] 不看文档重画学习依赖图,并解释为什么 RAG 与 Agent 都依赖 LLM 但职责不同;
- [ ] 在 RAG 图上标出一次“检索为空”的排查顺序和需要记录的版本;
- [ ] 在 Agent 图上圈出模型不能直接拥有的权限、状态和副作用;
- [ ] 任选一个真实项目,用工程治理六条主线列出已有证据与缺失证据;
- [ ] 从专项题库抽一题,沿面试证据图回答到 L7,并记录第一次说不清的节点。
12. 相关知识与证据边界
- 八条主干的详细解释与闭卷方法:AI 知识体系记忆脑图;
- 岗位与能力证据:AI 岗位画像与求职能力地图;
- 学习执行节奏:16 周 AI 面试导向学习计划;
- 全部正式主题入口:AI Knowledge 知识库总目录;
- 递进验证入口:AI 知识专项面试题库。
- 多可用区与拓扑分散:Kubernetes Running in multiple zones 与 Pod Topology Spread Constraints,访问日期:2026-07-14;
- 自愿中断保护:Kubernetes Disruptions,访问日期:2026-07-14;
- 可观测信号与关联:OpenTelemetry Signals 与 OpenTelemetry Logging,访问日期:2026-07-14;
- 持久化执行参考:Temporal Platform Documentation,访问日期:2026-07-14。该链接只证明持久化执行是一条可行实现路径,不代表项目必须采用 Temporal。
本专题中的 Mermaid 是对现有正式主题的跨主题导航性提炼,不新增动态模型版本、价格、性能榜单或项目实测结论。八张 PNG 产物已检查尺寸、格式、主要文字和方向关系;其中 Agent 图经过一次主循环箭头修正,生产高可用图保留 Mermaid 作为精确关系底稿。更细粒度的机制、组件选型和故障结论以链接的正式主题为准。
13. 总结
一句话记忆: 用全景图确定位置,用机制图理解运行,用工程图检查生产证据,用面试图验证自己能否讲清和落地。
- 本专题是视觉导航与复习工具,不是语义知识图谱系统或新的正式技术主题;
- 全景图与三张区域子图把八条主干连成学习路线,LLM、RAG、Agent 三张独立专题图继续下钻到各自核心链路;
- RAG 与 Agent 图分别强调证据链和受控行动链,不能把检索、生成和权限混为一体;
- 组合架构把多可用区、持久状态、检索证据、模型故障切换和工具副作用恢复放进同一故障边界,并要求质量、可靠性、观测、性能、成本和安全同时有证据;
- 真正掌握要经过闭卷重画、正式主题核对、项目证据和 L1~L7 复测。