Skip to content

AI 应用应该记录哪些日志、指标和 Trace?

3 分钟速学卡

30 秒口述: 我会用 AI 可观测性把一次任务的系统行为、模型行为和质量证据串起来:Metric 看趋势与告警,Log 记录结构化事件,Trace 还原单请求各阶段因果链。每个 Run 至少关联 request_id、身份与租户、模型、Prompt、语料、索引、工具和工作流版本,以及 Token、延迟、错误、重试、降级和质量结果。原始 Prompt、文档和模型输出可能包含敏感数据,应最小化采集、脱敏、分级访问并设置保留期。

  • 本质: AI 可观测性必须同时证明系统发生了什么、模型为何这样回答,以及结果是否有用。
  • 核心机制: Metric 看趋势,Log 看事件,Trace 看单次因果链;每个 Run 绑定完整版本指纹与成本、质量证据。
  • 关键判断: 高基数字段不进入无界 Metric 标签;敏感文本最小化采集、脱敏并分级保留。
  • 项目落地: 故障演练:回答质量突然下降但系统错误率正常。先按模型、Prompt、索引和租户分桶,找到质量首次变化的版本,再重放同一评测样本并检查 final_context、截断、工具结果与降级路径。
  • 边界与坑: “把 Prompt 和答案全部写日志”:可能泄露隐私,也缺少阶段和版本关系;“有 Dashboard 就可观测”:聚合图不能还原单次请求根因。

目录

面试官为什么问

面试官关注你能否回答“为什么这一次错了”,而不只是知道接入某个监控产品。优秀回答会说明信号分工、高基数治理、版本指纹和隐私边界。

小白先看懂

医院运营看三种记录:大屏显示今天平均等待时间,病历记录某次诊疗事件,完整诊疗时间线还原患者从挂号到出院的过程。大屏对应 Metric,病历事件对应 Log,端到端时间线对应 Trace,患者编号对应 request_id

技术上,Metric 适合低基数聚合,Trace 适合请求级阶段与因果,Log 适合可搜索事件。类比没有覆盖模型质量难以自动判断,所以还要关联评测结果、引用支持和人工反馈。

主题图与核心原理

图:教学图片|AI 应用应该记录哪些日志、指标和 Trace?

替代文本: 围绕“AI 应用应该记录哪些日志、指标和 Trace?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

AI 应用应该记录哪些日志、指标和 Trace?教学图片

读图结论: 系统正常不代表答案正确;版本与质量必须进入同一条链。

这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:一条 Run 的三类观测信号

替代文本: 请求经过接入、检索、模型和工具阶段,Metric 聚合趋势,Log 保存事件,Trace 串联阶段与版本,质量反馈回流评测集。

图表加载中…

读图结论: 三类信号互补:趋势靠指标,事件靠日志,单次根因与版本重放靠 Trace。

Metric 避免把 request_id、用户文本等高基数字段放进标签;Trace Span 建议覆盖网关、检索通道、Rerank、上下文构造、模型 attempt、工具和校验;Log 记录错误分类与策略决策。版本指纹应能定位模型、Prompt、语料、索引、工作流和配置。

项目和生产视角

故障演练: 回答质量突然下降但系统错误率正常。先按模型、Prompt、索引和租户分桶,找到质量首次变化的版本,再重放同一评测样本并检查 final_context、截断、工具结果与降级路径。若没有版本指纹和上下文 Trace,只能猜测,无法形成修复证据。

监控应同时覆盖系统层的 QPS、错误、尾延迟、队列与成本,以及质量层的任务成功、引用支持、拒答、工具成功和人工接管;告警必须绑定可执行 Runbook。

常见错误回答

  • “把 Prompt 和答案全部写日志”:可能泄露隐私,也缺少阶段和版本关系。
  • “有 Dashboard 就可观测”:聚合图不能还原单次请求根因。
  • “所有字段都做 Metric 标签”:高基数会造成成本和性能问题。

递进追问

  1. Metric、Log 和 Trace 各自最适合回答什么问题?
  2. 一次 RAG 请求的 Trace 至少有哪些 Span?
  3. 如何关联质量指标与系统指标?
  4. Prompt 和上下文如何脱敏又保留可重放性?
  5. 怎样发现同一请求混用了两个索引版本?

关联阅读

总结

一句话记忆: AI 可观测性必须同时证明系统发生了什么、模型为何这样回答,以及结果是否有用。

  • Metric 看趋势,Log 看事件,Trace 看单次因果链。
  • 每个 Run 绑定完整版本指纹与成本、质量证据。
  • 高基数字段不进入无界 Metric 标签。
  • 敏感文本最小化采集、脱敏并分级保留。