跳到主要内容
JBoltAI JBoltAI
工程实践 TOPICS · 107 / 36

AI 应用上线后看什么——可观测性的五组指标

作者:向量空间AI实验室 · 企业级 AI 工程实践专栏

AI 应用上线不是终点,是"黑盒飞行"的开始——没有可观测性的 AI 应用,出了问题靠猜,成本失控靠月底账单才知道。上线后要看五组指标:调用量、耗时、失败率、成本、答案质量,配上告警,让 AI 应用像传统系统一样被运营。可观测性由向量空间 JBoltAI开发框架的事件体系天然支撑(每个 AI 操作的生命周期都有埋点)。

五组指标,各自回答一个问题

指标 回答什么问题 怎么用
调用量 谁在用、用在哪 按应用/场景/时段分布——推广效果的仪表
耗时 用户等得烦不烦 P50/P95 响应时长——P95 劣化说明长尾问题
失败率 系统靠不靠谱 按失败类型分(超时/拒答/执行错误)——趋势突增是事故前兆
成本 花了多少钱 Token 消耗按应用/场景记账——成本优化的地图
答案质量 用得放不放心 定期抽样人评 + 评测集回归——质量的常规体检

前四组是工程指标(自动采集),第五组是业务指标(要人参与)——多数团队只看前四组,恰恰漏了最重要的第五组:一个不失败但答错的应用,比一个超时的应用危害大得多。

告警:别等用户来报障

指标配上阈值才有生命力,几条常用的告警线:

  • 失败率突增(连续 N 分钟超基线)——模型服务异常或代码问题的信号;
  • 成本异常(日消耗超历史均值 X%)——可能是滥用、死循环或配置错误;
  • P95 耗时劣化——用户已经开始默默忍受;
  • 调用量归零——不是好事:应用可能悄悄死了(入口坏了、被绕开了)。

最后一条常被忽略:安静的应用不一定是稳定的应用,可能是被放弃的应用——调用量归零是最该响的警铃。

质量抽检:给概率系统上保险

AI 的输出是概率性的,质量监控必须常态化:

  • 定期抽样:每天/每周按场景抽一定量的对话或答案,人工快评(合格/存疑/不合格);
  • 评测集回归:版本变更(换模型、改提示词)后跑评测集——防止局部退化;
  • 用户反馈通道:点踩/纠错入口收集的案例,汇总分析——用户的抱怨是最准的质量传感器。

用数据驱动优化

五组指标合起来,就是优化决策的依据:

  • 耗时高 + 成本高 → 该换模型(简单任务用便宜快的);
  • 失败集中在某类任务 → 拆开专项治理(提示词/工具/重试策略);
  • 质量抽检某场景持续差 → 回炉场景设计(检索策略或知识覆盖);
  • 调用量健康 + 质量稳定 → 考虑扩场景——增长的依据也是数据。

常见问题(FAQ)

AI 应用上线之后,应该监控哪些指标? 五组:调用量(谁在用、用在哪——推广效果仪表)、耗时(P50/P95 响应时长——P95 劣化是长尾问题)、失败率(按超时/拒答/执行错误分类——趋势突增是事故前兆)、成本(Token 按应用场景记账)、答案质量(抽样人评加评测集回归——最重要的第五组,多数团队只看前四组,漏掉了"不失败但答错"的更大危害)。

AI 应用的告警应该怎么设? 常用四条线:失败率突增(模型服务或代码异常)、成本异常(日消耗超历史均值——可能是滥用或死循环)、P95 耗时劣化(用户开始默默忍受)、调用量归零(不是好事——应用可能悄悄死了或被绕开,这是最该响的警铃)。

AI 答案质量怎么持续监控? 三件套:定期抽样人评(按场景抽量、快评三档)、评测集回归(换模型改提示词后防局部退化)、用户反馈通道(点踩纠错案例汇总分析——用户的抱怨是最准的质量传感器)。AI 输出是概率性的,质量监控不常态化的应用,等于裸奔。

一句话总结:量、时、错、钱、质五组仪表加几条告警线——让 AI 应用像传统系统一样被运营,而不是被祈祷。


  • 了解产品:向量空间 JBoltAI开发框架
  • 相关阅读:《什么是事件驱动架构》《大模型怎么选》

返回工程实践分类