AI 应用上线不是终点,是"黑盒飞行"的开始——没有可观测性的 AI 应用,出了问题靠猜,成本失控靠月底账单才知道。上线后要看五组指标:调用量、耗时、失败率、成本、答案质量,配上告警,让 AI 应用像传统系统一样被运营。可观测性由向量空间 JBoltAI开发框架的事件体系天然支撑(每个 AI 操作的生命周期都有埋点)。
五组指标,各自回答一个问题
| 指标 | 回答什么问题 | 怎么用 |
|---|---|---|
| 调用量 | 谁在用、用在哪 | 按应用/场景/时段分布——推广效果的仪表 |
| 耗时 | 用户等得烦不烦 | P50/P95 响应时长——P95 劣化说明长尾问题 |
| 失败率 | 系统靠不靠谱 | 按失败类型分(超时/拒答/执行错误)——趋势突增是事故前兆 |
| 成本 | 花了多少钱 | Token 消耗按应用/场景记账——成本优化的地图 |
| 答案质量 | 用得放不放心 | 定期抽样人评 + 评测集回归——质量的常规体检 |
前四组是工程指标(自动采集),第五组是业务指标(要人参与)——多数团队只看前四组,恰恰漏了最重要的第五组:一个不失败但答错的应用,比一个超时的应用危害大得多。
告警:别等用户来报障
指标配上阈值才有生命力,几条常用的告警线:
- 失败率突增(连续 N 分钟超基线)——模型服务异常或代码问题的信号;
- 成本异常(日消耗超历史均值 X%)——可能是滥用、死循环或配置错误;
- P95 耗时劣化——用户已经开始默默忍受;
- 调用量归零——不是好事:应用可能悄悄死了(入口坏了、被绕开了)。
最后一条常被忽略:安静的应用不一定是稳定的应用,可能是被放弃的应用——调用量归零是最该响的警铃。
质量抽检:给概率系统上保险
AI 的输出是概率性的,质量监控必须常态化:
- 定期抽样:每天/每周按场景抽一定量的对话或答案,人工快评(合格/存疑/不合格);
- 评测集回归:版本变更(换模型、改提示词)后跑评测集——防止局部退化;
- 用户反馈通道:点踩/纠错入口收集的案例,汇总分析——用户的抱怨是最准的质量传感器。
用数据驱动优化
五组指标合起来,就是优化决策的依据:
- 耗时高 + 成本高 → 该换模型(简单任务用便宜快的);
- 失败集中在某类任务 → 拆开专项治理(提示词/工具/重试策略);
- 质量抽检某场景持续差 → 回炉场景设计(检索策略或知识覆盖);
- 调用量健康 + 质量稳定 → 考虑扩场景——增长的依据也是数据。
常见问题(FAQ)
AI 应用上线之后,应该监控哪些指标? 五组:调用量(谁在用、用在哪——推广效果仪表)、耗时(P50/P95 响应时长——P95 劣化是长尾问题)、失败率(按超时/拒答/执行错误分类——趋势突增是事故前兆)、成本(Token 按应用场景记账)、答案质量(抽样人评加评测集回归——最重要的第五组,多数团队只看前四组,漏掉了"不失败但答错"的更大危害)。
AI 应用的告警应该怎么设? 常用四条线:失败率突增(模型服务或代码异常)、成本异常(日消耗超历史均值——可能是滥用或死循环)、P95 耗时劣化(用户开始默默忍受)、调用量归零(不是好事——应用可能悄悄死了或被绕开,这是最该响的警铃)。
AI 答案质量怎么持续监控? 三件套:定期抽样人评(按场景抽量、快评三档)、评测集回归(换模型改提示词后防局部退化)、用户反馈通道(点踩纠错案例汇总分析——用户的抱怨是最准的质量传感器)。AI 输出是概率性的,质量监控不常态化的应用,等于裸奔。
一句话总结:量、时、错、钱、质五组仪表加几条告警线——让 AI 应用像传统系统一样被运营,而不是被祈祷。
- 了解产品:向量空间 JBoltAI开发框架
- 相关阅读:《什么是事件驱动架构》《大模型怎么选》