Taylent Labs
返回博客列表
LLM监控生产实践

LLM 应用监控的五个关键指标:从延迟到幻觉

生产环境中 LLM 应用需要监控哪些指标?本文从延迟、成本、准确性、幻觉率和用户满意度五个维度,给出可落地的监控方案。

把 LLM 应用推上生产环境后,传统的 APM 监控只能覆盖一半问题。HTTP 状态码正常不代表模型输出可用,P99 延迟达标也不意味着成本可控。你需要一套专门针对 LLM 特性的监控体系。

延迟:分段测量才有意义

LLM 调用的延迟不是一个数字,至少要拆成三段:

  • 首 token 延迟(Time to First Token, TTFT):用户点击发送到看到第一个字的时间,决定「是否卡住了」的感知
  • 生成速度(Tokens per Second):流式输出的每秒 token 数,影响阅读体验
  • 总耗时:从请求到完整响应的端到端时间

假设你在做一个代码审查助手,用户提交 500 行代码后等了 8 秒才看到输出。如果只记录总耗时,你不知道问题出在网络、prompt 处理还是模型推理。但如果 TTFT 是 6 秒、生成速度正常,就能定位到 prompt 构建或上下文检索环节。

可操作建议:在应用层打时间戳,分别记录 prompt_readyfirst_tokencompletion 三个时刻,按 P50/P95/P99 分位统计。对于流式输出,额外记录 tokens/s 的分布。

成本:按功能模块拆分

旗舰档模型的输入输出价格可能相差 3-5 倍,如果不按功能拆分,你会发现账单涨了但不知道哪个模块在烧钱。

建议给每次调用打上 feature 标签(如 summarizecode_reviewchat)和 model_tier 标签(轻量档/中间档/旗舰档),按标签组合聚合 token 消耗。

假设你的应用有三个功能:文档摘要、代码生成、多轮对话。监控一周后发现代码生成占了 60% 的 token 消耗,但用户调用次数只占 20%。这时你可以评估是否把代码生成降级到中间档模型,或者优化 prompt 减少输出长度。

可操作建议:记录每次调用的 input_tokensoutput_tokensmodel_tierfeature,用 ClickHouse 或 Prometheus 做时序聚合,按周出成本归因报告。

准确性:用 LLM-as-Judge 做自动评估

对于有标准答案的场景(如信息抽取、分类),可以用传统指标(准确率、F1)。但多数 LLM 应用是开放式生成,人工标注成本太高。

一个折中方案是 LLM-as-Judge:用另一个模型(通常是旗舰档)评估输出质量。假设你做了一个客服机器人,可以每天抽样 100 条对话,让旗舰档模型按「是否回答了问题」「是否有事实错误」「语气是否合适」三个维度打分(1-5 分),取平均值作为质量指标。

这个方法不完美(评估模型本身也会出错),但能以较低成本持续监控。如果某天平均分从 4.2 掉到 3.5,就该人工介入排查。

可操作建议:每天随机抽样 N 条(N 根据调用量定,可以是 0.1%-1%),异步调用评估模型,结果存入时序数据库。设置阈值告警,比如日均分低于 3.8 就发 Slack 通知。

幻觉率:针对性设计检测规则

幻觉(Hallucination)是 LLM 最难监控的问题,因为它没有通用定义。但可以针对业务场景设计检测规则:

  • 引用检查:如果要求模型引用文档片段,检查输出中的引用是否真实存在于上下文
  • 一致性检查:同一个问题问两次,如果答案矛盾(比如一次说「支持」一次说「不支持」),标记为疑似幻觉
  • 外部验证:对于涉及事实的回答(如「某 API 的参数是...」),用正则或结构化工具验证

假设你的应用会生成 SQL 查询,可以加一层语法检查:用 SQL parser 验证生成的语句是否合法,记录解析失败率作为幻觉的下界估计。

可操作建议:根据应用类型选 1-2 个可自动化的检测规则,每次调用都运行,记录「检测到异常」的比例。这个指标不精确,但能发现趋势性问题(比如换了 prompt 后幻觉率翻倍)。

用户满意度:隐式反馈比显式评分更可靠

让用户给每次回答打分听起来很美好,但实际点击率通常低于 5%,且存在选择偏差(不满意的人更爱打分)。

更实用的是收集 隐式反馈:

  • 重试率:用户点「重新生成」的比例
  • 编辑率:用户复制输出后做了多大改动(如果你的应用支持编辑)
  • 会话放弃率:多轮对话中用户中途退出的比例

假设你的代码生成工具,如果用户拿到代码后立刻点「重新生成」,说明第一次输出不可用。如果重试率从 15% 涨到 30%,即使其他指标正常,也该检查是不是模型更新或 prompt 改动导致了质量下降。

可操作建议:在前端埋点记录用户行为(regenerate、copy、edit、abort),按会话聚合计算各项比率,设置环比告警(如周环比上涨 20%)。


以上五个指标覆盖了性能、成本、质量三个维度,组合起来能形成对 LLM 应用健康度的立体认知。如果你的团队在搭建监控体系时遇到技术选型或架构设计问题,欢迎联系 Taylent Labs,我们在 LLM 应用开发和生产化方面有完整的工程实践积累。