你的技术前沿之旅,从这里开始
上线之后要盯住哪些指标
线上问题很少在平均指标上暴露,分布漂移与长尾请求才是重点。

一、区分错误类型
把失败分成解析错误、检索错误、生成错误与工具执行错误。平均成功率无法反映结构问题,分类统计才能定位。
二、监控分布而不是只看总量
输入分布随时间漂移是常态。定期抽样人工复核,比等指标下跌再反应更早发现问题。
三、保留可复现的样本
线上出现异常时,能否用当时的输入复现问题,决定了排查速度。日志里应保留足够的上下文。
四、回归评测要能自动跑
把业务评测集接进发布流程,每次改动都跑一次。人工抽检无法替代可重复的回归评测。
五、权限与合规属于系统设计
访问控制、审计与数据保留策略需要与部署环境一起确定,超出模板层可以覆盖的范围。
六、变更要有回滚路径
提示词、模型版本与检索配置都属于会改变行为的东西。上线前确认这些项都可以单独回滚,避免一次改动同时影响多个变量。
七、适用边界
本文讨论可观测性与排查方法,不涉及具体平台的配置步骤。