AI 应用的故障链路比传统 Web 应用更长。一次用户提问可能经过网关、鉴权、业务编排、Prompt 构造、向量检索、Rerank、模型推理、工具调用和结果后处理。任何一环变慢或失败,用户都会感知为回答慢、答非所问或无响应。
指标体系
基础指标包括 QPS、错误率、P95/P99 延迟、GPU 利用率、显存占用、队列长度和容器重启次数。RAG 场景还要监控召回数量、命中文档、无答案比例和向量数据库耗时。Agent 场景则要观察工具调用次数、失败率和超时分布。
日志与追踪
指标能告诉你系统不正常,日志和链路追踪才能帮助定位具体环节。建议每次请求保留 request id,把网关、业务 API、检索服务、模型服务和工具调用日志串起来。排查时先看错误边界,再看耗时边界,避免只盯模型服务。
告警策略
告警不应只关注服务是否存活,更要关注用户体验和资源风险。例如 P95 延迟持续升高、GPU 显存接近上限、检索接口错误率升高、队列积压超过阈值,都应该触发分级告警和处理流程。

