所有文章
阅读时长 2 分钟

Agent 跑错了,别只盯着最后那句答案

一个 Agent 连着调用二十步工具,最后答错只是表象。想知道它为什么跑偏,得看见每次判断、调用和重试留下的轨迹。

AI agent 可观测性生产 2026 封面

只记录最终回答,无法解释 Agent 为什么选错工具、重复调用或花费失控。可观测性的最小单位应该是一次任务中的每个模型调用和工具调用。

先统一一条任务轨迹

为一次用户任务生成 trace ID,模型推理、检索和工具调用分别记录 span。至少保留模型名、延迟、token、工具名、结果状态、重试和错误类型。OpenTelemetry 已提供生成式 AI 的语义约定,可避免每个团队自造字段。

内容与元数据分开

生产日志默认记录长度、哈希、错误类别和评测结果,不默认保存完整提示词、文档或个人信息。确需采样正文时,应脱敏、限权并设置短保留期。

告警围绕用户任务

不要只盯单次 API 失败率。更有用的告警包括任务成功率下降、每任务成本突增、工具循环、人工接管率上升,以及某类输入的质量退化。

上线前检查

  • 从失败任务能定位到具体调用
  • 日志不含未授权的敏感正文
  • 成本和质量能按功能、版本和模型切分

资料来源

相关阅读