所有文章
阅读时长 2 分钟

一个 Agent 开始自己跑以后,最先要补的不是能力

把 Agent 接上工具不难,难的是让它出错时停得下来、查得清楚、花得明白。这篇文章从真实系统里最容易漏掉的护栏、记忆、评测和成本说起。

AI agent 生产架构 2026 封面

把模型接上搜索、数据库和代码执行器,只能证明它会调用工具,不能证明它适合无人值守。生产系统真正需要设计的是:它能做什么、做到哪一步必须停、出了错如何恢复。

先把工作流画出来

把一次任务拆成明确状态:接收输入、制定计划、调用工具、检查结果、提交输出。每个状态都要有允许的下一步、超时和最大重试次数。Anthropic 的工程指南也建议先用简单、可组合的工作流,只有在步骤无法预先定义时才增加自主性。

权限不跟模型能力走

工具权限按任务最小化,而不是因为模型“更聪明”就放宽。读操作和写操作分开;发消息、付款、删除和部署必须二次确认;密钥放在工具层,不能进入提示词。

失败要有确定出口

给整个任务设置时间、步骤和预算上限。工具返回异常时先分类:可重试错误使用退避;权限或参数错误立即停止;结果不确定则转人工。不要让模型用同一种参数无限重试。

上线前检查

  • 一个测试环境任务能从头回放
  • 所有副作用操作都能被拦截或撤销
  • 达到预算、步骤或时间上限时会明确失败

资料来源

相关阅读