所有文章
阅读时长 2 分钟
榜单第一的编程 Agent,放进你的仓库还好用吗?
SWE-bench 能告诉你模型大概有多强,却不能替你回答它懂不懂你的代码、测试和约定。更可靠的办法,是用自己的真实任务给它一次小规模试用。
公开基准适合筛选候选模型,但不能替代仓库内评测。你的依赖、测试速度、代码约定和权限边界,都会改变 Agent 的真实成功率。
从真实工单抽样
选取已经关闭且结果明确的缺陷、重构和小功能,隐藏最终补丁,只给当时可获得的信息。样本要覆盖不同目录、任务长度和失败风险,不能只挑容易演示的任务。
成功不等于测试绿
先检查能否构建和通过测试,再看改动是否满足需求、是否越权修改、是否引入维护负担。记录人工审查时间和返工次数,因为省下的生成时间可能被审查吃掉。
用同一环境重复运行
固定代码快照、依赖、工具权限和时间上限,对每个任务运行多次。Agent 有随机性,单次成功不能代表稳定;结果应同时报告成功率、成本、中位耗时和高风险失败。
上线前检查
- 任务来自真实历史而非自编谜题
- 评分者看不到模型身份
- 失败补丁按原因分类并可复现