所有文章
阅读时长 2 分钟
评测工具买了一堆,真正缺的往往是一套好样本
模型、框架和指标都要靠标注样本落地。样本不贴近真实用户,再漂亮的评测分数也很难帮你做决定。
黄金集不是随手收集的一批“标准答案”,而是一组能代表真实任务、风险和决策边界的版本化样本。它的质量决定后续指标有没有意义。
从真实分布取样
按任务类型、语言、长度、用户群和风险分层,从生产请求或历史工单抽样。去除隐私后保留困难、模糊和失败案例;不要只收团队容易达成一致的干净输入。
定义答案之外的证据
有些任务有唯一标签,有些只能给评分规则、必要事实和不可接受错误。为每条样本保存来源、适用时间、标注者、仲裁记录和允许的答案范围。
把集合分成开发与保留集
开发集用于调提示词和定位问题,保留集只用于发布门槛。新增线上失败时先判断它代表普遍分布还是罕见风险,再有意识地加入相应分层,避免只追着最近一次事故优化。
上线前检查
- 样本覆盖真实占比和高风险长尾
- 标注分歧有记录而非强行平均
- 每次变更能复现使用的集合版本