所有文章
阅读时长 2 分钟

评测工具买了一堆,真正缺的往往是一套好样本

模型、框架和指标都要靠标注样本落地。样本不贴近真实用户,再漂亮的评测分数也很难帮你做决定。

LLM golden set 构建封面

黄金集不是随手收集的一批“标准答案”,而是一组能代表真实任务、风险和决策边界的版本化样本。它的质量决定后续指标有没有意义。

从真实分布取样

按任务类型、语言、长度、用户群和风险分层,从生产请求或历史工单抽样。去除隐私后保留困难、模糊和失败案例;不要只收团队容易达成一致的干净输入。

定义答案之外的证据

有些任务有唯一标签,有些只能给评分规则、必要事实和不可接受错误。为每条样本保存来源、适用时间、标注者、仲裁记录和允许的答案范围。

把集合分成开发与保留集

开发集用于调提示词和定位问题,保留集只用于发布门槛。新增线上失败时先判断它代表普遍分布还是罕见风险,再有意识地加入相应分层,避免只追着最近一次事故优化。

上线前检查

  • 样本覆盖真实占比和高风险长尾
  • 标注分歧有记录而非强行平均
  • 每次变更能复现使用的集合版本

资料来源

相关阅读