所有文章
阅读时长 1 分钟
基准拿了 85 分,为什么上线后还是一团糟?
单一分数很省事,却常常掩盖真实任务里的错误。把检索、格式、事实和用户感受拆开看,才知道模型到底哪里不行。
pass@1 只回答第一次尝试是否通过某个自动判定。它看不到错误有多严重、输出是否稳定,也看不到用户为修正结果付出了多少时间。
把质量拆成可诊断维度
按任务完成、事实与证据、格式、风格和安全分别评分。结构化抽取还要看字段级精确率与召回率;RAG 要把检索质量和回答忠实度分开。
同时测稳定性和严重度
对关键样本重复运行,记录结果波动。普通措辞差异和错误付款金额不能算成同等一次失败;为严重错误设置独立的零容忍或人工审批门槛。
用线上信号补充离线评测
把用户重试、编辑距离、放弃率、人工接管和投诉回流到评测集。线上信号能发现覆盖盲点,但不能直接当真值,仍需抽样复核。
上线前检查
- 指标能定位具体失败环节
- 严重错误不会被平均分稀释
- 离线评测与线上信号定期对照