所有文章
阅读时长 1 分钟

基准拿了 85 分,为什么上线后还是一团糟?

单一分数很省事,却常常掩盖真实任务里的错误。把检索、格式、事实和用户感受拆开看,才知道模型到底哪里不行。

LLM 输出质量评测超越 pass@1 封面

pass@1 只回答第一次尝试是否通过某个自动判定。它看不到错误有多严重、输出是否稳定,也看不到用户为修正结果付出了多少时间。

把质量拆成可诊断维度

按任务完成、事实与证据、格式、风格和安全分别评分。结构化抽取还要看字段级精确率与召回率;RAG 要把检索质量和回答忠实度分开。

同时测稳定性和严重度

对关键样本重复运行,记录结果波动。普通措辞差异和错误付款金额不能算成同等一次失败;为严重错误设置独立的零容忍或人工审批门槛。

用线上信号补充离线评测

把用户重试、编辑距离、放弃率、人工接管和投诉回流到评测集。线上信号能发现覆盖盲点,但不能直接当真值,仍需抽样复核。

上线前检查

  • 指标能定位具体失败环节
  • 严重错误不会被平均分稀释
  • 离线评测与线上信号定期对照

资料来源

相关阅读