所有文章
阅读时长 1 分钟

仪表盘全绿,不代表你的 LLM 评审真的靠谱

模型会给出很自信的分数,但这些分数未必和人的判断一致。先拿人工标注对照,再谈把它接进质量流程。

LLM 评审校准封面

LLM 评审适合扩大评测覆盖面,但它本身也是一个会偏、会漂移的测量工具。上线前必须先回答:它和目标用户或领域专家的判断一致到什么程度。

先写可观察的评分标准

把“好”拆成事实正确、任务完成、格式合规和风险等维度,每一档给出可观察例子。避免让评审用一个总分掩盖严重事实错误。

用盲评样本校准

准备有人类双人标注和分歧仲裁的样本,隐藏模型身份与输出顺序。比较一致率、各类别误差和严重错误漏判,而不是只看平均相关系数。

防止评审过拟合

保留一组不参与提示词调整的测试集;定期加入新失败案例。更换评审模型、提示词或被测模型后重新校准,因为任何一处变化都可能改变分数。

上线前检查

  • 评分维度能由人类独立判断
  • 关键错误单独统计漏判率
  • 评审版本和提示词可追溯

资料来源

相关阅读