所有文章
阅读时长 1 分钟
仪表盘全绿,不代表你的 LLM 评审真的靠谱
模型会给出很自信的分数,但这些分数未必和人的判断一致。先拿人工标注对照,再谈把它接进质量流程。
LLM 评审适合扩大评测覆盖面,但它本身也是一个会偏、会漂移的测量工具。上线前必须先回答:它和目标用户或领域专家的判断一致到什么程度。
先写可观察的评分标准
把“好”拆成事实正确、任务完成、格式合规和风险等维度,每一档给出可观察例子。避免让评审用一个总分掩盖严重事实错误。
用盲评样本校准
准备有人类双人标注和分歧仲裁的样本,隐藏模型身份与输出顺序。比较一致率、各类别误差和严重错误漏判,而不是只看平均相关系数。
防止评审过拟合
保留一组不参与提示词调整的测试集;定期加入新失败案例。更换评审模型、提示词或被测模型后重新校准,因为任何一处变化都可能改变分数。
上线前检查
- 评分维度能由人类独立判断
- 关键错误单独统计漏判率
- 评审版本和提示词可追溯