所有文章
阅读时长 1 分钟

RAG 回答得像那么回事,检索真的找对了吗?

只看最后一句答案,很难知道问题出在检索还是生成。把两段拆开测,才不用在模型看似正常时盲猜。

RAG 评测实操封面

RAG 的答案错了,可能是资料没入库、查询改写错误、相关块没召回,也可能是模型没有忠实使用已召回证据。评测必须把这些阶段拆开。

先建有证据的问题集

从真实查询抽样,为每题标注可回答性、支持片段和允许答案。加入资料库中没有答案的问题,测试系统是否会承认不知道,而不是总能找到一句相似文本。

检索和生成分别计分

检索看相关证据是否被召回、噪声比例和排名;生成看答案是否由上下文支持、是否完整回答、引用是否对应。Ragas 提供相关指标定义,但自动评分仍需用人工样本校准。

按失败类型推动修复

未召回应检查入库、切块和搜索;召回正确但回答错应检查提示词、上下文排序和模型;来源过期则修内容生命周期。不要用更大模型掩盖索引问题。

上线前检查

  • 问题集包含不可回答样本
  • 引用正确性独立检查
  • 每次失败能归到具体阶段

资料来源

相关阅读