首页 / Skills 资产 / rag-eval-checklist

rag-eval-checklist

评测 RAG 系统质量时使用。当需要判断一个 RAG/知识库问答系统"能不能上生产"、或要给 RAG 建立评测闭环时,按此清单执行:构建评测集 → RAGAS 核心指标 → 脏数据压力测试 → 上线门槛判定。

raw markdown ↗
ragevalragasproduction

给 RAG 系统建立评测闭环的可执行步骤。适用场景:客户问"你们这个问答系统准确率多少"、上线前验收、迭代后回归测试。

第一步:构建评测集(不要用真实用户当小白鼠)

  1. 从真实文档里挑 30–50 个问题,覆盖三类:
    • 答案在文档里(约 70%)——考检索和生成
    • 答案不在文档里(约 20%)——考"拒答"能力
    • 需要跨文档综合(约 10%)——考多跳检索
  2. 每个问题人工写出标准答案和出处文档 ID
  3. 存成 CSV:question, ground_truth, source_doc

第二步:跑 RAGAS 核心指标

bashpip install ragas

四个指标,及格线参考(生产门槛):

指标测什么上线门槛
Faithfulness 忠实度答案是否忠于检索到的内容(幻觉率反向)≥ 0.85
Answer Relevancy答案与问题的相关性≥ 0.80
Context Precision检索回来的内容里"有用的占多少"≥ 0.75
Context Recall该检到的是否检到了≥ 0.85

第三步:脏数据压力测试(企业现场的真考点)

干净数据人人会跑,用下面这些"脏"样本再测一轮:

记录每一类的失败模式,这就是给客户的技术方案里"已知限制"一节的内容。

第四步:判定与迭代

参考资源