RAG评估
723 字约 2 分钟
domain/aiai/safety
2026-07-24
1. 核心结论
- RAG 评估需要分别评估检索质量和生成质量,不能只看最终回答
- 核心指标:上下文相关性、答案忠实度、答案相关性、上下文召回率
- RAGAS 是最常用的 RAG 评估框架
- 评估应该覆盖不同查询类型和难度级别
- 持续评估是 RAG 系统优化的基础
2. 基础概念
Context Relevance:上下文相关性,检索结果与查询的相关程度。
Context Recall:上下文召回率,检索结果覆盖正确答案的比例。
Answer Faithfulness:答案忠实度,答案是否基于检索到的上下文。
Answer Relevance:答案相关性,答案是否回答用户查询。
Hit Rate:命中率,正确答案是否在检索结果中。
MRR:平均倒数排名,正确答案的排名指标。
RAGAS:Retrieval-Augmented Generation Assessment 框架。
3. 工作原理
RAG 评估体系:
- 检索评估:
- Context Precision:
- 检索结果中相关文档的比例
- 越高说明检索越精准
- Context Recall:
- 检索结果覆盖 ground truth 的比例
- 越高说明检索越完整
- Hit Rate@K:
- 正确答案在前 K 个结果中的比例
- MRR@K:
- 正确答案排名的倒数平均值
- Context Precision:
- 生成评估:
- Faithfulness:
- 答案是否忠实于上下文
- 检测幻觉的关键指标
- Answer Relevance:
- 答案是否回答用户查询
- 检测答非所问
- Context Utilization:
- 是否有效利用提供的上下文
- Faithfulness:
- 端到端评估:
- Answer Correctness:
- 答案与标准答案的相似度
- Human Evaluation:
- 人工评分
- 定性反馈
- Answer Correctness:
RAGAS 评估示例:
from ragas import evaluate
from ragas.metrics import faithfulness, answer_relevance, context_precision, context_recall
result = evaluate(
dataset=dataset,
metrics=[faithfulness, answer_relevance, context_precision, context_recall]
)
print(result)测试集构建:
- 覆盖不同查询类型
- 包含简单和复杂查询
- 包含边界情况
- 标注标准答案和相关文档
- 定期更新测试集
4. 实战场景
- RAG 系统上线前评估
- 检索策略对比
- Embedding 模型选择
- 切分策略优化
- Rerank 效果验证
- 持续质量监控
5. 常见误区
- 只评估最终答案:忽视检索环节
- 测试集太小:无法代表真实场景
- 不评估检索质量:只看生成不看检索
- 忽视领域差异:通用指标不一定适用
- 不持续评估:系统退化无法发现
6. 进阶方向
- 自动化评估流水线
- 领域特定指标
- 实时质量监控
- 用户反馈集成
- 多跳检索评估
- 多模态 RAG 评估
7. 推荐资料
- RAGAS - https://docs.ragas.io/
- LangSmith RAG Evaluation - https://docs.smith.langchain.com/
- DeepEval RAG - https://docs.confident-ai.com/
- TruLens RAG - https://www.trulens.org/