RAG评估与优化
756 字约 3 分钟
domain/aiai/rag
2026-07-24
1. 核心结论
- RAG 系统需要分别评估检索质量和生成质量,不能只看最终回答
- RAGAS 和 TruLens 是主流的 RAG 评估框架
- 核心评估指标:上下文相关性、答案相关性、答案忠实度、答案相关性
- 优化 RAG 需要系统性方法:从数据质量到检索策略到生成控制
- 持续监控和用户反馈是 RAG 系统迭代的关键
2. 基础概念
Context Relevance:检索到的上下文与查询的相关程度。
Answer Faithfulness:生成答案是否忠实于检索到的上下文。
Answer Relevance:生成答案与查询的相关程度。
Context Recall:检索结果覆盖正确答案的比例。
Context Precision:检索结果中相关文档的比例。
RAGAS:Retrieval Augmented Generation Assessment,RAG 评估框架。
TruLens:基于 RAG 三元组的评估框架。
3. 工作原理
RAG 评估体系:
- 检索评估:
- Context Precision:检索结果的相关性
- Context Recall:检索结果的完整性
- Hit Rate:正确答案是否在检索结果中
- MRR(Mean Reciprocal Rank):正确答案的排名
- 生成评估:
- Faithfulness:答案是否基于上下文
- Answer Relevance:答案是否回答查询
- Context Utilization:是否有效利用上下文
- 端到端评估:
- 人工评分
- LLM-as-a-Judge
- 用户反馈收集
优化策略矩阵:
| 问题 | 优化方向 |
|---|---|
| 检索不相关 | 改进 embedding、Hybrid Search、Rerank |
| 检索不完整 | 查询扩展、增加 K 值、多路召回 |
| 答案幻觉 | 强化 prompt 约束、降低 temperature |
| 答案不完整 | 增加上下文、改进切分策略 |
| 响应慢 | 缓存、优化检索、流式输出 |
| 成本高 | 减小上下文、选择小模型、批量处理 |
评估流程:
- 构建测试集(查询 + 标准答案 + 相关文档)
- 运行 RAG 系统获取结果
- 计算各项指标
- 分析瓶颈
- 针对性优化
- 回归测试
4. 实战场景
- RAG 系统上线前评估
- 不同检索策略对比
- Embedding 模型选择
- 切分策略优化
- Rerank 效果验证
- 持续质量监控
5. 常见误区
- 只评估最终答案:忽视检索环节的问题
- 测试集太小:无法代表真实场景
- 只用自动评估:人工评估不可替代
- 不建立基线:没有对比就无法判断优化效果
- 忽视用户反馈:用户满意度是最终指标
6. 进阶方向
- 自动化评估流水线
- 在线 A/B 测试
- 用户反馈闭环
- 多维度评估仪表盘
- 领域特定评估指标
- 实时质量监控
7. 推荐资料
- RAGAS Framework - https://docs.ragas.io/
- TruLens - https://www.trulens.org/
- LangSmith Evaluation - https://docs.smith.langchain.com/
- DeepEval - https://docs.confident-ai.com/
- ARAGOG Framework - https://arxiv.org/abs/2401.07397