AI评估体系
726 字约 2 分钟
domain/aiai/safety
2026-07-24
1. 核心结论
- AI 评估是衡量模型和应用质量的关键环节,贯穿开发和运营全生命周期
- 评估应该多维度进行,包括准确性、完整性、安全性、成本等
- 自动化评估和人工评估结合,各有优劣
- LLM-as-a-Judge 是当前主流的自动化评估方式
- 评估体系应该持续迭代,适应模型和应用的发展
2. 基础概念
Evaluation:评估,衡量 AI 系统的质量和性能。
Benchmark:标准化测试集,用于对比不同模型。
Metric:评估指标,量化的质量度量。
LLM-as-a-Judge:使用 LLM 作为评估者。
Human Evaluation:人工评估,人类专家评分。
A/B Testing:对比测试,比较两个版本的效果。
Ground Truth:标准答案,用于对比评估。
3. 工作原理
评估体系框架:
- 评估维度:
- 准确性:输出是否正确
- 完整性:是否覆盖所有要点
- 相关性:是否与查询相关
- 一致性:多次输出是否一致
- 安全性:是否包含有害内容
- 成本:每次请求的花费
- 延迟:响应速度
- 评估方法:
- 自动化评估:
- 规则匹配
- 模型评分
- 指标计算
- 人工评估:
- 专家评分
- 众包标注
- 用户反馈
- 混合评估:
- 自动初筛 + 人工复核
- LLM-as-a-Judge + 人工校验
- 自动化评估:
- 评估流程:
- 构建测试集
- 运行评估
- 分析结果
- 优化改进
- 回归测试
主流评估框架:
- RAGAS:RAG 系统评估
- DeepEval:通用 LLM 评估
- LangSmith:端到端评估
- HELM:Holistic Evaluation
- OpenAI Evals:OpenAI 评估框架
评估指标示例:
准确性 = 正确回答数 / 总回答数
完整性 = 覆盖要点数 / 总要点数
忠实度 = 基于上下文的回答比例
相关性 = 相关回答数 / 总回答数
安全性 = 安全回答数 / 总回答数4. 实战场景
- 模型选型对比
- Prompt 优化验证
- RAG 系统调优
- 上线前质量检查
- 持续质量监控
- 竞品对比分析
5. 常见误区
- 只看单一指标:综合评估更重要
- 测试集不具代表性:无法反映真实场景
- 过度依赖自动评估:人工评估不可替代
- 不建立基线:没有对比无法判断改进
- 评估后不行动:评估结果应该指导优化
6. 进阶方向
- 自动化评估流水线
- 实时质量监控
- 领域特定评估
- 多模态评估
- 评估基准建设
- 评估即代码
7. 推荐资料
- RAGAS - https://docs.ragas.io/
- DeepEval - https://docs.confident-ai.com/
- LangSmith - https://docs.smith.langchain.com/
- OpenAI Evals - https://github.com/openai/evals
- HELM - https://crfm.stanford.edu/helm/