Agent评估
745 字约 2 分钟
domain/aiai/safety
2026-07-24
1. 核心结论
- Agent 评估比单一模型评估更复杂,需要评估规划、执行、工具使用等多维度
- Agent 评估关注任务完成率、步骤效率、工具使用正确率和安全性
- Agent 行为具有不确定性,需要多次运行评估稳定性
- 评估应该覆盖正常流程和异常处理
- Agent 评估框架仍在发展中,需要结合自定义评估方法
2. 基础概念
Task Completion Rate:任务完成率,成功完成任务的比例。
Step Efficiency:步骤效率,完成任务所需的步骤数。
Tool Use Accuracy:工具使用准确率,正确选择和使用的比例。
Planning Quality:规划质量,计划的合理性和可执行性。
Error Recovery:错误恢复,从失败中恢复的能力。
Safety:安全性,是否执行危险操作。
Cost:成本,完成任务的总花费。
3. 工作原理
Agent 评估维度:
- 任务完成:
- 是否达成目标
- 输出是否正确
- 是否满足约束
- 规划能力:
- 计划是否合理
- 步骤是否最优
- 是否考虑约束
- 执行能力:
- 工具选择是否正确
- 参数传递是否准确
- 结果处理是否恰当
- 鲁棒性:
- 错误处理能力
- 异常情况处理
- 多次运行一致性
- 安全性:
- 是否执行危险操作
- 是否遵循权限
- 是否泄露敏感信息
- 效率:
- 步骤数量
- 执行时间
- Token 消耗
- API 调用次数
评估方法:
- 基于规则的评估:
- 检查最终输出
- 验证中间步骤
- 统计指标计算
- LLM-as-a-Judge:
- 使用 LLM 评估 Agent 行为
- 多维度打分
- 定性分析
- 人工评估:
- 专家审查执行日志
- 评估决策合理性
- 发现潜在问题
评估流程:
定义测试任务
↓
运行 Agent(多次)
↓
收集执行日志
↓
评估各维度指标
↓
分析失败案例
↓
优化 Agent 设计
↓
回归测试4. 实战场景
- Agent 上线前验证
- 不同 Agent 架构对比
- 工具集优化
- 规划策略调优
- 安全边界测试
- 成本效益分析
5. 常见误区
- 只评估最终结果:忽视过程质量
- 不多次运行:无法评估稳定性
- 忽视安全测试:Agent 可能执行危险操作
- 不评估成本:多步执行成本可能很高
- 测试任务太简单:无法发现复杂问题
6. 进阶方向
- 自动化 Agent 测试
- 对抗性测试
- 多 Agent 协作评估
- 长期行为评估
- 自我改进评估
- 标准化 Agent 基准
7. 推荐资料
- LangSmith Agent Evaluation - https://docs.smith.langchain.com/
- AgentBench - https://github.com/THUDM/AgentBench
- WebArena - https://webarena.dev/
- SWE-bench - https://www.swebench.com/