AI-与-Agent
2068 字约 7 分钟
domain/aiai/agent
2026-07-24
Agent(智能体)是 AI 领域从"模型"走向"系统"的关键跃迁。LLM 是一个强大的"大脑",但 Agent 赋予了 AI 感知环境、制定计划、执行行动和从经验中学习的能力——它不再只是回答问题,而是自主完成任务。
一句话解释
Agent = LLM(大脑)+ 感知(输入)+ 规划(思考)+ 行动(工具调用)+ 记忆(经验积累)。LLM 是引擎,Agent 是整车。
核心问题
为什么需要 Agent?
- LLM 的局限:LLM 只能根据输入生成文本,无法主动获取信息、执行操作、或从错误中学习
- 复杂任务需要多步骤:现实世界的任务往往需要规划、执行、验证、调整的循环
- 与环境交互:很多任务需要与外部系统(API、数据库、文件系统)交互,而非纯文本生成
- 持续学习:Agent 可以从过去的成功和失败中积累经验,不断改进策略
Agent 的定义与核心能力
定义
AI Agent 是一个能够自主感知环境、做出决策、执行行动并从反馈中学习的智能系统。其核心是 LLM 作为推理引擎,但 Agent 远不止是 LLM。
四大核心能力
┌─────────────────────────────────────────┐
│ AI Agent │
│ │
│ ┌──────────┐ ┌──────────┐ │
│ │ 感知 │ │ 规划 │ │
│ │Perception│ │ Planning │ │
│ │ │ │ │ │
│ │ 接收输入 │ │ 制定计划 │ │
│ │ 理解环境 │ │ 分解任务 │ │
│ └────┬─────┘ └────┬─────┘ │
│ │ │ │
│ └───────┬───────┘ │
│ ▼ │
│ ┌──────────┐ │
│ │ LLM │ ← 推理引擎 │
│ │ (大脑) │ │
│ └────┬─────┘ │
│ │ │
│ ┌──────┴──────┐ │
│ ▼ ▼ │
│ ┌──────────┐ ┌──────────┐ │
│ │ 执行 │ │ 记忆 │ │
│ │ Execution│ │ Memory │ │
│ │ │ │ │ │
│ │ 调用工具 │ │ 存储经验 │ │
│ │ 操作环境 │ │ 学习改进 │ │
│ └──────────┘ └──────────┘ │
└─────────────────────────────────────────┘| 能力 | 说明 | 实现方式 |
|---|---|---|
| 感知(Perception) | 接收和理解来自用户、环境、工具的多模态输入 | 文本解析、结构化数据提取、多模态理解 |
| 规划(Planning) | 将复杂任务分解为可执行的子任务序列 | CoT、ToT、Plan-and-Solve、任务分解 |
| 执行(Execution) | 调用外部工具执行具体操作 | Tool Use工具调用设计、Function Calling、API 调用 |
| 记忆(Memory) | 存储和检索过去的经验和信息 | Memory记忆系统、短期/长期记忆、向量存储 |
Agent 与 LLM 的关系
LLM 是 Agent 的"大脑",但 Agent 是一个完整的系统:
| 维度 | LLM | Agent |
|---|---|---|
| 本质 | 文本生成模型 | 任务执行系统 |
| 输入 | 文本 Prompt | 多模态感知 |
| 输出 | 文本 | 行动(工具调用、API 请求等) |
| 状态 | 无状态(每次独立) | 有状态(记忆系统) |
| 环境交互 | 无 | 通过工具与环境交互 |
| 学习能力 | 参数中的知识 | 经验记忆 + 策略改进 |
| 错误处理 | 无法自我修正 | 通过 Reflection 自我修正 |
关键洞察:LLM 的能力上限决定了 Agent 的能力天花板,但 Agent 的工程设计(工具、记忆、规划策略)决定了能否达到这个天花板。
Agent 发展简史
阶段 1: 反应式 Agent(1980s-1990s)
├─ Brooks 的 Subsumption Architecture(1986)
├─ 直接感知→行动,无内部模型
└─ 适用于简单、确定性环境
阶段 2: 基于目标的 Agent(1990s-2000s)
├─ BDI(Belief-Desire-Intention)模型
├─ 有内部状态和目标,能做规划
└─ 适用于结构化环境(棋类游戏、机器人路径规划)
阶段 3: 基于效用的 Agent(2000s-2010s)
├─ 引入效用函数,能在多个目标间做权衡
├─ 强化学习驱动的决策
└─ 适用于复杂决策环境(推荐系统、自动驾驶)
阶段 4: LLM-based Agent(2023-至今)
├─ LLM 作为通用推理引擎
├─ ReAct、Reflexion、AutoGPT 等范式
├─ 工具使用 + 记忆系统 + 多 Agent 协作
└─ 适用于开放式、非结构化任务LLM-based Agent 的突破性在于:LLM 提供了通用的语言理解和推理能力,使得 Agent 不再需要为每个任务专门设计决策逻辑,而是通过自然语言"理解"任务并"推理"出行动方案。
Agent 的分类体系
按架构分类
| 类型 | 特征 | 优势 | 劣势 | 代表 |
|---|---|---|---|---|
| Reactive(反应式) | 感知→行动,无记忆 | 简单、快速 | 无法处理复杂任务 | 简单聊天机器人 |
| Deliberative(审慎式) | 内部建模 + 规划→行动 | 能处理复杂任务 | 规划成本高 | AutoGPT、BabyAGI |
| Hybrid(混合式) | 反应式 + 审慎式结合 | 灵活、平衡 | 设计复杂 | 大多数现代 Agent 框架 |
| Learning(学习型) | 从经验中学习和改进 | 持续优化 | 需要大量经验数据 | Reflexion、Voyager |
按自主性层级分类
| 层级 | 名称 | 描述 | 人类参与 |
|---|---|---|---|
| Level 0 | 无自动化 | 完全手动 | 100% |
| Level 1 | 辅助 | AI 提供建议,人类决策 | 90% |
| Level 2 | 部分自动化 | AI 执行部分任务,人类监督 | 60% |
| Level 3 | 条件自动化 | AI 自主执行,人类在需要时介入 | 30% |
| Level 4 | 高度自动化 | AI 自主完成大部分任务,人类仅审核 | 10% |
| Level 5 | 完全自动化 | AI 完全自主,无需人类参与 | 0% |
当前大多数 LLM Agent 处于 Level 2-3 之间。
Agent 与 Automation 的边界
| 维度 | Automation(自动化) | Agent(智能体) |
|---|---|---|
| 决策方式 | 预定义规则 | 动态推理 |
| 适应性 | 固定流程 | 根据环境调整 |
| 异常处理 | 预设异常路径 | 自主处理未知情况 |
| 任务范围 | 单一、重复性任务 | 开放式、多样化任务 |
| 示例 | RPA 流程、CI/CD Pipeline | 研究助手、代码开发助手 |
关键区分:Automation 是"按剧本演出",Agent 是"即兴表演"。
Agent 的核心挑战
1. 对齐(Alignment)
Agent 的行动必须符合人类意图和价值观。LLM 的对齐问题在 Agent 中被放大——Agent 不仅生成文本,还执行行动,错误行动的代价远高于错误文本。
2. 安全(Safety)
Agent 能调用工具、访问系统,意味着潜在的攻击面更大。需要严格的权限控制、操作审计和沙箱执行。详见 Agent权限与安全。
3. 可控性(Controllability)
Agent 的自主性越高,可控性越难保证。需要在"自主执行"和"人类监督"之间找到平衡。关键机制:
- 操作确认(高风险操作需人类确认)
- 执行日志(完整记录 Agent 的决策和行动链)
- 紧急停止(随时可以中断 Agent 执行)
4. 可靠性(Reliability)
LLM 的不确定性导致 Agent 行为不可完全预测。改进方向:
- 结构化输出(减少 LLM 输出的随机性)
- 确定性工作流(关键路径用代码而非 LLM 控制)
- 回退机制(LLM 失败时的降级策略)
Agent 五要素框架
本知识库的 Agent 模块围绕五个核心要素展开:
Agent 五要素
├── Reasoning(推理)→ [ReAct模式](/zh/notes/AI/05_Agents/ReAct模式)
├── Action(行动) → Tool Use工具调用设计
├── Reflection(反思)→ [Reflection反思机制](/zh/notes/AI/05_Agents/Reflection反思机制)
├── Tool(工具) → Tool Use工具调用设计
└── Memory(记忆) → [Memory记忆系统](/zh/notes/AI/05_Agents/Memory记忆系统)这五个要素构成了 Agent 的核心循环:推理→行动→观察→反思→记忆→再推理。
相关项目资源
- AI Agent 面试与工程知识体系 — Agent 工程化知识体系
- Universal AI Memory Layer Platform 方案 — 记忆层平台方案
- 统一 AI 工具链同步方案:QCoder - Cursor - Codex - Claude Code - Trae — 工具链集成
常见误区
- Agent = LLM:Agent 是系统,LLM 只是其中的推理引擎
- Agent 越自主越好:当前阶段,人类监督和介入仍然不可或缺
- 忽视安全:Agent 能调用工具意味着能执行操作,安全风险远大于纯文本 LLM
- 所有任务都用 Agent:简单的文本生成、翻译、总结不需要 Agent,用 LLM 直接完成即可
可继续补充的方向
- Agent 的设计模式(单 Agent vs 多 Agent)
- Agent 的评估框架和基准测试
- Agent 的工程化部署(可扩展性、容错性)
- Agent 的伦理和法律问题
关联笔记
- Agent基础 — Agent 基础概念
- Agent工作流 — Agent 的工作流程设计
- ReAct模式 — Agent 的核心推理范式
- Reflection反思机制 — Agent 的自我修正机制
- Tool Use工具调用设计 — Agent 的工具使用
- Memory记忆系统 — Agent 的记忆架构
- 多Agent协作 — 多 Agent 系统
- Agent评估 — Agent 效果评估