Agent基础
702 字约 2 分钟
domain/aiai/agents
2026-07-24
1. 核心结论
- AI Agent 是能够感知环境、做出决策并执行动作的智能系统
- Agent 的核心组件:感知(Perception)、规划(Planning)、行动(Action)、记忆(Memory)
- LLM 作为 Agent 的大脑,提供推理、规划和决策能力
- Agent 通过工具调用与外部世界交互,扩展自身能力边界
- Agent 设计需要明确目标、约束和反馈机制
2. 基础概念
Agent:能够自主感知环境、做出决策并执行动作的智能体。
LLM as Brain:使用大语言模型作为 Agent 的核心推理引擎。
Perception:感知环境,理解用户输入和上下文信息。
Planning:制定行动计划,分解任务,选择策略。
Action:执行具体动作,如调用工具、搜索信息、生成内容。
Memory:存储和检索历史信息,支持长期决策。
Tool:Agent 可调用的外部功能或 API。
Environment:Agent 运行和交互的环境。
3. 工作原理
Agent 核心架构:
用户输入
↓
[感知模块]
- 理解意图
- 提取关键信息
- 上下文管理
↓
[规划模块]
- 任务分解
- 策略选择
- 步骤规划
↓
[执行模块]
- 工具调用
- 结果处理
- 状态更新
↓
[记忆模块]
- 短期记忆(对话历史)
- 长期记忆(知识库)
- 经验记忆(成功/失败模式)
↓
输出结果Agent 模式:
- ReAct:Reasoning + Acting,交替推理和行动
- Plan-and-Execute:先规划完整计划,再逐步执行
- Reflexion:自我反思,从失败中学习
- Toolformer:学习何时和如何使用工具
主流 Agent 框架:
- LangGraph(LangChain)
- AutoGen(Microsoft)
- CrewAI
- OpenAI Agents SDK
- Anthropic Tool Use
4. 实战场景
- 自动化工作流:数据收集、处理、报告生成
- 智能客服:多轮对话、问题诊断、工单处理
- 代码助手:需求分析、代码生成、测试、部署
- 研究助手:文献检索、摘要、综述生成
- 数据分析:数据查询、可视化、洞察生成
- 个人助理:日程管理、邮件处理、信息整理
5. 常见误区
- 过度设计:简单任务不需要复杂 Agent
- 忽视错误处理:工具调用失败没有 fallback
- 不限制循环:Agent 可能陷入无限循环
- 忽视成本:多步推理和工具调用成本累积
- 缺乏评估:没有明确的 Agent 效果评估标准
6. 进阶方向
- 多 Agent 协作
- 自我改进 Agent
- 长期记忆优化
- Agent 安全与对齐
- 实时 Agent
- 具身智能(Embodied AI)
7. 推荐资料
- LangGraph Docs - https://langchain-ai.github.io/langgraph/
- AutoGen Docs - https://microsoft.github.io/autogen/
- CrewAI Docs - https://docs.crewai.com/
- ReAct Paper - https://arxiv.org/abs/2210.03629
- OpenAI Agents SDK - https://platform.openai.com/docs/guides/agents
8. 关联笔记
- Agent工作流
- Function Calling与Tool Use
- 记忆系统
- Planner与Executor