《深入理解 AI Agent:设计原理与工程实践》
《深入理解 AI Agent:设计原理与工程实践》 第一章 AI Agent 入门总结 一、AI Agent 的兴起:从对话工具到自主智能系统 随着大语言模型(Large Language Model,LLM)的快速发展,人工智能正在从传统问答模式逐渐走向自主执行任务的新阶段。 过去的 AI 更多是
《深入理解 AI Agent:设计原理与工程实践》
第一章 AI Agent 入门总结
一、AI Agent 的兴起:从对话工具到自主智能系统
随着大语言模型(Large Language Model,LLM)的快速发展,人工智能正在从传统问答模式逐渐走向自主执行任务的新阶段。
过去的 AI 更多是:
用户输入问题 → 模型生成回答
而现代 AI Agent 已经能够:
- 理解用户目标;
- 自主规划任务步骤;
- 调用外部工具;
- 根据执行结果调整策略;
- 完成复杂的长流程任务。
AI Agent 的本质并不是简单聊天机器人,而是一种能够感知环境、进行决策并采取行动的智能系统。
二、现代 Agent 的核心公式
理解 AI Agent 最重要的公式:
[
Agent = LLM + Context + Tool
]
也可以理解为:
Agent = 大脑 + 眼睛 + 手脚
| 组成部分 | 作用 | 类比 |
|---|---|---|
| LLM | 理解、思考、规划、决策 | 大脑 |
| Context | 提供环境信息、历史状态、知识 | 眼睛 |
| Tool | 执行动作、改变外部环境 | 手脚 |
三者共同构成现代 Agent 的基础。
三、LLM:Agent 的大脑
LLM 是 Agent 的决策核心,负责:
- 理解用户意图;
- 分析任务目标;
- 拆解复杂任务;
- 制定执行计划;
- 判断下一步行动。
LLM 通过预训练获得世界知识和语言能力,通过后训练获得更加稳定的决策能力。
四、上下文:Agent 的眼睛
上下文决定 Agent 能够看到什么信息。
上下文主要包括:
1. 系统提示词
定义 Agent 的身份、规则和行为方式。
2. 工具定义
告诉模型有哪些工具可以使用,以及工具参数。
3. 用户消息
当前任务输入。
4. 模型历史回复
包括之前的思考、回复和工具调用。
5. 工具执行结果
提供行动后的反馈。
上下文缺失会导致:
- 无法调用工具;
- 重复执行任务;
- 决策混乱;
- 无法根据反馈调整。
五、工具:Agent 的手脚
工具使 Agent 从“知识回答者”变成“任务执行者”。
主要包括五类:
1. 感知工具
用于获取信息:
- 搜索引擎;
- 文件读取;
- 数据库查询;
- API。
2. 执行工具
用于改变现实:
- 执行代码;
- 修改文件;
- 调用外部服务。
3. 协作工具
用于:
- 调用其他 Agent;
- 请求人工确认;
- 多 Agent 协作。
4. 事件触发工具
例如:
- 邮件通知;
- 定时任务;
- Webhook。
5. 用户沟通工具
例如:
- 消息;
- 邮件;
- 电话。
六、ReAct:Agent 的核心运行循环
ReAct(Reasoning + Acting)描述了 Agent 的基本工作方式:
思考 → 行动 → 观察 → 思考 → 行动
执行过程:
- LLM 分析当前任务;
- 决定下一步动作;
- 调用工具;
- 获取工具反馈;
- 根据结果继续调整。
这种循环使 Agent 能够完成复杂多步骤任务。
七、Agent 的三种学习方式
1. 上下文适应
发生在当前任务中。
特点:
- 快速;
- 成本低;
- 不永久保存。
2. 外部产物更新
将经验保存为:
- 知识库;
- Prompt;
- Skill;
- 程序;
- Harness。
特点:
- 可长期保存;
- 可人工修改;
- 可审计。
3. 模型参数更新
通过:
- SFT;
- 强化学习。
改变模型自身能力。
三者关系:
上下文:
临时适应
外部产物:
经验积累
模型参数:
能力内化
八、Harness 工程:模型之外的竞争力
简单 Agent:
[
Agent = LLM + 上下文 + 工具
]
生产级 Agent:
[
Agent = LLM + [上下文 + 工具 + 约束 + 验证 + 纠正]
]
其中:
1. 约束
限制 Agent 能做什么。
例如:
- 权限控制;
- 操作范围限制。
2. 验证
检查 Agent 是否正确。
例如:
- 结果检查;
- 自动测试。
3. 纠正
错误恢复。
例如:
- API 重试;
- 调整执行策略。
Harness 让 Agent 从“能够运行”变成“可靠运行”。
九、从工作流到自主 Agent
Agent 开发不应该一开始追求完全自主。
推荐路线:
提示词优化
↓
工作流设计
↓
自主 Agent
原因:
- 工作流更加稳定;
- 风险更低;
- 更容易控制。
十、安全问题是架构问题
AI Agent 安全需要从系统设计阶段考虑。
主要包括:
- 模型层:防止目标偏移;
- 上下文层:防止提示注入和信息泄露;
- 工具层:防止越权操作;
- 协作层:防止权限冲突。
安全不是上线后的补丁,而是架构的一部分。
十一、第一章核心总结
1. Agent 的本质
AI Agent 是:
能够感知环境、进行决策、调用工具并持续调整策略的智能系统。
2. Agent 核心结构
[
Agent = LLM + Context + Tool
]
对应:
| 模块 | 作用 |
|---|---|
| LLM | 思考 |
| Context | 感知 |
| Tool | 行动 |
3. Agent 工作方式
通过 ReAct 循环:
思考
↓
行动
↓
观察
↓
继续思考
完成复杂任务。
4. Agent 的核心竞争力
未来竞争不只是模型能力,而是:
- 上下文工程;
- 工具设计;
- Harness;
- 评估体系;
- 安全机制。
总结
大语言模型只是 Agent 的“大脑”,真正让 AI 具备智能行为的是上下文提供感知能力、工具提供行动能力,而 Harness 工程保证 Agent 能够安全、可靠、持续地完成复杂任务。
CONVERSATION
留下一点回声