《深入理解 AI Agent:设计原理与工程实践》

《深入理解 AI Agent:设计原理与工程实践》 第一章 AI Agent 入门总结 一、AI Agent 的兴起:从对话工具到自主智能系统 随着大语言模型(Large Language Model,LLM)的快速发展,人工智能正在从传统问答模式逐渐走向自主执行任务的新阶段。 过去的 AI 更多是

《深入理解 AI Agent:设计原理与工程实践》

第一章 AI Agent 入门总结

一、AI Agent 的兴起:从对话工具到自主智能系统

随着大语言模型(Large Language Model,LLM)的快速发展,人工智能正在从传统问答模式逐渐走向自主执行任务的新阶段。

过去的 AI 更多是:

用户输入问题 → 模型生成回答

而现代 AI Agent 已经能够:

  • 理解用户目标;
  • 自主规划任务步骤;
  • 调用外部工具;
  • 根据执行结果调整策略;
  • 完成复杂的长流程任务。

AI Agent 的本质并不是简单聊天机器人,而是一种能够感知环境、进行决策并采取行动的智能系统。


二、现代 Agent 的核心公式

理解 AI Agent 最重要的公式:

[
Agent = LLM + Context + Tool
]

也可以理解为:

Agent = 大脑 + 眼睛 + 手脚

组成部分作用类比
LLM理解、思考、规划、决策大脑
Context提供环境信息、历史状态、知识眼睛
Tool执行动作、改变外部环境手脚

三者共同构成现代 Agent 的基础。


三、LLM:Agent 的大脑

LLM 是 Agent 的决策核心,负责:

  • 理解用户意图;
  • 分析任务目标;
  • 拆解复杂任务;
  • 制定执行计划;
  • 判断下一步行动。

LLM 通过预训练获得世界知识和语言能力,通过后训练获得更加稳定的决策能力。


四、上下文:Agent 的眼睛

上下文决定 Agent 能够看到什么信息。

上下文主要包括:

1. 系统提示词

定义 Agent 的身份、规则和行为方式。

2. 工具定义

告诉模型有哪些工具可以使用,以及工具参数。

3. 用户消息

当前任务输入。

4. 模型历史回复

包括之前的思考、回复和工具调用。

5. 工具执行结果

提供行动后的反馈。

上下文缺失会导致:

  • 无法调用工具;
  • 重复执行任务;
  • 决策混乱;
  • 无法根据反馈调整。

五、工具:Agent 的手脚

工具使 Agent 从“知识回答者”变成“任务执行者”。

主要包括五类:

1. 感知工具

用于获取信息:

  • 搜索引擎;
  • 文件读取;
  • 数据库查询;
  • API。

2. 执行工具

用于改变现实:

  • 执行代码;
  • 修改文件;
  • 调用外部服务。

3. 协作工具

用于:

  • 调用其他 Agent;
  • 请求人工确认;
  • 多 Agent 协作。

4. 事件触发工具

例如:

  • 邮件通知;
  • 定时任务;
  • Webhook。

5. 用户沟通工具

例如:

  • 消息;
  • 邮件;
  • 电话。

六、ReAct:Agent 的核心运行循环

ReAct(Reasoning + Acting)描述了 Agent 的基本工作方式:

思考 → 行动 → 观察 → 思考 → 行动

执行过程:

  1. LLM 分析当前任务;
  2. 决定下一步动作;
  3. 调用工具;
  4. 获取工具反馈;
  5. 根据结果继续调整。

这种循环使 Agent 能够完成复杂多步骤任务。


七、Agent 的三种学习方式

1. 上下文适应

发生在当前任务中。

特点:

  • 快速;
  • 成本低;
  • 不永久保存。

2. 外部产物更新

将经验保存为:

  • 知识库;
  • Prompt;
  • Skill;
  • 程序;
  • Harness。

特点:

  • 可长期保存;
  • 可人工修改;
  • 可审计。

3. 模型参数更新

通过:

  • SFT;
  • 强化学习。

改变模型自身能力。

三者关系:

上下文:
临时适应

外部产物:
经验积累

模型参数:
能力内化

八、Harness 工程:模型之外的竞争力

简单 Agent:

[
Agent = LLM + 上下文 + 工具
]

生产级 Agent:

[
Agent = LLM + [上下文 + 工具 + 约束 + 验证 + 纠正]
]

其中:

1. 约束

限制 Agent 能做什么。

例如:

  • 权限控制;
  • 操作范围限制。

2. 验证

检查 Agent 是否正确。

例如:

  • 结果检查;
  • 自动测试。

3. 纠正

错误恢复。

例如:

  • API 重试;
  • 调整执行策略。

Harness 让 Agent 从“能够运行”变成“可靠运行”。


九、从工作流到自主 Agent

Agent 开发不应该一开始追求完全自主。

推荐路线:

提示词优化
↓
工作流设计
↓
自主 Agent

原因:

  • 工作流更加稳定;
  • 风险更低;
  • 更容易控制。

十、安全问题是架构问题

AI Agent 安全需要从系统设计阶段考虑。

主要包括:

  • 模型层:防止目标偏移;
  • 上下文层:防止提示注入和信息泄露;
  • 工具层:防止越权操作;
  • 协作层:防止权限冲突。

安全不是上线后的补丁,而是架构的一部分。


十一、第一章核心总结

1. Agent 的本质

AI Agent 是:

能够感知环境、进行决策、调用工具并持续调整策略的智能系统。


2. Agent 核心结构

[
Agent = LLM + Context + Tool
]

对应:

模块作用
LLM思考
Context感知
Tool行动

3. Agent 工作方式

通过 ReAct 循环:

思考
↓
行动
↓
观察
↓
继续思考

完成复杂任务。


4. Agent 的核心竞争力

未来竞争不只是模型能力,而是:

  • 上下文工程;
  • 工具设计;
  • Harness;
  • 评估体系;
  • 安全机制。

总结

大语言模型只是 Agent 的“大脑”,真正让 AI 具备智能行为的是上下文提供感知能力、工具提供行动能力,而 Harness 工程保证 Agent 能够安全、可靠、持续地完成复杂任务。

CONVERSATION

留下一点回声