到底什么是 Agent?一篇讲清定义、组成、产品形态与开发方式
说实话,"Agent"可能是 2026 年 AI 圈被滥用最多的词。聊天机器人叫 Agent,工作流叫 Agent,全自动数字员工也叫 Agent。这篇文章尝试一次性把它讲清楚。
一、为什么这个词让人模糊
模糊的根源在于:Agent 不是 LLM 时代的新词,而是一个被重新启用的老概念。
早在 1995 年,Wooldridge 和 Jennings 就在经典论文中定义过智能体;AI 教科书《人工智能:一种现代方法》(Russell & Norvig)更是开宗明义:
"Agent 是任何能通过传感器感知环境、并通过执行器对环境采取行动的实体。"
按这个定义,温控器是 Agent,自动驾驶汽车是 Agent,围棋 AI 也是 Agent。而当 LLM 爆发后,这个词被套在了新的事物上——不同人站在光谱的不同位置使用同一个词,混乱由此产生:
- 有人说 Agent 是"能自主运行几小时的完全自治系统"
- 有人说 Agent 是"遵循预定义流程的规范实现"
- 卖课的把所有带工具调用的聊天机器人都叫 Agent
要理清它,最有用的切入点是狭义与广义之分。
二、狭义与广义:一张光谱
广义 Agent(Agentic System,智能体系统)
Anthropic 在《Building Effective Agents》中提出了一个包容性框架:把所有这类系统统称为 Agentic System(智能体系统),然后在内部划出关键一刀:
| Workflow(工作流) | Agent(狭义) | |
|---|---|---|
| 定义 | LLM 和工具沿预定义代码路径编排 | LLM 动态指导自己的流程和工具使用 |
| 路径 | 运行前已确定,人设计的 | 运行时动态生成,模型决定的 |
| 分支判断 | 规则、条件表达式 | 模型对上下文的理解和推理 |
| 可控性 | 高,完全可预测 | 低,存在不确定性 |
| 适用 | 标准化、合规性要求高的任务 | 开放性、探索性任务 |
狭义 Agent(严格定义)
狭义的 Agent 只有一个核心判据:控制权在谁手里。
- 流程是人写死的 → 不管用了多少 LLM,都是 Workflow
- 流程是模型自己决定的 → 这才是 Agent
OpenAI 在《A Practical Guide to Building Agents》中的定义与之呼应:
"Agent 是能够独立代表用户完成任务的系统。集成了 LLM 但不用它来控制工作流执行的系统——比如单轮问答机器人——不是 Agent。"
一句话记住
Workflow 是"人画地图,模型走路";Agent 是"人给目的地,模型自己找路"。
实用主义视角
纠结定义时,记住两点就够了:
- Agent 是一个光谱,不是一个开关——从纯 Workflow 到完全自治之间存在大量混合形态(比如"大部分流程写死,关键环节交给模型自主")
- 工程上"够用"比"纯正"重要——Anthropic 和 OpenAI 都强烈建议:能用 Workflow 解决就不要上 Agent,因为自主性是用成本、延迟和不可预测性换来的
三、Agent 包含什么:解剖一只 Agent
核心公式
Agent = 模型(大脑)
+ 工具(手脚)
+ 指令(行为规范)
+ 循环(工作方式)
+ 护栏(安全边界)这正是 OpenAI 指南中归纳的设计三要素(Model / Tools / Instructions)加上运行时(Loop)与安全保障(Guardrails)。
各组件详解
① 模型(Model)—— 大脑
负责理解、推理、决策。工程建议:先用最强模型建立性能基线,再逐步替换小模型优化成本和延迟——先保证准,再优化便宜。
② 工具(Tools)—— 手脚
分三类:
| 类型 | 作用 | 例子 |
|---|---|---|
| Data | 获取上下文 | 查数据库、读文档、搜索 |
| Action | 对世界执行操作 | 发邮件、改记录、执行代码 |
| Orchestration | Agent 作为工具被调用 | 退款 Agent、研究 Agent |
工具设计的黄金标准:"设身处地为模型着想"——如果你自己看工具描述都分不清两个搜索接口的区别,模型也分不清。
③ 指令(Instructions)—— 行为规范
高质量指令 = 更少歧义 + 更少错误。把操作规程拆成明确步骤,覆盖边缘情况("用户信息不全怎么办")。
④ 循环(Loop)—— 工作方式
Agent 的运行骨架就是 Agent Loop:
感知环境 → 模型推理 → 选择并调用工具 → 观察结果 → 再推理 → …… → 完成任务⑤ 护栏(Guardrails)—— 安全边界
权限检查、沙箱、人工接管机制。狭义 Agent 自主性越强,护栏越重要。
和上一篇的关系
如果你读过《Harness 是什么》,会发现:狭义 Agent 的"循环 + 工具 + 护栏"正是 Harness 提供的能力。模型是灵魂,Harness 是身体,两者合体才是 Agent——这正是 DeepSeek 的公式 Model + Harness = Agent。
经典四要素视角
学界和工业界还常用另一种拆解(吴恩达等人的总结):
- 规划(Planning):把复杂任务拆解成子任务
- 记忆(Memory):短期上下文 + 长期经验
- 工具使用(Tool Use):调用外部能力
- 反思(Reflection):对输出自我评估、迭代优化
两种拆解本质相通:前者偏工程实现,后者偏能力维度。
四、Agent 与模型的区别
这是最容易混淆的一点,用一个例子说清——让 AI"写一份竞品分析报告":
大模型的做法:
你提问 → 模型一次性生成全文 → 结束
(只有你和模型参与,模型不能查资料、不能验证、不能修改)Agent 的做法:
接收目标 → 拆解任务(列大纲)
→ 调用搜索工具查资料
→ 阅读资料、提取要点
→ 撰写初稿
→ 自我评估/用另一个模型评审
→ 发现问题,修改优化
→ 达标后输出,搞不定则求助人类对比表:
| 维度 | 大模型 | Agent |
|---|---|---|
| 本质 | 一个函数:输入文本 → 输出文本 | 一个系统:接收目标 → 交付结果 |
| 交互 | 单轮或多轮对话 | 多步行动,可无人值守 |
| 能力边界 | 训练数据 + 上下文窗口 | 可借助工具触达真实世界 |
| 类比 | 大脑 / 发动机 / 电池 | 完整的人 / 汽车 / 电动车 |
| 失败模式 | 答错、幻觉 | 链路中任一环节出错则前功尽弃 |
大模型是"脑",Agent 是"人",AI 应用是"带界面的产品"。
也要看到 Agent 的代价:链路过长导致错误累积、多次调用模型推高成本和延迟、换模型往往需要重写提示词。这也是为什么"能不用 Agent 就不用"是两大厂共同的忠告。
五、产品形态:Agent 都长什么样
2026 年的 Agent 产品已经形成清晰的格局:
① 编程 Agent(黄金赛道)
目前最成熟、商业化最成功的形态。AI 编程 Agent 市占率已达 54%,仅 Claude Code 年化收入就接近 63 亿美元。
- Claude Code(Anthropic):终端里的 Agent,支持 Skills、MCP、Hooks
- Codex(OpenAI):云端沙箱 + 本地 CLI
- Cursor:AI 原生 IDE
- 开发者的工作正从"写代码"转向"审查代码"
② 通用 Agent
目标是"给我一个目标,我还你一个结果":
- Manus:2025 年引爆通用 Agent 赛道的产品
- OpenClaw 等开源方案:本地运行、可自托管
- 形态特征:虚拟机/浏览器/文件系统全套工具 + 长任务执行
③ 桌面/办公 Agent
- Claude Cowork:桌面端多 Agent 协作
- Agent Skills:Anthropic 2025 年 10 月推出的开放标准——用自然语言文档+文件夹结构赋予 Agent 专业能力,零代码,已被 VS Code、GitHub、Cursor 采纳
④ 垂直场景 Agent
客服、数据分析、运维、内容生产……通常以"Workflow 为主 + 关键环节 Agent 化"的混合形态落地。麦肯锡 2026 年调查:23% 的组织已在核心业务规模化部署 Agentic 系统,另有 39% 在试点。
⑤ 底层基础设施
- 协议层:MCP(工具接入)、A2A(Agent 间通信)、AG-UI(前端交互)——Agent 生态从孤岛走向互联
- Harness 层:DeepSeek Harness 等开源运行时(详见上一篇文章)
六、开发方式:怎么造一个 Agent
按抽象层次从低到高,有四条路:
路径一:手写代码(最灵活)
Agent 的内核简单到惊人——一个 while 循环:
while not done:
response = llm.chat(messages, tools=tools)
if response.has_tool_calls:
results = execute_tools(response.tool_calls)
messages.append(results)
else:
done = True生产级的复杂性全在循环之外:状态持久化、错误恢复、权限、观测——也就是 Harness 要解决的那些事。
路径二:Agent 框架
- LangGraph:图结构状态机,持久化和人工介入能力强
- OpenAI Agents SDK:轻量循环 + 多 Agent 交接(handoff)
- CrewAI / AutoGen:多智能体编排
路径三:低代码平台
Dify、Coze 等可视化编排,适合 Workflow 为主的业务系统。
路径四:Skills(零代码)
用自然语言文档定义专业能力,"一个 Skill 包解锁一个垂直场景"。门槛最低,2026 年增长最快的生态。
工程方法论(两大厂的共识)
- 从最简单的方案开始:优化单次 LLM 调用(加检索、加示例)能解决,就不要上 Agent
- 先 Workflow 后 Agent:五种 Workflow 模式(提示链、路由、并行化、编排-执行、评估-优化)覆盖了大部分需求
- 先单 Agent 后多 Agent:单 Agent 能力榨干之前,不要引入多 Agent 的复杂性
- 什么时候该用 Agent:决策复杂需要判断力、规则体系臃肿难维护、大量非结构化数据——三者居其一
七、总结:一张图收尾
自主性低 ◄──────────────────► 自主性高
纯 LLM 调用 Workflow 混合形态 狭义 Agent
(问答机器人) (人画地图) (关键环节自主) (模型找路)
│ │ │ │
不是 Agent 广义 Agentic 广义 Agentic 广义+狭义
System System 都是 Agent判断一个系统是不是(狭义)Agent,只需问一个问题:
"下一步做什么"这个决定,是人写死的,还是模型自己做的?
而判断该不该用 Agent,也只需问一个问题:
"这个任务的路径能提前枚举出来吗?"——能,用 Workflow;不能,才轮到 Agent。
概念会过时,但这两个问题不会。
参考资料
- Anthropic: Building Effective Agents
- OpenAI: A Practical Guide to Building Agents
- 吴恩达:Agentic Reasoning 四种模式
- Wooldridge & Jennings, Intelligent Agents: Theory and Practice, 1995
- Harness 是什么?从概念演进到 DeepSeek Harness 深度解析(本博客上一篇)