Skip to content

到底什么是 Agent?一篇讲清定义、组成、产品形态与开发方式

说实话,"Agent"可能是 2026 年 AI 圈被滥用最多的词。聊天机器人叫 Agent,工作流叫 Agent,全自动数字员工也叫 Agent。这篇文章尝试一次性把它讲清楚。

一、为什么这个词让人模糊

模糊的根源在于:Agent 不是 LLM 时代的新词,而是一个被重新启用的老概念

早在 1995 年,Wooldridge 和 Jennings 就在经典论文中定义过智能体;AI 教科书《人工智能:一种现代方法》(Russell & Norvig)更是开宗明义:

"Agent 是任何能通过传感器感知环境、并通过执行器对环境采取行动的实体。"

按这个定义,温控器是 Agent,自动驾驶汽车是 Agent,围棋 AI 也是 Agent。而当 LLM 爆发后,这个词被套在了新的事物上——不同人站在光谱的不同位置使用同一个词,混乱由此产生:

  • 有人说 Agent 是"能自主运行几小时的完全自治系统"
  • 有人说 Agent 是"遵循预定义流程的规范实现"
  • 卖课的把所有带工具调用的聊天机器人都叫 Agent

要理清它,最有用的切入点是狭义与广义之分

二、狭义与广义:一张光谱

广义 Agent(Agentic System,智能体系统)

Anthropic 在《Building Effective Agents》中提出了一个包容性框架:把所有这类系统统称为 Agentic System(智能体系统),然后在内部划出关键一刀:

Workflow(工作流)Agent(狭义)
定义LLM 和工具沿预定义代码路径编排LLM 动态指导自己的流程和工具使用
路径运行前已确定,人设计的运行时动态生成,模型决定的
分支判断规则、条件表达式模型对上下文的理解和推理
可控性高,完全可预测低,存在不确定性
适用标准化、合规性要求高的任务开放性、探索性任务

狭义 Agent(严格定义)

狭义的 Agent 只有一个核心判据:控制权在谁手里

  • 流程是人写死的 → 不管用了多少 LLM,都是 Workflow
  • 流程是模型自己决定的 → 这才是 Agent

OpenAI 在《A Practical Guide to Building Agents》中的定义与之呼应:

"Agent 是能够独立代表用户完成任务的系统。集成了 LLM 但不用它来控制工作流执行的系统——比如单轮问答机器人——不是 Agent。"

一句话记住

Workflow 是"人画地图,模型走路";Agent 是"人给目的地,模型自己找路"。

实用主义视角

纠结定义时,记住两点就够了:

  1. Agent 是一个光谱,不是一个开关——从纯 Workflow 到完全自治之间存在大量混合形态(比如"大部分流程写死,关键环节交给模型自主")
  2. 工程上"够用"比"纯正"重要——Anthropic 和 OpenAI 都强烈建议:能用 Workflow 解决就不要上 Agent,因为自主性是用成本、延迟和不可预测性换来的

三、Agent 包含什么:解剖一只 Agent

核心公式

Agent = 模型(大脑)
      + 工具(手脚)
      + 指令(行为规范)
      + 循环(工作方式)
      + 护栏(安全边界)

这正是 OpenAI 指南中归纳的设计三要素(Model / Tools / Instructions)加上运行时(Loop)与安全保障(Guardrails)。

各组件详解

① 模型(Model)—— 大脑

负责理解、推理、决策。工程建议:先用最强模型建立性能基线,再逐步替换小模型优化成本和延迟——先保证准,再优化便宜

② 工具(Tools)—— 手脚

分三类:

类型作用例子
Data获取上下文查数据库、读文档、搜索
Action对世界执行操作发邮件、改记录、执行代码
OrchestrationAgent 作为工具被调用退款 Agent、研究 Agent

工具设计的黄金标准:"设身处地为模型着想"——如果你自己看工具描述都分不清两个搜索接口的区别,模型也分不清。

③ 指令(Instructions)—— 行为规范

高质量指令 = 更少歧义 + 更少错误。把操作规程拆成明确步骤,覆盖边缘情况("用户信息不全怎么办")。

④ 循环(Loop)—— 工作方式

Agent 的运行骨架就是 Agent Loop:

感知环境 → 模型推理 → 选择并调用工具 → 观察结果 → 再推理 → …… → 完成任务

⑤ 护栏(Guardrails)—— 安全边界

权限检查、沙箱、人工接管机制。狭义 Agent 自主性越强,护栏越重要。

和上一篇的关系

如果你读过《Harness 是什么》,会发现:狭义 Agent 的"循环 + 工具 + 护栏"正是 Harness 提供的能力。模型是灵魂,Harness 是身体,两者合体才是 Agent——这正是 DeepSeek 的公式 Model + Harness = Agent

经典四要素视角

学界和工业界还常用另一种拆解(吴恩达等人的总结):

  • 规划(Planning):把复杂任务拆解成子任务
  • 记忆(Memory):短期上下文 + 长期经验
  • 工具使用(Tool Use):调用外部能力
  • 反思(Reflection):对输出自我评估、迭代优化

两种拆解本质相通:前者偏工程实现,后者偏能力维度。

四、Agent 与模型的区别

这是最容易混淆的一点,用一个例子说清——让 AI"写一份竞品分析报告":

大模型的做法

你提问 → 模型一次性生成全文 → 结束
(只有你和模型参与,模型不能查资料、不能验证、不能修改)

Agent 的做法

接收目标 → 拆解任务(列大纲)
        → 调用搜索工具查资料
        → 阅读资料、提取要点
        → 撰写初稿
        → 自我评估/用另一个模型评审
        → 发现问题,修改优化
        → 达标后输出,搞不定则求助人类

对比表:

维度大模型Agent
本质一个函数:输入文本 → 输出文本一个系统:接收目标 → 交付结果
交互单轮或多轮对话多步行动,可无人值守
能力边界训练数据 + 上下文窗口可借助工具触达真实世界
类比大脑 / 发动机 / 电池完整的人 / 汽车 / 电动车
失败模式答错、幻觉链路中任一环节出错则前功尽弃

大模型是"脑",Agent 是"人",AI 应用是"带界面的产品"。

也要看到 Agent 的代价:链路过长导致错误累积、多次调用模型推高成本和延迟、换模型往往需要重写提示词。这也是为什么"能不用 Agent 就不用"是两大厂共同的忠告。

五、产品形态:Agent 都长什么样

2026 年的 Agent 产品已经形成清晰的格局:

① 编程 Agent(黄金赛道)

目前最成熟、商业化最成功的形态。AI 编程 Agent 市占率已达 54%,仅 Claude Code 年化收入就接近 63 亿美元。

  • Claude Code(Anthropic):终端里的 Agent,支持 Skills、MCP、Hooks
  • Codex(OpenAI):云端沙箱 + 本地 CLI
  • Cursor:AI 原生 IDE
  • 开发者的工作正从"写代码"转向"审查代码"

② 通用 Agent

目标是"给我一个目标,我还你一个结果":

  • Manus:2025 年引爆通用 Agent 赛道的产品
  • OpenClaw 等开源方案:本地运行、可自托管
  • 形态特征:虚拟机/浏览器/文件系统全套工具 + 长任务执行

③ 桌面/办公 Agent

  • Claude Cowork:桌面端多 Agent 协作
  • Agent Skills:Anthropic 2025 年 10 月推出的开放标准——用自然语言文档+文件夹结构赋予 Agent 专业能力,零代码,已被 VS Code、GitHub、Cursor 采纳

④ 垂直场景 Agent

客服、数据分析、运维、内容生产……通常以"Workflow 为主 + 关键环节 Agent 化"的混合形态落地。麦肯锡 2026 年调查:23% 的组织已在核心业务规模化部署 Agentic 系统,另有 39% 在试点。

⑤ 底层基础设施

  • 协议层:MCP(工具接入)、A2A(Agent 间通信)、AG-UI(前端交互)——Agent 生态从孤岛走向互联
  • Harness 层:DeepSeek Harness 等开源运行时(详见上一篇文章)

六、开发方式:怎么造一个 Agent

按抽象层次从低到高,有四条路:

路径一:手写代码(最灵活)

Agent 的内核简单到惊人——一个 while 循环:

python
while not done:
    response = llm.chat(messages, tools=tools)
    if response.has_tool_calls:
        results = execute_tools(response.tool_calls)
        messages.append(results)
    else:
        done = True

生产级的复杂性全在循环之外:状态持久化、错误恢复、权限、观测——也就是 Harness 要解决的那些事。

路径二:Agent 框架

  • LangGraph:图结构状态机,持久化和人工介入能力强
  • OpenAI Agents SDK:轻量循环 + 多 Agent 交接(handoff)
  • CrewAI / AutoGen:多智能体编排

路径三:低代码平台

Dify、Coze 等可视化编排,适合 Workflow 为主的业务系统。

路径四:Skills(零代码)

用自然语言文档定义专业能力,"一个 Skill 包解锁一个垂直场景"。门槛最低,2026 年增长最快的生态。

工程方法论(两大厂的共识)

  1. 从最简单的方案开始:优化单次 LLM 调用(加检索、加示例)能解决,就不要上 Agent
  2. 先 Workflow 后 Agent:五种 Workflow 模式(提示链、路由、并行化、编排-执行、评估-优化)覆盖了大部分需求
  3. 先单 Agent 后多 Agent:单 Agent 能力榨干之前,不要引入多 Agent 的复杂性
  4. 什么时候该用 Agent:决策复杂需要判断力、规则体系臃肿难维护、大量非结构化数据——三者居其一

七、总结:一张图收尾

                    自主性低 ◄──────────────────► 自主性高

  纯 LLM 调用      Workflow        混合形态         狭义 Agent
  (问答机器人)   (人画地图)    (关键环节自主)   (模型找路)

       │                │               │               │
    不是 Agent      广义 Agentic     广义 Agentic    广义+狭义
                    System           System         都是 Agent

判断一个系统是不是(狭义)Agent,只需问一个问题:

"下一步做什么"这个决定,是人写死的,还是模型自己做的?

而判断该不该用 Agent,也只需问一个问题:

"这个任务的路径能提前枚举出来吗?"——能,用 Workflow;不能,才轮到 Agent。

概念会过时,但这两个问题不会。

参考资料