Harness 是什么?从概念演进到 DeepSeek Harness 深度解析
2026 年 AI 圈最热的工程概念不是某个新模型,而是 Harness——让大模型真正成为 Agent 的那套"驾驭系统"。这篇文章从词源、历史、技术栈一路讲到 DeepSeek 最新开源的 DeepSeek Harness。
一、Harness 的定义
Harness 原意是"马具"——马鞍、缰绳、马镫的统称。马本身有强大的力量,但没有马具,骑手无法驾驭它。
这个隐喻被精准地移植到了 AI 领域:
- LLM 是马:强大、有潜力,但随机、有幻觉、无记忆,裸跑时像一匹脱缰野马
- Harness 是马具:约束、引导、纠错,把不可控的智能输出转化为稳定的生产力
- 骑手是你:定义目标和方向
DeepSeek 在招聘 Agent Harness 团队时给出了一个广为流传的公式:
Model + Harness = Agent用一句话定义:Harness 是除模型本身以外,让 Agent 可靠工作的一切基础设施的总和——编排循环、工具运行时、上下文管理、状态持久化、权限沙箱、可观测性,全都在它的范畴内。
和 System Prompt 的本质区别
System Prompt 是"请求",模型可以选择不遵守;Harness 是代码级别的强制力——从"请你这样做"变成"你只能这样做"。这是从 Demo 到生产的关键一步。
二、词源与历史演进
词源:从测试领域借来的词
"Harness"在软件工程里早有先例——Test Harness(测试框架/测试夹具),指包裹被测代码、提供输入并收集输出的那套基础设施。EleutherAI 著名的 lm-evaluation-harness 就是评测领域的代表。2026 年初,这个词被正式引入 Agent 领域,语义从"评测的框架"扩展为"运行的框架"。
演进:四个阶段
| 阶段 | 核心问题 | 代表 |
|---|---|---|
| ① Prompt 工程 | "怎么跟模型说话" | Few-shot、CoT |
| ② 工具调用 | "模型如何动手" | Function Calling、ReAct |
| ③ Agent 框架 | "如何组织多步任务" | LangChain、AutoGPT |
| ④ Harness 工程 | "如何可靠、可控、可恢复" | Claude Code、Codex、DSH |
早期的 Agent 其实就是一个 while 循环:调模型 → 返回工具调用 → 执行 → 把结果塞回去 → 再调模型。Demo 能跑,但一上生产就崩:模型忘了三步前干过什么、工具调用静默失败、上下文窗口塞满垃圾、同一个错误反复重试。
人们逐渐意识到:问题不在模型,而在模型周围的一切。 一个著名的佐证是 LangChain 的实验——不动模型、不改权重,只优化外围基础设施,就在 TerminalBench 2.0 上从 30 名开外冲到第 5。
2026 年,随着 Claude Code、Codex 等产品的爆发,Anthropic 在官方文档中直言其 SDK 就是"驱动 Claude Code 的 agent harness",OpenAI Codex 团队也明确区分 "agent" 与 "harness" 两个概念。Harness Engineering 正式成为一门显学。
三、Harness 的技术组成
一个生产级 Harness 可以拆解为以下模块:
Harness = Model Adapter # 模型适配层(可切换不同模型)
+ Agent Loop # 编排循环(推理-行动-观察)
+ Tool Runtime # 工具运行时(注册、校验、执行)
+ Context/Memory # 上下文工程(压缩、注入、检索)
+ State/Checkpoint # 状态持久化(可暂停、可恢复)
+ Policy/Sandbox # 权限与沙箱(代码级强制约束)
+ Event/Trace # 事件与追踪(可观测、可回放)
+ Scheduler # 调度(子 Agent、并发、长任务)其中最容易被低估的三件事:
- 上下文工程:不是把对话历史一股脑塞给模型,而是精心管理"模型此刻应该看到什么"
- 状态持久化:长期任务需要持久化的不是聊天历史,而是工作状态
- 权限边界:工具调用的每一次执行都必须经过权限检查,不能被批量调用绕过
四、现有技术栈格局
当前 Harness 领域大致分为三个层次:
① 产品级 Harness(开箱即用)
- Claude Code / Claude Agent SDK(Anthropic):"harness"一词的布道者,SDK 即官方 harness
- OpenAI Codex:云端沙箱 + 本地 CLI 的 Agent 产品
- Claude Cowork:桌面端多 Agent 协作形态
② 框架级 Harness(自己搭建)
- LangGraph:图结构的状态机编排,持久化与人工介入能力强
- OpenAI Agents SDK:轻量级的 Agent 循环 + 交接(handoff)
- CrewAI / AutoGen / Mastra / Semantic Kernel:多智能体编排方向
③ 评测级 Harness(词源本家)
- lm-evaluation-harness(EleutherAI):LLM 静态评测的事实标准
- SWE-bench / Terminal-Bench:Agent 动态能力的基准测试
一个共识
模型决定 Agent"能做什么",Harness 决定 Agent"如何把事情做完"。2026 年的竞争焦点,已经从模型参数转向了工程化体系。
五、DeepSeek Harness 深度解析
5.1 发布背景
DeepSeek 的布局有清晰的时间线:
- 2026 年 5 月:DeepSeek 连续发布 "Agent Harness 产品经理" 和 "Agent Harness 研发工程师" 岗位,首次公开
Model + Harness = Agent的公式,并提出"除模型本身以外的所有工作,都属于 Harness 的范畴" - 2026 年 8 月 13 日:DeepSeek Harness v0.1(DSH)开发者预览版正式发布,以 MIT 协议开源(
github.com/deepseek-ai/deepseek-harness),同日推出增强 Agent 能力的 DeepSeek-V4 Pro - 发布后 24 小时内 GitHub 狂揽 7 万+ Star,直接对标 OpenAI Codex 和 Anthropic Claude Code
5.2 架构:一切皆插件
DSH 最核心的设计原则是 "Everything is a plugin",整个框架基于 Cordis 插件系统构建:
模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。
这意味着 DSH 不是给 DeepSeek 模型套一层工具,而是把 Agent 运行的每个环节都拆成可动态组合的模块——开发者无需改动源码,就能在配置层替换任意能力。它想做的是 Agent 基础设施的平台底座,而不是一个封闭产品。
5.3 五个值得学习的设计思路
① 日志即事实源(Event Sourcing)
大多数 Agent 把日志当"运行后的录像"。DSH 反过来:先记录发生了什么,再从记录生成模型上下文。系统提示词、思维链、工具调用、子 Agent 调度、每一次上下文注入,全部写入仅追加(append-only)的会话日志。模型看到的每一条信息事后都能完整还原,恢复、分叉、检索、回放共享同一份事件流。
② 渐进式纠错,而非粗暴禁止
Agent 最常见的失控是不断重复同一个无效工具调用。DSH 不禁止重试,而是监控重复行为,在模型连续犯同一个错误时逐步加强提醒,把"你正在原地打转"这个系统级信息告诉模型,让它自己决定继续、换路还是退出。
③ 让模型"知道自己不知道"
Agent 犯错常常不是推理能力不够,而是不知道自己的信息不完整。DSH 的做法:搜索结果被截断时,明确告知还有多少内容未展示并保留完整结果供继续读取;命令被安全策略拒绝时,明确告知这不是命令写错了、换方法重试没有意义。
④ 效率与权限的解耦
DSH 的 run_code 允许模型自己写一小段程序批量调用工具以提升效率。关键设计在于:哪怕模型自己写程序,每一次真正的工具调用仍必须重新经过原有的权限检查——批量执行不能成为绕过权限系统的后门。
⑤ 清空上下文,保留工作区
长期 Agent 需要持久化的不是聊天历史,而是工作状态。DSH 通过"清空上下文、保留工作区"的机制,让每个新会话都能从干净的状态继续未完成的任务。
5.4 快速体验
# 需要 Node.js 环境
npx @deepseek-ai/dsh web
# 启动后浏览器访问 http://127.0.0.1:3080注意 v0.1 仍是开发者预览版,官方提示核心插件和基础接口在未来几个月会快速演化,暂不建议用于生产环境。
5.5 评价与展望
DSH 的意义不止于一个新产品:
- 战略层面:DeepSeek 从模型层向 Agent 基础设施层延伸,形成"模型 + Harness 协同进化"的闭环——内部真实任务既是 Harness 的反馈源,也是模型训练的数据源
- 行业层面:MIT 开源 + 插件化架构,把 Anthropic、OpenAI 闭源产品的核心工程能力开放给了整个社区
- 技术层面:事件溯源、渐进纠错、权限解耦等设计,为"生产级 Harness 该长什么样"提供了一份可参考的公开答案
六、总结
Harness 的流行标志着 AI 工程重心的转移:
2023:谁的模型更强
2024:谁的 Prompt 写得更好
2025:谁的 Agent 框架更完善
2026:谁的 Harness 更可靠模型是灵魂,但 Harness 才是让 Agent 在真实世界持续工作的身体。对开发者而言,理解 Harness 的组成与设计原则,比追逐下一个新模型更有长期价值——因为模型会换代,而工程体系会沉淀。