Skip to content

Harness 是什么?从概念演进到 DeepSeek Harness 深度解析

2026 年 AI 圈最热的工程概念不是某个新模型,而是 Harness——让大模型真正成为 Agent 的那套"驾驭系统"。这篇文章从词源、历史、技术栈一路讲到 DeepSeek 最新开源的 DeepSeek Harness。

一、Harness 的定义

Harness 原意是"马具"——马鞍、缰绳、马镫的统称。马本身有强大的力量,但没有马具,骑手无法驾驭它。

这个隐喻被精准地移植到了 AI 领域:

  • LLM 是马:强大、有潜力,但随机、有幻觉、无记忆,裸跑时像一匹脱缰野马
  • Harness 是马具:约束、引导、纠错,把不可控的智能输出转化为稳定的生产力
  • 骑手是你:定义目标和方向

DeepSeek 在招聘 Agent Harness 团队时给出了一个广为流传的公式:

Model + Harness = Agent

用一句话定义:Harness 是除模型本身以外,让 Agent 可靠工作的一切基础设施的总和——编排循环、工具运行时、上下文管理、状态持久化、权限沙箱、可观测性,全都在它的范畴内。

和 System Prompt 的本质区别

System Prompt 是"请求",模型可以选择不遵守;Harness 是代码级别的强制力——从"请你这样做"变成"你只能这样做"。这是从 Demo 到生产的关键一步。

二、词源与历史演进

词源:从测试领域借来的词

"Harness"在软件工程里早有先例——Test Harness(测试框架/测试夹具),指包裹被测代码、提供输入并收集输出的那套基础设施。EleutherAI 著名的 lm-evaluation-harness 就是评测领域的代表。2026 年初,这个词被正式引入 Agent 领域,语义从"评测的框架"扩展为"运行的框架"。

演进:四个阶段

阶段核心问题代表
① Prompt 工程"怎么跟模型说话"Few-shot、CoT
② 工具调用"模型如何动手"Function Calling、ReAct
③ Agent 框架"如何组织多步任务"LangChain、AutoGPT
④ Harness 工程"如何可靠、可控、可恢复"Claude Code、Codex、DSH

早期的 Agent 其实就是一个 while 循环:调模型 → 返回工具调用 → 执行 → 把结果塞回去 → 再调模型。Demo 能跑,但一上生产就崩:模型忘了三步前干过什么、工具调用静默失败、上下文窗口塞满垃圾、同一个错误反复重试。

人们逐渐意识到:问题不在模型,而在模型周围的一切。 一个著名的佐证是 LangChain 的实验——不动模型、不改权重,只优化外围基础设施,就在 TerminalBench 2.0 上从 30 名开外冲到第 5。

2026 年,随着 Claude Code、Codex 等产品的爆发,Anthropic 在官方文档中直言其 SDK 就是"驱动 Claude Code 的 agent harness",OpenAI Codex 团队也明确区分 "agent" 与 "harness" 两个概念。Harness Engineering 正式成为一门显学。

三、Harness 的技术组成

一个生产级 Harness 可以拆解为以下模块:

Harness = Model Adapter    # 模型适配层(可切换不同模型)
        + Agent Loop       # 编排循环(推理-行动-观察)
        + Tool Runtime     # 工具运行时(注册、校验、执行)
        + Context/Memory   # 上下文工程(压缩、注入、检索)
        + State/Checkpoint # 状态持久化(可暂停、可恢复)
        + Policy/Sandbox   # 权限与沙箱(代码级强制约束)
        + Event/Trace      # 事件与追踪(可观测、可回放)
        + Scheduler        # 调度(子 Agent、并发、长任务)

其中最容易被低估的三件事:

  1. 上下文工程:不是把对话历史一股脑塞给模型,而是精心管理"模型此刻应该看到什么"
  2. 状态持久化:长期任务需要持久化的不是聊天历史,而是工作状态
  3. 权限边界:工具调用的每一次执行都必须经过权限检查,不能被批量调用绕过

四、现有技术栈格局

当前 Harness 领域大致分为三个层次:

① 产品级 Harness(开箱即用)

  • Claude Code / Claude Agent SDK(Anthropic):"harness"一词的布道者,SDK 即官方 harness
  • OpenAI Codex:云端沙箱 + 本地 CLI 的 Agent 产品
  • Claude Cowork:桌面端多 Agent 协作形态

② 框架级 Harness(自己搭建)

  • LangGraph:图结构的状态机编排,持久化与人工介入能力强
  • OpenAI Agents SDK:轻量级的 Agent 循环 + 交接(handoff)
  • CrewAI / AutoGen / Mastra / Semantic Kernel:多智能体编排方向

③ 评测级 Harness(词源本家)

  • lm-evaluation-harness(EleutherAI):LLM 静态评测的事实标准
  • SWE-bench / Terminal-Bench:Agent 动态能力的基准测试

一个共识

模型决定 Agent"能做什么",Harness 决定 Agent"如何把事情做完"。2026 年的竞争焦点,已经从模型参数转向了工程化体系。

五、DeepSeek Harness 深度解析

5.1 发布背景

DeepSeek 的布局有清晰的时间线:

  • 2026 年 5 月:DeepSeek 连续发布 "Agent Harness 产品经理" 和 "Agent Harness 研发工程师" 岗位,首次公开 Model + Harness = Agent 的公式,并提出"除模型本身以外的所有工作,都属于 Harness 的范畴"
  • 2026 年 8 月 13 日DeepSeek Harness v0.1(DSH)开发者预览版正式发布,以 MIT 协议开源github.com/deepseek-ai/deepseek-harness),同日推出增强 Agent 能力的 DeepSeek-V4 Pro
  • 发布后 24 小时内 GitHub 狂揽 7 万+ Star,直接对标 OpenAI Codex 和 Anthropic Claude Code

5.2 架构:一切皆插件

DSH 最核心的设计原则是 "Everything is a plugin",整个框架基于 Cordis 插件系统构建:

模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。

这意味着 DSH 不是给 DeepSeek 模型套一层工具,而是把 Agent 运行的每个环节都拆成可动态组合的模块——开发者无需改动源码,就能在配置层替换任意能力。它想做的是 Agent 基础设施的平台底座,而不是一个封闭产品。

5.3 五个值得学习的设计思路

① 日志即事实源(Event Sourcing)

大多数 Agent 把日志当"运行后的录像"。DSH 反过来:先记录发生了什么,再从记录生成模型上下文。系统提示词、思维链、工具调用、子 Agent 调度、每一次上下文注入,全部写入仅追加(append-only)的会话日志。模型看到的每一条信息事后都能完整还原,恢复、分叉、检索、回放共享同一份事件流。

② 渐进式纠错,而非粗暴禁止

Agent 最常见的失控是不断重复同一个无效工具调用。DSH 不禁止重试,而是监控重复行为,在模型连续犯同一个错误时逐步加强提醒,把"你正在原地打转"这个系统级信息告诉模型,让它自己决定继续、换路还是退出。

③ 让模型"知道自己不知道"

Agent 犯错常常不是推理能力不够,而是不知道自己的信息不完整。DSH 的做法:搜索结果被截断时,明确告知还有多少内容未展示并保留完整结果供继续读取;命令被安全策略拒绝时,明确告知这不是命令写错了、换方法重试没有意义。

④ 效率与权限的解耦

DSH 的 run_code 允许模型自己写一小段程序批量调用工具以提升效率。关键设计在于:哪怕模型自己写程序,每一次真正的工具调用仍必须重新经过原有的权限检查——批量执行不能成为绕过权限系统的后门。

⑤ 清空上下文,保留工作区

长期 Agent 需要持久化的不是聊天历史,而是工作状态。DSH 通过"清空上下文、保留工作区"的机制,让每个新会话都能从干净的状态继续未完成的任务。

5.4 快速体验

bash
# 需要 Node.js 环境
npx @deepseek-ai/dsh web
# 启动后浏览器访问 http://127.0.0.1:3080

注意 v0.1 仍是开发者预览版,官方提示核心插件和基础接口在未来几个月会快速演化,暂不建议用于生产环境。

5.5 评价与展望

DSH 的意义不止于一个新产品:

  • 战略层面:DeepSeek 从模型层向 Agent 基础设施层延伸,形成"模型 + Harness 协同进化"的闭环——内部真实任务既是 Harness 的反馈源,也是模型训练的数据源
  • 行业层面:MIT 开源 + 插件化架构,把 Anthropic、OpenAI 闭源产品的核心工程能力开放给了整个社区
  • 技术层面:事件溯源、渐进纠错、权限解耦等设计,为"生产级 Harness 该长什么样"提供了一份可参考的公开答案

六、总结

Harness 的流行标志着 AI 工程重心的转移:

2023:谁的模型更强
2024:谁的 Prompt 写得更好
2025:谁的 Agent 框架更完善
2026:谁的 Harness 更可靠

模型是灵魂,但 Harness 才是让 Agent 在真实世界持续工作的身体。对开发者而言,理解 Harness 的组成与设计原则,比追逐下一个新模型更有长期价值——因为模型会换代,而工程体系会沉淀

参考资料