展开目录
#DeepSeek#Agent#开源#Harness#橙皮书#MCP#AI编程

DeepSeek Harness 橙皮书解读:24 小时拆穿「一切皆插件」的 Agent 框架

DeepSeek 8月13日开源 Agent 框架 Harness,一天狂揽 10 万 star。花叔用 AI 连夜写出 120 页橙皮书,把系统提示词、129 行启动清单、四种模式、skill/MCP/插件的关系一次拆清楚

预计阅读 10 分钟

一句话总结

DeepSeek 在 8 月 13 日开源了 Agent 框架 Harness(「Everything is a Plugin」,MIT 协议),一天之内冲到 10.5 万 star;独立开发者花叔在发布 24 小时内用 AI 写出 120 页《DeepSeek Harness 橙皮书:从开机到拆开》,把官方文档没讲的一手实测全记录了下来——从完整系统提示词到 129 行启动清单,再到 AI 现场给自己造工具的全过程。


DeepSeek Harness 是什么?

2026 年 8 月 13 日,DeepSeek 开源了一个名为 Harness 的 Agent 框架(仓库 deepseek-ai/deepseek-harness,MIT 协议,发布当天即开源)。它的官方描述只有一句话:

DeepSeek Harness: Everything is a Plugin.(一切皆插件)

这一句话引发的关注是惊人的——上线一天之内,仓库就积累了 10.5 万+ star(截至 8 月 14 日),TypeScript 编写,主页挂在 deepseek.com/harness

但热度归热度,大多数人看完这句「一切皆插件」之后其实是懵的:

  • 什么叫「一切皆插件」?它和我熟悉的 skill、MCP 是什么关系?
  • 官网提到的四种模式(标准模型、PTC 模式、极简模式、创造模式)到底指什么?我该用哪个?
  • 它和 Codex、Claude Code 这些 coding agent 相比,有什么不同?

这三个问题,恰恰是花叔在 X 上点名的疑问,也是这本橙皮书要回答的核心。


橙皮书:一本 AI 写的、120 页的一手拆解

橙皮书全名 《DeepSeek Harness:从开机到拆开》,作者花叔(HuaShu),免费开源(CC BY-NC-SA 4.0),PDF / EPUB / HTML 三种格式任选。

橙皮书封面

有两个背景值得先说清楚:

第一,这本书是 AI 写的。 花叔在 X 上坦率地说:「这么短时间内能出这个东西,当然是 AI 写的」,前后花了约 2 亿 Opus 5 tokens。但「AI 写」不等于「没价值」——恰恰相反,这本书的卖点是一手实测:一个从未手写过代码的人,把刚出厂 24 小时的框架装在自己机器上跑穿了。

第二,它的视角和官方发布稿相反。 官方发布稿的主语是「它」——它怎么造的、它是什么架构;而橙皮书把主语换回了「我」——我装上去第一件事干什么、会不会花我的钱、会不会动我硬盘上别的文件。这种「使用者视角」正是官方文档缺的那一块。

作者花叔是谁?他是「小猫补光灯」(App Store 付费榜第一)的开发者,橙皮书系列作者,全平台 50 万+ 读者,所有产品全部用 AI 完成、从未手写过一行代码,也是 CCTV《焦点访谈》报道的「手搓经济」代表人物。他的橙皮书系列里,已经覆盖了 Claude Code、Codex、OpenClaw、Agent Skills 等多个 Agent 生态。


核心问题一:「一切皆插件」到底是谁管谁?

这是全书最基础也最让人困惑的一点。Harness 宣称「Everything is a Plugin」,把 skill、MCP、插件这些概念统统收进了「插件」这一个统一模型里。

插件与 skill、MCP 的关系

理解这个统一模型,是理解 Harness 架构的钥匙:

  • skill(技能):一段被组织好的能力描述,告诉 Agent「怎么做好某件事」
  • MCP(Model Context Protocol):连接外部工具与数据源的标准协议
  • 插件(Plugin):Harness 的统一抽象,把上述两者都装进同一个容器里

换句话说,在 Harness 的世界里,skill 和 MCP 服务器都是插件的不同形态——它们不再是你需要分别去理解、分别去配置的两套东西,而是被收编到了同一个「一切皆插件」的框架之下。这也解释了为什么官方敢喊出这么一句口号:它想用「插件」这一个词,终结概念的分裂。

书里「skill、MCP、插件到底谁管谁」这一节,以及「两个插件都想管文件编辑,谁赢」的冲突解析,讲的正是这套统一模型落到工程细节后的取舍。


核心问题二:四种模式到底怎么选?

Harness 提供了四种运行模式,这也是花叔最初最困惑的地方——名字都玄乎,不知道哪个该用。橙皮书用「人话版」把它们拆开了:

四种模式对比

  • 标准模式(Standard):默认模式,适合大多数日常任务,稳定、可控
  • PTC 模式:让模型直接写程序来编排工具。花叔的实测是「5 次开口、15 次操作」——模型自己生成代码去调用工具,能力更强,但有一笔反直觉的账(下文细说)
  • 极简模式(Minimal):轻量、快速,适合简单直给的任务,开销最小
  • 创造模式(Creative):让 AI 现场给自己造工具——书里记录了一次完整的创造过程:19 步,工具清单从 32 行变成了 33 行,多出来的那一行,是 AI 自己写的

一个核心心法是:别被名字唬住,按「任务复杂度」和「要不要它自己扩展能力」来选。 简单的活选极简/标准,需要模型编排工具选 PTC,需要它长出「新手」去探索的选创造模式。


核心问题三:和 Codex / Claude Code 差在哪?

这是最容易被问到的问题。Harness 和 Codex、Claude Code 一样,都属于 coding agent / agent harness 这一大类,但定位不同:

与 Codex、Claude Code 的定位对比

  • Codex / Claude Code:面向「写代码」这个具体任务打磨到极致的产品,生态成熟、迁移门槛低
  • DeepSeek Harness:更像一个**「一切皆插件」的通用 Agent 底座**,把插件、skill、MCP 统一收编,开放性更强,但刚出厂 24 小时,生态和文档都还在早期

书里「从 Claude Code 搬家」这一节专门做了迁移对照:哪些能力能直接用、哪些要自己装、哪些暂时用不了。一个细节是——~/.agents/skills 这个目录会被 Harness 零配置读走,这种兼容性文档不会告诉你,但实测才知道。

DeepSeek 为什么这么设计?花叔的答案是去仓库里「考古」——dsh 仓库保存了开发过程中几乎所有决策过程的 Agent Note,正是靠这些笔记,才把「它为什么走到今天这个状态」拆了出来。


官方文档没有的:一手实测内容

橙皮书最值钱的部分,是那些「跑在自己机器上才有的」一手材料:

实测内容说明
完整系统提示词每次开口前被灌进模型脑子里的那一大段话
129 行出厂启动清单dsh --profile web --dump-default-config 导出,一行行看它开机装了什么
三份原始会话日志标准模式、PTC、创造模式各一份,一条事件都没删
AI 现场造工具全程19 步,工具清单从 32 行变 33 行,多出来那行是它自己写的
PTC 实测账单5 次开口编排 15 次操作,以及那笔反直觉的账
35 个扩展包清单都在 npm 上,但不在安装闭包里——「仓库里有」不等于「装上就有」
代码库考古12,293 次提交 / 约 64 天、683 篇 Agent Note、4 篇事故复盘

其中最反直觉的是 PTC 的账:让模型写程序编排工具,看起来更「智能」,但实测发现固定开销反而涨了 9%。这个数字背后藏着一个朴素的道理——能力更强的模式,往往有它自己的隐性成本,选模式不能只看「厉不厉害」。


代码库考古:一个几乎全由 AI 写出来的仓库长什么样

花叔对 Harness 仓库做了一次「考古」,几个数字很值得玩味:

代码库考古数据

  • 12,293 次提交 / 约 64 天——这是一个极高密度的开发节奏,几乎是 AI 全天候产出的产物
  • 683 篇 Agent Note——把开发过程中几乎每一个决策都留痕了,这正是花叔「如获至宝」的来源:想搞懂一个 AI 造出来的产品「为什么这么设计」,没有比读它的决策笔记更直接的路径了
  • 4 篇事故复盘——包括一个耐人寻味的案例:「100% 覆盖率全绿,编辑器一连上就崩」。测试全绿 ≠ 真的能用,这个教训对任何用 AI 写代码的人都是一记提醒

橙皮书每一节的结尾还有个固定栏目叫 《他们本来想这么做,后来没做》——取自仓库里被否决的设计方案,专门回答「为什么这里没有 X」。这种「看被砍掉的设计」的视角,比看最终成品更能理解一个框架的取舍逻辑。


适合谁读?

橙皮书的分层很清晰,三类人能各取所需:

  • 不写代码、但用过 Claude Code / Codex / OpenClaw 的人:每个概念一句技术定义 + 一个日常类比,还告诉你「类比在哪失真」
  • 业内工程师:一手材料是自己跑出来的日志、被否决的方案、事故复盘的考古,不是发布稿的转译
  • 想评估要不要迁移的人:能直接用 / 要自己装 / 用不了,逐项实测

正如花叔自己说的:书里凡是卡住他的地方都原样写下来了——顺的过程没什么可信度,卡住的地方才有。


总结

  • Harness 是 DeepSeek 的通用 Agent 底座,核心口号「一切皆插件」,用统一模型收编 skill、MCP 与插件
  • 四种模式(标准 / PTC / 极简 / 创造)对应不同任务复杂度,创造模式能让 AI 给自己造工具
  • 橙皮书的价值在「一手实测」:完整系统提示词、129 行启动清单、三份原始日志、AI 造工具的全程,都是官方文档没有的
  • 几个反直觉的结论:PTC 固定开销反涨 9%;测试 100% 覆盖全绿照样崩;「仓库里有」不等于「装上就有」
  • 读它的正确姿势:先看「四种模式人话版」和「skill/MCP/插件谁管谁」,再对着自己的需求决定要不要迁移

一句话:如果你也被 Harness 的「一切皆插件」和四种模式搞懵了,这本 120 页的橙皮书是目前最快的一手拆解。

资源地址

Related

相关文章

延伸阅读

查看全部 →