🐋 Agent 框架 · 开源实测

开源 Agent 框架实测:88 页论文翻译耗时 22 分钟,GitHub 星数 3 小时破 3 万

8 月 14 日,DeepSeek Harness 以 v0.1 开发者预览版正式公测并开源。它没有套用社区猜测的 Pi Agent 架构,也没有沿用缓存命中率超高的 Reasonix,而是用一套「一切皆插件」的元框架,让开发者自己拼装想要的智能体。

来源:综合公开信息整理 2026-08-14 全文约 5 分钟读完
#DeepSeek Harness #Agent 框架 #一切皆插件 #开源
🐋 元框架 不内置 Agent 本体,只定义插件的挂载规则
30 分钟 GitHub 星数破 1 万
3 小时 仓库星数发稿时已超 3 万

⚡ 30 秒速览

  • 闪电二连击:V4-Pro 正式版上线并预告涨价两小时后,DeepSeek Harness v0.1 公测开源;星数 30 分钟破万,发稿破 3 万。
  • 设计哲学:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部插件化;底层 Cordis 元框架只负责加载、卸载和依赖管理。
  • 四种模式:标准 / 极简 / 创造 / PTC 各自加载不同插件集,按场景自由选。
  • 实测数据:88 页论文翻译耗时 22 分钟,首 Token 平均 1.4 秒,缓存命中率 98%;贪吃蛇游戏极简模式 50 秒完成。
  • 诚实分歧:它不是开箱即用的 Coding Agent,更像一套可组装的开发框架——这正是社区讨论最激烈的地方。

01发生了什么 一场密集的深夜发布

这不是一次孤立的产品更新,而是一次刻意安排的「组合拳」。

DeepSeek-V4-Pro 正式版上线,官方同步预告「价格即将大幅上涨」。
DeepSeek Harness v0.1 公测,开发者预览版与源代码同步开放。
GitHub 仓库星数突破 1 万
星数超过 3 万,国内外开发者开始晒内测合影与「解密感言」。

注:时间线按公开信息整理,未标注具体分钟刻度;星数增长数据以官方仓库实时显示为准。

02它到底是什么 一个「一切皆插件」的元框架

社区原本的猜测落空了。DeepSeek Harness 没有采用 Pi Agent 架构,也没有套用缓存命中率极高的 Reasonix。它选择了更底层、也更开放的路线:先把 Agent 拆成积木,再让用户自己拼。

模型· 工具· 技能· 会话· 沙箱· 存储· 循环· 调度· UI

这些能力全部通过插件挂载到底层 Cordis 插件系统上。Cordis 本身不关心业务,只负责插件的加载、卸载和依赖关系。它的设计思想来自北京大学与 DeepSeek 联合署名的一篇论文,核心是「时空可组合性」——把不同模块按需组合成新的系统能力。

换句话说,DeepSeek Harness 不是一台组装好的机器,而是一套允许你造机器的工具箱

社区原本期待

Pi Agent 架构 / Reasonix 高缓存命中率 / 开箱即用的 Coding Agent

实际给出的

Cordis 插件系统 / 可替换的组件集合 / 需要开发者自行组装的 元框架

注:这不等于「失望」。两类产品的评价体系完全不同——成品看功能,框架看扩展空间。

03实测:能做什么 翻译 88 页论文,只花了 22 分钟

编辑第一时间拉取源码,在标准模式下喂了两个真实任务:翻译一篇 88 页论文、写一个贪吃蛇游戏。

22 min88 页论文翻译
1.4 s首 Token 平均耗时
98%缓存命中率
72.7k输出 Tokens

注:翻译任务输入约 6.6M Tokens,共派发 10 个子代理;数据来自单次本地运行记录,不同环境可能有差异。

📄 88 页论文翻译 完成

  • 首次执行时没有内置 PDF 工具,Agent 先自行安装工具,再提取文本。
  • 它没有直接开写,而是识别出桌面上已有一份该论文的旧翻译稿,并建议在旧稿基础上做增量修正
  • 最终派发 10 个子代理,完成复制、修正、补齐,交付格式完整、内容严谨的翻译文件。
亮点不在翻译速度,而在「先发现旧稿、再决定增量更新」的决策路径——这是传统自动化流程很难做到的部分。

🍎 贪吃蛇游戏:极简模式 vs PTC 模式 双模式完成

  • 极简模式 50 秒完成,产出 Python 版,需在终端运行。
  • PTC 模式 1 分 05 秒完成,由模型生成一段代码组合多轮工具调用。
  • 极简模式刻意不做 HTML 封装,因为它的目标不是 C 端体验,而是最小环境下测出模型真实能力
同一个任务,两种模式给出不同的「够用」定义;开发者要按场景选择插件集。

04为什么能做到 模式可组合,过程可回放

这个框架的工程巧思,藏在两个地方:模式系统轨迹系统

标准模式

提供完整工具组合,覆盖日常开发与任务执行。

极简模式

只保留 shell 与文件编辑工具,专门服务模型基准测试。

创造模式

允许在内存中调试 Cordis 插件,组合并创作新模式。

PTC 模式

程序化工具调用,由模型生成代码组合多轮调用。

「每一次运行都有迹可循」不是一句口号,而是一个具体设计:

🧭 轨迹系统

  • 模型看到的一切都会写入仅追加的会话日志,包括系统提示词、思维链、工具调用与结果、子 Agent 调度、上下文注入。
  • 轨迹视图支持按来源检索,也支持恢复、分叉、回放
  • 每个彩色读条对应一个运行节点,报错信息同样可回溯。

注:轨迹系统是 Agent 的「白箱」基础——开发者看到的是完整执行过程,而不是只拿到一个结果。

05为什么开源 闭源提供现在,开源掌握未来

团队负责人崔添翼在公开发布时说了这样一句:

「这是一个预览版本,可能存在很多粗糙之处,希望大家多提意见。」

从产品形态看,DeepSeek Harness 并不完美:生态不完整、界面极简、很多能力需要开发者自己补完。但它把选择权交了出来。

它不是一款面向 C 端用户的产品,更像一套乐高底座——你可以把它拼成评测工具、Coding Agent,或任何尚未被定义的东西。

编辑核心判断

DeepSeek Harness 的价值,不在「现在能跑多快」,而在把 Agent 的组装权交还给社区。一个不完美但可塑的开源底座,比一个封闭的完美产品更能定义下一代基础设施;当模型能力开始趋同,下一轮竞争的关键变量,是框架工程与开发者生态。

现在就能装

官方仓库已开放,需要 Node 环境与 pnpm。三行命令即可拉起本地网关,输入 API Key 后开始体验。

git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install && pnpm run build && pnpm dsh web