⚙️ Agent 基础设施 · 开源快讯

开源 Agent 框架 12 小时冲上 5 万星,模型公司的竞争转向“壳”

DeepSeek 发布成立以来首个 Agent 产品 DeepSeek Harness。它没有端出一个面向大众的成品,而是把模型、工具、界面与运行循环拆成可替换插件,交给开发者自行组装。

发布时间:8 月 13 日 20:30 开发者预览版 约 4 分钟读完
#DeepSeek Harness #AI Agent #开源框架 #Harness
>5 万 公开后约 12 小时的 GitHub star
12小时 从仓库公开到突破 5 万星
<3 两项实测 Demo 的 Token 成本

⚡ 30 秒速览

  • 发生了什么:DeepSeek 在 8 月 13 日晚公布首个 Agent 产品,仓库公开后约 12 小时突破 5 万 star。
  • 它是什么:不是云端聊天服务,而是一套运行在本地电脑上的 Harness;模型、工具、界面、审批策略和主循环都能替换。
  • 实测结果:重构网站、调用公开 API 绘制 star 曲线,两项任务都完成;但网页交互仍有细节问题。
  • 最强卖点:“轨迹”页把系统提示、推理过程、工具调用和返回结果完整记录,任务不再只有最终答案可看。
  • 必须降温:当前版本面向 Harness 开发者,非编程用户上手门槛较高;第三方对比还提示,它未必是最省 Token 的方案。

01一夜之间,热度先于产品形态到来

仓库在正式公布前约半小时悄然公开。随后,star 数在几个小时内连续跳升:它的传播速度远超一个普通开发者工具,更像一次大型开发者集结。

先看这条增长曲线。

记录到 7,283 个 star,仓库公开后热度已经快速聚集。

46 分钟后升至 15,530,新增超过 8,000 个 star。

早间记录达到 44,514,从夜间发布进入开发者工作日。

仓库突破 5 万 star,成为 DeepSeek 成立以来最受瞩目的 Agent 产品发布。

注:时间点来自发布当晚及次日的人工记录;star 会持续变化,曲线用于呈现增长节奏,不代表实时排名。

作为参照,OpenClaw 用 84 天累计约 20 万 star,平均每小时约 99 个。原报道按头两个小时的统计窗口估算,DeepSeek Harness 的增速约为其 80 倍;但两者统计口径并不完全一致,更适合用来感受热度,而不是当作严格竞速结果。

02为什么可信:它把“做过什么”留下了证据

DeepSeek Harness 当前不是一个登录即用的云端产品。安装 Node.js 后,开发者在本地执行 npx @deepseek-ai/dsh web,浏览器打开本地 3080 端口;会话、日志和数据都留在自己的电脑里,浏览器只是外壳。

本地运行意味着什么?
它更像一套可调试的开发环境,而不是一个把复杂过程藏在后台的聊天窗口。对开发者而言,这带来更强的控制力;对普通用户而言,也意味着更多安装和配置成本。

模型插件

负责理解、规划与生成,可按需替换。

工具插件

接入浏览器、代码、文件和外部 API。

界面插件

连 Web 前端都能换成自定义样式。

主循环插件

驱动 Agent 运转的核心机制也可拆换。

注:这里展示的是产品设计的可替换层级,不代表每个插件都能在不改配置的情况下即插即用。

内置预设: 标准 极简 代码 创造

发布前后的内测阶段,开发者已经做出约 300 个插件:复古 Windows XP 皮肤、表情包插件,以及用于实时预览交互设计的 DSH-OpenPencil。它们未必都是生产级工具,却证明了一点:这里没有太多被焊死的组件。

更有说服力的是“轨迹”页。系统提示、模型看到的内容、每一次工具调用与返回结果,都能在会话里被追溯。它回答的不只是“结果是什么”,还允许开发者追问“到底看了什么、调用了什么、在哪一步出了问题”。

03它到底能做什么?两项发布当晚实测

我们没有只让它写一段文字,而是给了两个需要检索、调用工具并交付文件的任务。结果并不完美,但已经能看出 Harness 和普通聊天机器人的分界线。

🌐 网站重构:同时理解目标站与参考风格 任务完成

  • 输入一个真实网站地址,再给出一个参考站点的视觉方向,要求它重新设计页面结构与交互。
  • 这个任务的关键不在“会不会写代码”,而在它是否真的访问并理解了两个网站,而不是凭训练记忆拼出一个相似页面。
  • 最终交付了可运行的网页,但格式和交互仍存在细节问题;安装更多设计与前端插件后,页面还有继续迭代的空间。
编辑观察:能交付初版,不等于能替代设计师完成验收。当前更像一个可以持续改造的工作台。

📈 数据提取:调用公开 API 绘制 star 增长曲线 任务完成

  • 让 Agent 查询仓库的公开 API,并结合 21:05、21:51、次日 08:53 三个人工记录点整理数据。
  • 任务要求包括绘制时间—star 曲线、标注关键节点,并将结果保存为图片,而不是只返回一段代码。
  • 它完成了数据提取、计算、可视化和文件输出,整个 Demo 测试的 Token 成本没有超过 3 元
可审计性:轨迹页能逐步核对 API 调用、返回数据和最终图片生成过程。
读取页面 调用工具 处理数据 生成文件 留下轨迹

注:两项任务均来自发布当晚的实机体验;“完成”指交付了可用初版,不代表结果无需人工复核。

04硬数据的两面:可审计,但不一定最省

Harness 的价值并不只体现在界面。不同 Harness 会重新组织上下文、安排工具调用、决定何时重试,因此同一个底座模型,最后能完成多少任务,可能出现明显差距。

20/30
14/30

注:对照测试使用同一个 V4-Flash 完成 30 项任务;条形长度按 30 项满分缩放,重点是展示 Harness 带来的完成度差异。

成本则是另一面。每个会话底部都会显示耗时、输入输出 Token、缓存命中率和本轮累计用量,账单被直接摊在桌面上。

<3 元 两项实测 Demo 的 Token 消耗
实时 会话底部展示用量与耗时
约三成多 第三方对比中,另一款开源 Harness 的相对消耗

注:成本数据基于 8 月 13 日涨价前的模型价格;第三方消耗对比未在同一环境独立复测,只适合作为效率警示。

这也是目前不能回避的缺口:DeepSeek Harness 的 V4 Flash 体感速度较快,内容准确率没有明显下降,但同款模型接入不同 Harness 后,Token 消耗可能相差数倍。它能把过程公开,却还没有证明自己已经把过程做到了最优。

05为什么它被叫作 Agent 界的 Android?

模型像大脑,Harness 像手脚。模型决定能力上限,Harness 决定这份能力能否被稳定地调用、验证并交付。过去的聊天机器人主要交付一段话,而 Agent 要交付一件做完的事。

理解意图 拆解任务 调用工具 检查结果 交付文件

注:这条链路展示的是 Agent 的执行闭环;模型能力贯穿其中,但每一步是否发生,取决于 Harness 的编排。

对 DeepSeek 来说,这层“壳”至少对应三笔现实账:

成本账

上下文如何组织、缓存是否命中、失败后重试几次,都会改变单个任务的 Token 消耗。

数据账

任务失败的完整过程是改进模型的重要材料,而这些过程数据掌握在 Harness 一侧。

生态账

插件开发者越多,模型、工具与工作流之间的绑定越深,平台就越容易形成自己的开发生态。

它和传统成品 Agent 的差别也由此出现:别家更倾向于把复杂度藏起来,DeepSeek 则把零件全部摊开,赌开发者会在这些零件之上拼出新的工作方式。开放带来速度,也把稳定性、易用性和维护责任一并交给了使用者。

所以,“像框架、不像成品”既是今天最大的批评,也可能是它最核心的路线选择。

编辑核心判断

DeepSeek Harness 目前不是一个更好用的聊天框,而是一场对 Agent 基础设施形态的押注:可替换的 Harness 加插件生态,可能比单一模型更接近真实生产环境;但在开发者预览阶段,复杂度、成本效率和非编程用户门槛仍是三道硬伤。行业层面的判断是:Agent 竞争正在从“谁的模型更强”转向“谁能把模型稳定、低成本地接入真实工作流”。

现在就能试

它适合愿意动手的开发者:准备好 Node.js,在本地终端运行下面的命令,再用浏览器打开本地 3080 端口。

npx @deepseek-ai/dsh web

预览版提示:界面、插件接口与核心能力仍会快速演化;重要结果请保留人工复核。