🧩 智能体 · 架构发布

插件化 Agent 框架 DSH 正式发布,V4 Pro 能力飙升近 5 倍,token 成本仅为竞品 1/120

DeepSeek 正式发布 DeepSeek Harness(DSH)插件化 Agent 框架与 V4 Pro 正式版。V4 Pro 的 Agent 能力全面飙升——DeepSWE 从预览版 12.8 分跃升至 62.7 分,涨幅近 5 倍;DSH 配合 V4 Pro 在同等任务下 token 花费仅为 Claude Fable 5 的 1/120,缓存命中率高达 99%

综合公开信息整理 2026-08-15 全文约 4 分钟读完
#DeepSeek #DSH #V4 Pro #Agent 框架 #插件化
↑ 4.9× DeepSWE 得分:12.8 → 62.7
1/120 token 成本仅为 Fable 5
99% 缓存命中率 · 增量协调加持

⚡ 30 秒速览

  • DSH 是什么:DeepSeek Harness,一个"一切皆插件"的 Agent 框架,任务需要什么就调用什么,用完即卸,支持热替换与事务性回滚。
  • V4 Pro 涨了多少:DeepSWE 12.8→62.7(+4.9×),DSBench-Hard 31.1→67.2,DSBench-FullStack 41.8→71.1,Agent 能力全面跃升。
  • 便宜多少:相同任务,Claude Fable 5 花 9.8 美金(≈70 元),DSH + V4 Pro 仅花 0.59 元,便宜约 120 倍。
  • 凭什么省:增量协调只改该改的,缓存命中率 99%;PTC 模式将 5 次模型往返压缩为 1 次。
  • 代价:价格上调——高峰时段输出为原价 4.5 倍(27 元/百万 token),但 DSH 让每一分钱都更值。

01Agent 能力跃升 V4 Pro 正式版三大基准得分

V4 Pro 正式版在 Agent 能力上实现了"跳级式"提升。三个关键基准的得分变化,清晰地展示了这次升级的幅度。

🛠️ DeepSWE端到端软件工程
62.7
📊 DSBench-Hard数据科学困难任务
67.2
🧩 DSBench-FullStack全栈开发
71.1

注:柱形宽度按新得分等比例缩放,标注点为预览版旧得分位置,非零起点。分差以标注数字为准。DeepSWE 涨幅 4.9 倍,DSBench-Hard 涨 2.2 倍,DSBench-FullStack 涨 1.7 倍。

但数字只是结果。真正让业界侧目的,是背后那套"一切皆插件"的架构。

02性能对标 DSH + V4 Pro vs Claude Fable 5

在 Agent 领域影响力最大的基准 Terminal Bench 2.1 上,V4 Pro 正式版性能比肩当前最强的 Claude Fable 5。但真正的差距不在得分,而在成本。

Claude Fable 5

单次任务 token 消耗成本

9.8 美金

≈ 人民币 70 元

DSH + V4 Pro 正式版

相同任务,同等效果

0.59

仅为 Fable 5 的 1/120 🏆

注:测试在非高峰时段进行,缓存命中率约 99%。若在高峰时段,成本差距约为 1/100 以内。数据引自公开评测,具体任务为代码审查与多步 Agent 管线。

一个诚实的注脚:高峰时段价格会上浮,但 DSH 的缓存机制让"便宜"在涨价后依然成立。

03价格模型 调价后的实际成本

V4 Pro 正式版确实涨价了——输出高峰时段为原价 4.5 倍。但 DSH 的架构优化,让实际使用成本远低于表面定价。

27 输出 · 高峰 4.5×
13.5 输出 · 空闲 2.25×
0.3 缓存命中输入 · 高峰 12×
99% 缓存命中率 · 实际

注:价格单位为元/百万 token。缓存命中率 99% 意味着绝大多数输入走缓存通道,实际成本远低于标价。原价指 V4 Pro 预览版定价。

以单日 20 万输出 token 的代码审查场景为例:调价前单日成本约 1.2 元,高峰时段升至 5.4 元,空闲时段 2.7 元。DSH 的缓存机制让实际支出更接近空闲时段水平。

04架构解析 DSH 的"一切皆插件"哲学

DSH 不是又一款 Codex 或 Workbuddy。它走了一条从未有人走过的路——BS 架构的 Web UI,打开就是网页,网页里就是 Agent 工作区。安装门槛高(需要 node.js + npm),但换来的是极致的灵活性与资源效率。

它的核心设计理念来自北京大学与 DeepSeek 联合署名的论文《A Programming Paradigm for Spatiotemporal Composability》。两个维度定义了这套架构的独特性。

⏳ 时间可组合性 可逆效应

  • 传统做法:组件卸载时,它对环境的所有修改无法自动撤销,需要手动清理或重启进程。
  • DSH 做法:每次上下文变换都自带"逆变换",运行时全程追踪,组件卸载时自动回滚所有修改。
  • 类比:传统像"买东西开小票,退货得走流程";DSH 像"胖东来退货——交给客服,剩下的系统自动解决"。
核心价值:热卸载 + 零残留,组件用完即走,不污染共享环境。

🌐 空间可组合性 动态协作

  • 传统做法:依赖关系在编码时或启动时固定,VS Code 扩展装在共享进程里,想停用就得重启整个宿主。
  • DSH 做法:组件在共享运行时"空间"中动态建立关联,视觉插件与声音插件放在同一空间,自动协作——一个负责记录文字,一个负责朗读。
  • 类比:DSH 只是一个底盘,你可以给它加轮子变成车,也可以加螺旋桨变成直升机。
核心价值:热模块替换,改插件原地替换,缓存和连接保留,改炸了还能事务性回滚。

DSH 还定义了四套执行模式:普通任务直接做;长程任务进入 Goal 模式跨多轮自主执行;子任务丢给子 Agent 后台运行;大规模并行任务进入 Workflow,用 JavaScript 编排多个 Agent。每轮 Ralph Loop 创建一个完全"失忆"的新 Agent,只通过共享 Workspace 保留长期记忆。

接收意图拆解任务调用插件执行并验证卸载插件

注:DSH 的插件化架构实现了解耦——每个模块独立演化,不互相依赖。AI 注意力受限时,解耦设计能最大化并发优势,避免系统崩溃。

05日常场景 DSH 到底能做什么

📝

小事直接干,不折腾

「帮我把这个文件改一下。」——AI 直接上手就做,不搞流程、不折腾。普通任务走直接执行模式,一步到位。

🎯

大事定目标,KPI 驱动

「给我写一个完整项目。」——进入 Goal 模式,Agent 会持续多轮自主执行,直到目标达成才收工。就像带了个 KPI,没完成不许下班。

复杂任务并行,效率拉满

「同时分析 10 份合同,提取风险条款并生成对比报告。」——Workflow 模式用 JavaScript 编排多个 Agent,并行执行,互不干扰。AI 注意力有限?没关系,每个模块是独立的小任务,分头指挥、同时推进。

注:以上场景均基于 DSH 的四套执行模式——普通/Goal/子 Agent/Workflow,开发者可根据任务复杂度自由选择。

编辑核心判断

DSH 的"一切皆插件"不只是一个架构选择——它第一次让 Agent 框架具备了"自进化"的能力:任何模块都可以独立升级、独立替换,而不需要推倒整个系统。当模型定价权掌握在厂商手中时,架构层面的效率优化才是用户真正能掌控的变量。涨价不可避免,但 DSH 让每一分钱都花在刀刃上。

现在就能用

DSH 已开源,可在 GitHub 搜索 "DeepSeek Harness" 获取。需要 node.js 环境,通过 npm 安装。V4 Pro 正式版已在 DeepSeek API 上线,登录官网即可体验。

deepseek.com → 体验 V4 Pro

DSH 安装指引:GitHub 搜索 DeepSeek Harness,按 README 配置即可