开源 Agent 框架静默上线:1817 词长提示词翻车,删到一句目标反而跑通
DeepSeek 在 V4 Pro 正式版上线后开源 Harness 开发者预览版,把模型、工具、文件、沙箱与任务编排拆成可替换组件。一次对照测试显示:同一模型、同一环境,仅改变提示词长度,结果便从粗糙失控反转为完整可运行。
DeepSeek 在 V4 Pro 正式版上线后开源 Harness 开发者预览版,把模型、工具、文件、沙箱与任务编排拆成可替换组件。一次对照测试显示:同一模型、同一环境,仅改变提示词长度,结果便从粗糙失控反转为完整可运行。
这次更新没有发布会,也没有提前预告。V4 Pro 正式版以“0813”为编号出现在 API 文档中,随后首页横幅与开放平台公告突然消失。开发者仍然可以调用模型,但官方没有立即解释原因。
真正的主角,很快从模型变成了 Harness。
编号为“0813”的模型进入 API 文档,开发者开始进行实际调用;与此同时,围绕体验、跑分与价格的讨论迅速升温。
官网横幅和开放平台公告被撤回。开发者随后发现代码仓库出现密集修补,外界据此推测前端接口、推理栈与权重配置之间可能存在错位。
正式版公告重新发布,同时开源 DeepSeek Harness 开发者预览版,事件从一次模型发布转向一次 Agent 基础设施亮相。
注:时间线只呈现公开可确认的动作;关于代码仓库修补原因的部分属于开发者观察与推测,不等同于官方故障说明。
DeepSeek 给出的公式是 Model + Harness = Agent。模型负责理解意图、推理与生成,但纯语言模型只能输出文本;它无法天然打开文件、修改数据库、浏览网页,也不能独立处理权限、状态与运行环境。
负责理解任务、规划步骤、生成判断与代码,但自身并不拥有稳定的外部行动能力。
负责把模型的判断变成可执行、可观察、可回溯的动作。
注:这里的“模型”和“Harness”不是二选一;前者决定思考上限,后者决定思考能否在真实环境中稳定落地。
这也解释了为什么同一模型接入不同执行框架,速度、缓存与任务完成效果会不同。此次测试中,Harness 内的响应速度快于前一日通过 Claude Code 接入的版本,缓存命中率也从 98% 提升到 99%。
注:缓存提升来自此次测试环境对比,并非公开标准基准;在长上下文任务中,命中率变化通常会同时影响成本与生成速度。
测试选择了《指环王》第一章前段的完整文字:从比尔博宣布 111 岁生日宴会,到霍比屯居民议论,再到弗罗多的身世往事,共计 1817 个词、23 段。任务不是生成一张图片,而是读懂文学、理解世界,再用 Three.js 搭出一个可运行的 3D 场景。
注:案例结果来自单次编辑测试,不代表模型在所有复杂创作任务中都更适合短提示词;它更准确地说明了“目标驱动”在本次任务中的优势。
这个反差给提示词工程带来一个新问题:顶级模型是否正在从“按剧本执行”,转向“理解目标后自行组织”?至少在这次测试里,写得越细并没有带来更高的确定性。
DeepSeek Harness 的核心理念是“一切皆插件”:模型、工具,甚至最核心的 Agent Loop,都被拆成可以独立组合的组件。开发者不必接受一套不可修改的内部流程,而是可以通过配置文件重新安排调用关系。
通过“可逆效应”记录组件加载产生的副作用,并在卸载时自动撤销;怎么加载,系统就能推导出怎么卸载。
通过“响应式共效应”进行声明式依赖管理,组件只需声明需求,运行时自动协调依赖的激活与停用。
注:这条链路描述的是 Harness 的工程抽象,不是用户操作步骤;重点在于组件的加载、替换与卸载都拥有明确边界。
最终形成的是一个无特权核心:没有哪个组件天然拥有不可替代的地位,Agent 主循环本身也可以被替换。可控、可观测、可回溯,正是模型从“会回答”走向“能干活”时缺失的三种系统能力。
注:矩阵中的能力是框架设计目标与已展示特征的归纳,不等于开发者预览版已经覆盖成熟产品的全部稳定性要求。
OpenAI、Anthropic 等公司更倾向于向下整合:用深度绑定自家模型的 Harness 把体验做完整。DeepSeek 选择的是另一条路——把 Harness 做成模型中立、模块化、可开源的底层标准,横向吸引插件、运行时、编排框架与多智能体调度系统。
注:这些方向来自公开披露的内测项目线索与框架定位,不能视为完整的产品路线图。
这套策略同时包含技术理想与商业算盘:先用开源 Harness 修建一条免费高速公路,吸引开发者与真实任务进入;再通过模型性能、API 调用与生态适配完成商业变现。模型、开源、Harness 与价格动作放在一起看,逻辑就不再只是一次技术发布。
注:飞轮是基于产品机制的推演,不代表已经形成规模化闭环;数据回流还涉及隐私、授权、质量筛选与训练合规等现实条件。
更现实的判断是:短期内,Harness 对普通用户的直接提效有限,它还不像成熟办公 Agent 那样开箱即用。真正的长期价值,取决于插件生态是否足够丰富、运行轨迹是否足够可靠,以及模型升级后能否无需大量二次适配就释放到整个系统。
DeepSeek Harness 的关键贡献,不是证明某个模型突然无所不能,而是把 Agent 的执行层从黑箱拆成了可观察、可替换的工程组件;但开发者预览版的稳定性、生态规模和商业边界仍未经过长期验证。Agent 基础设施的竞争,最终会从“谁的模型最强”转向“谁能让模型在真实任务中被安全、透明、低成本地反复调用”。
原文给出的方式是使用 npm 安装开发者预览版,并启动 Web 界面。
若启动卡住,可先执行 npm install -g @deepseek-ai/dsh,再重新运行启动命令。当前版本更适合开发者测试,不宜直接当作成熟办公产品使用。