⚙️ 智能体 · 框架竞赛

DeepSeek Harness 开源一周迭代两版,Agent 框架竞赛进入"工程外壳"时代

8月13日,DeepSeek 正式开源 AI Agent 框架 DeepSeek Harness,一周内迭代两个版本。阿里、腾讯、MiniMax 等厂商相继跟进,Harness 概念从技术圈走向全面产品化,成为 AI 落地的新战场。业内认为,Harness 工程能力正在成为决定 Agent 表现的关键因素。

综合公开信息整理 2026-08-15 全文约 4 分钟读完
#DeepSeek Harness #AI Agent #Harness #工程化落地
📅 2025.08.13 DeepSeek Harness 正式开源
2版/周 开源后迭代速度
33 一次性开放岗位扩军
30 秒速览
  • Harness 是什么:模型之外的"工程外壳",负责让"会思考"的模型"动手干活"——Model + Harness = Agent
  • 热潮:DeepSeek Harness 开源一周迭代两版,国家超算互联网、腾讯 QQ、企微、阿里云、企查查等 7+ 家厂商相继接入。
  • 产品化提速:DeepSeek 组建专项团队,由梁文锋校友崔添翼主导,目标做出对标 Claude Code 的产品。
  • 核心价值:没有 Harness,模型是"聪明但不可预测"的黑箱;有了 Harness,模型才能在约束边界内稳定输出、可审计、可复用
  • 冷静一面:运行不稳定、配置繁琐、缺少评估共识,Harness 本身仍在"边跑边迭代",争议事件也暴露了行业标准缺失。

01Harness:模型之外的"工程外壳"

Harness 并非新鲜概念,但今年 8 月之前,它更多停留在工程圈内。简单来说,Harness 是编排 AI 工作流、管理提示词模板、系统化评估模型输出的一套执行框架。DeepSeek 官方将其定义为模型之外的"工程外壳",负责让"会思考"的模型"动手干活"。

传统方式:模型直接输出

模型给出答案,但过程不可控、不可复用、不可审计。每次调用都是"黑箱",难以规模化落地。

Harness 方式:工程外壳

任务拆解→工具调用→结果验证→可回滚。全程可审计、可复现、可管理,适合企业级生产流程。

对比:Harness 的核心差异在于"过程可控"——从模型直接输出变为"工程外壳+模型"的协同工作方式。

北大青鸟人工智能研究院肖睿团队在一份报告中指出:"没有 Harness,再强的模型也只是'聪明但不可预测'的黑箱;有了 Harness,模型才能在约束边界内稳定输出。" 这正是 AI 能力规模化转化为生产力的关键。

7+生态伙伴接入
2版/周迭代速度
33扩军岗位数
100万行代码/5月(OpenAI)

注:右下标数据来自 OpenAI 内部案例——3-7人团队、零人工代码起步、5个月生成100万行代码,被视为 Harness 工程能力的标杆。

02生态扩圈:从技术名词到产品浪潮

8 月成为 Harness 概念走向全面产品化的转折点。从 DeepSeek 开源到多家厂商接入,只用了不到两周。

已接入或推出 Harness 的厂商:

DeepSeek 阿里 Qoder 腾讯 QQ 企业微信 阿里云 企查查 国家超算互联网 MiniMax

注:8月20日 MiniMax 发布 Agent 工作台 MiniMax Design,聚焦电商、教育及创意短片场景,是其 H3 多模态模型开源后的首个 Harness 产品。

这一波热潮的起点可以追溯到今年 3-4 月,当时 OpenAI 内部通过 Harness 实现"3-7人团队、零人工代码、5个月、100万行代码"的案例,以及 Anthropic 连续发文强调"Harness 决定 Agent 表现"的观点,让这个词开始进入公众视野。

2025.03 Harness概念流行 05 月 DeepSeek组建专项团队 07 月 阿里开源 Better Harness 08.13 DeepSeek Harness 开源 08.20 MiniMax 发布 Design

时间线:Harness 从技术概念到产品化浪潮的关键节点。

汤道生(腾讯集团高级执行副总裁)今年 3 月即指出:"AI 落地的关键是 Harness 工程能力。" 这一论断在 8 月的热潮中反复被验证。

03两个案例:Harness 的产品化之路

🧩 DeepSeek Harness:从团队组建到开源只用了3个月产品化标杆

  • 去年 4 月:DeepSeek 首次公开发布产品经理类岗位招聘,产品化意识萌芽。
  • 今年 5 月:内部立项组建 Harness 专项团队,招聘 Agent Harness 产品经理、研发工程师等核心岗位。
  • 6 月:一次性开放 33 个岗位,产品类岗位明显增多且细化,覆盖办公、生活、法律、医学等场景。
  • 8 月 13 日:DeepSeek Harness 正式开源,一周内迭代两个版本,提供多种使用方式和运行模式。
  • 目标:做出对标 Claude Code 的产品,并以 Harness 为底座推出桌面应用和更广泛场景的产品。
关键判断:从招聘产品经理到开源 Harness,历时仅 16 个月——产品化速度远超行业预期,工程团队执行力是核心壁垒。

🏭 OpenAI 内部实践:Harness 让 3-7 人团队 5 个月生成 100 万行代码

  • 团队规模仅 3-7 人,零人工代码起步,完全依赖 Harness 编排 AI 工作流。
  • 5 个月内生成 100 万行生产级代码,全程可审计、可回滚、可管理。
  • Harness 沉淀了可复用的记忆与工作流模板,使 AI 能力从"一次性输出"变为"可规模化的生产力"。
  • 这一案例被业界视为 Harness 工程能力的"北极星",直接推动了 Anthropic 和国内厂商的跟进。
启示:Harness 的核心价值不是"让模型更强",而是"让模型的能力可以被可靠地组织、复制和审计"——这是 AI 从工具走向基础设施的必经之路。

04为什么是 DeepSeek 做出来了?

答案藏在两个关键词里:意图理解基因量化工程文化

搜索引擎本身就是最早的 Agent 雏形——接收意图、拆解任务、调用工具、验证结果,这条链路 DeepSeek 的团队已经跑了二十余年。变化的只是工具集从索引爬虫升级为代码执行环境与实时 API,输出从蓝链变成结构化报告。

更重要的是,DeepSeek 将 Harness 团队交给了 崔添翼——梁文锋的校友,长期在量化机构从事开发工作。量化交易对"工程外壳"的要求极高:低延迟、高可靠、可回测、可审计。这种工程文化天然适配 Harness 的研发逻辑。

搜索引擎基因 意图理解能力 量化工程文化 Harness 专项团队 产品化落地

DeepSeek 的 Harness 路径:从搜索架构到 Agent 框架,底层逻辑一脉相承。

从招聘节奏也能看出战略决心:去年 4 月首次招产品经理,今年 5 月组建 Harness 专项团队,6 月一次性开放 33 个岗位,8 月开源——每一步都踩在点上。业内此前曾传闻 DeepSeek 会在 V4 大模型发布后大刀阔斧推进产品化,虽然当时并未应验,但 Harness 的亮相证明了其产品化的真正方向。

05Harness 的"毛边":热潮之下的冷静审视

热潮之下,一个诚实的注脚是:Harness 本身仍在"边跑边迭代"的阶段,远未成熟。

从开发者社区的反馈来看,各类 Harness 产品普遍面临几个问题:

⚠️ 开发者核心吐槽

运行不稳定、功能逻辑不连贯、"毛边随处可见"、缺少人性化细节、配置繁琐易错。一位开发者评价目前国内的 Harness 产品更像"项目制工具",仍需要复杂调试、适配,无法标准化复用。

🔍 争议事件:J-Space 声称"Harness 让模型性能飞跃"被质疑造假

一个名为 J-Space Cognition Suite 的项目声称,仅通过一套 Harness 就能让 DeepSeek V4-Pro 的性能大幅提升,甚至超越性能最顶尖的 Fable 5。但随后就有开发者质疑其数据造假、无法复现、Token 消耗翻倍。

这一事件暴露了行业核心问题:Harness 的效果评估缺乏共识和标准,容易产生泡沫与误导。

对于如何评估 Harness 的效果,目前开发者社区甚至没有基本的共识框架。是看任务完成率?Token 效率?还是可复用性?没有标准,就没有比较;没有比较,所谓的"最优"就只能是自说自话。

编辑核心判断

Harness 是 AI 从"聪明工具"走向"可靠生产力"的必经工程路径,但行业当前最大的风险不是"做不做 Harness",而是"用泡沫标准替代真实效果评估"。J-Space 争议是一个警示:没有可复现、可审计的评测共识,Harness 就会从工程答案变成营销话术。真正的分水岭,不在于谁先开源,而在于谁能通过真实业务数据的持续迭代,沉淀出一套可标准化复用的工程方法论。

现在就能用

DeepSeek Harness 已全面开源,开发者可前往官方仓库下载体验。核心技术已应用于 DeepSeek 系列产品,生态伙伴陆续接入中。

deepseek-ai/DeepSeek-Harness → 开源仓库

MiniMax Design 亦已开放 Agent 工作台内测,聚焦电商、教育及创意短片场景。