AI 开始制造 AI 了:DeepSeek 发布 Harness,押注递归式自我改进
上周,DeepSeek 正式发布 DeepSeek Harness(DSH)开发者预览版——一个让 AI 参与制造更强 AI 的工程底座,也是梁文锋对 RSI(递归式自我改进)路线最清晰的一次落点。尽管姗姗来迟、被吐槽"半成品",它依然让 AI 圈重新兴奋了起来。
上周,DeepSeek 正式发布 DeepSeek Harness(DSH)开发者预览版——一个让 AI 参与制造更强 AI 的工程底座,也是梁文锋对 RSI(递归式自我改进)路线最清晰的一次落点。尽管姗姗来迟、被吐槽"半成品",它依然让 AI 圈重新兴奋了起来。
在 Codex、Claude Code、Kimi、Hy 都有了各自的 Harness 之后,DeepSeek 上周终于推出 DeepSeek Harness(DSH)。它只是一个开发者预览版,定位却不含糊:给 AI 一个能安全修改自己、迭代自己的工程环境。
单看发布本身,DSH 算不上惊艳。真正让 AI 圈兴奋的,是它背后那张路线图。
梁文锋在 7 月底的内部四小时发言里,把 AI 的发展比作一级一级的阶梯:
注:前四阶已有较成熟的产品形态;"自我迭代"正是 DSH 所在的层级,再往上就是梁文锋所说的"奇点"。
他的原话是:"AI 的自我迭代,将会带领大家走到一个奇点。"
他还说了一句更反常识的话:"第一目标不是大家用得好用,而是我们自己用得好用。"
模型做出来,第一目标不是给用户用?梁文锋的解释是:模型先服务于 DeepSeek 自己,这是实现 AGI 最快的办法。AGI 是目标,RSI 是手段——让 AI 自己参与造更强的 AI,再用更强的 AI 加速下一轮改进,循环往复。
要让 AI 敢对自己动手,得先解决一个行业老难题:传统插件系统擅长把插件装上,却几乎无法在不重启进程的前提下,把插件留下的影响干净地撤掉。
这对一个需要持续自进化的 Agent 来说是致命的——环境里塞满工具、权限、沙箱、记忆、会话状态,每次修改都要求整个系统重启,持续运行就被打断;一次失败的修改,还可能把系统带进无法恢复的中间状态。
所以 DSH 的第一步,不是让 AI 变聪明,而是让 AI 敢犯错。
注:对比维度为插件生命周期管理。Cordis 对应论文中的 temporal / spatial composability(时间与空间可组合性)。
这套机制出自 DeepSeek 与北京大学联合发布的论文《A Programming Paradigm for Spatiotemporal Composability》。更关键的是,它并非纸上谈兵——Cordis 的思路已在开源机器人框架 Koishi 里跑了 4 年,4000+ 社区插件每天都在使用。
当自我修改变成一种可以持续、可以失败、也可以回退的工程过程,AI 自我进化才算真正有了能落脚的土壤。
RSI 不是 DeepSeek 一家的事。谷歌 DeepMind 掌门人哈萨比斯 7 月表态:大多数前沿实验室都在致力于研究 RSI。一个月后,DeepMind 首席战略官 Jasjeet Sekhon 说得更直接:RSI 正成为 AI 资本开支的核心投资逻辑。
他的比喻很妙:"当年人类正是依靠蒸汽机来制造新一代蒸汽机。"
官方标题直指 RSI。早期模型自己搭 harness,分析失败轨迹、修改脚手架代码、跑评测、决定保留或回退,循环 100 多轮后内部评测提升 3 成。
腾讯发布 Hyra-1.0,官方称能递归自我改进、面向研究与工程任务;OpenAI 在 GPT-5.6 发布说明中新增 RSI-Index 指标,专门衡量模型的自进化程度。
在 Google 待了 27 年的 Jeff Dean 离职,带走几位研究员创办新公司,目标直指递归式自我改进。
Anthropic 联合创始人 Jack Clark 同期给出预测:RSI 有 60% 概率在 2028 年底之前发生。
注:时间线按各公司公开表态与产品发布排序,事件密度不代表研发进度;"最近"以报道发布时点为准。
Anthropic 的押注同样激进。它今年成立的 Anthropic Institute 将 RSI 列为核心方向之一;在 "Weak-to-Strong 自动化研究者" 实验中,多个 Claude 驱动的 Agent 自主提出假设、设计并运行实验、分析结果再迭代,在一个 AI 对齐问题上取得了优于人工研究者的结果。
而离"已经在用"最近的,是谷歌的 AlphaEvolve。它已运行一年多,机制不复杂:让 Gemini 生成一批程序,交给自动评估器运行、验证、打分,保留表现好的方案进入下一轮——评价环节也完全自动化,无需工程师插手。
注:以上为谷歌公布的自有数据。AlphaEvolve 目前主要用于优化自家计算基础设施,与"通用自我改进"仍有距离。
RSI 不只是技术命题,它正在改写 AI 公司的竞争逻辑。过去,行业把模型发布当作能力变化的时间节点:新模型上线、跑一轮榜单、行业重新排队。现在,单次发布越来越难以代表一家公司的长期能力——能力的成长发生在发布之后。
竞争焦点,正在从"参数有多大"转向"循环有多快"。
RSI 的基本设想是让 AI 进入一个能持续改进的循环,这对基础设施提出了三重新要求:
模型要进入真实任务,能行动、能修改、能验证,在实际工作中暴露问题。
系统要可靠判断一次修改是解决了问题,还是只让某个指标暂时变好。
上一轮结果进入下一轮,方案可反复运行、比较、回退,失败也能重来。
用这个逻辑回看马斯克 600 亿美元收购 Cursor 的新闻,一切都说得通了。SEC 文件给出的收购理由是:软件开发同时具备高质量结构化数据、快速反馈周期和高频使用。用户用 AI 写代码时,Cursor 会记录它在哪一步卡住、如何补救——这些行为轨迹,反过来就是训练模型的最佳数据。
马斯克真正买下的不是一款编辑器,而是 AI 进入真实工作环境后的反馈与循环。接下来,会有更多公司复制这套打法:通过收购拿到高价值场景、产品入口与用户规模,把循环攥在自己手里。
兴奋归兴奋,先泼一盆冷水:DSH 现在确实不好用。
发布几天后,已有用户吐槽它部署繁琐、配置复杂,体验上像是一个"半成品"。
学术界的质疑更根本。华盛顿大学教授 Pedro Domingos 指出,从 LISP 在 1950 年代出现开始,AI 就具备某种构建自身的能力。自我改进究竟带来递增回报还是递减回报?在他看来,目前没有足够证据证明前者。
1965 年,数学家 I.J. 古德写下:"第一台超智能机器,将是人类最后一项发明。"——但他附了一个前提:机器得一直肯听人的话,人可以随时关掉它。
如果 AI 真的通过 RSI 实现能力指数级增长,人类还攥不攥得住那个开关?这个问题,比任何技术细节都更难回答。
RSI 真正的门槛,不是模型够不够强,而是有没有一块允许 AI 反复试错、随时回退的工程底座。
DSH 目前为开发者预览版,可在 DeepSeek 官方渠道获取。部署需要 Docker 环境与一定工程基础——普通用户建议观望,开发者可以上手体验"AI 自我进化"的第一块积木。
🛠 面向开发者 · 建议具备容器与 Agent 工程经验