🔧 模型更新 · 开源动态

DeepSeek Harness 昨夜发布重大更新:14项调整补齐多模态,纯文本模型也能"看图"做任务

8 月 20 日,DeepSeek Harness 迎来公测后首次重要版本迭代——v0.1.0-rc.8 正式上线,多模态能力成为本次更新的重头戏。14 项调整覆盖多模态输入、子代理协作、终端体验、工具调用与开发者支持五大方向,Agent 工作流从纯文本正式迈向图文混合。

综合公开信息整理 2026-08-20 全文约 3 分钟读完
#DeepSeek Harness #多模态 Agent #开源 #v0.1.0-rc.8
14 项调整 v0.1.0-rc.8 版本 · 公测后首次大更新
🖼️ 多模态 原生图片请求 · 图文混合输入
🤖 子代理扩展 Claude Code · Codex 按需接入

⚡ 30 秒速览

  • 版本更新:rc.8 带来 14 项调整,覆盖多模态输入、子代理协作、终端体验、工具调用与开发者支持五大方向。
  • 多模态能力:支持原生图片请求与图文混合输入,/goal、/plan 等命令可直接接收图片,Agent 工作流进入图文时代。
  • 工具层视觉:当模型不支持图像输入时,Harness 自动退化到 OCR + 像素扫描 + 颜色统计,为纯文本模型"拼出"视觉能力。
  • 插件化架构:Claude Code、Codex 作为子代理按需安装,模型、工具、技能、沙箱均可由插件组合替换。

0114项调整一览 五大方向,各司其职

从 8 月 13 日公测到 rc.8,仅过去不到一周。这次更新不是小修小补,而是系统性地补齐了多模态能力,同时优化了子代理协作与终端体验。以下是五大方向的具体改进:

4 多模态输入
原生图片请求
图文混合
3 子代理协作
Claude Code
Codex 接入
3 终端体验
Windows PTY
持久化会话
2 工具调用
web_search 并发
报告唤醒
2 开发者支持
自定义网关修复
性能优化

数字格展示了 rc.8 版本在 5 个主要方向的改进项数量,总计 14 项调整。每个方向内的改进项按官方更新日志归类统计。

但数据只是框架的骨架。真正的变化,藏在多模态能力的补齐方式里。

02多模态:Agent 终于能"看见"了 原生图片请求 + 图文混合输入

rc.8 最明显的变化,就是 DeepSeek Harness 正式补齐了多模态输入。对于具备视觉能力的模型,Harness 可以直接把图片送进模型;/goal、/plan 等指令也已支持图文混合输入。同时,输入框中的 @菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。

这意味着,过去主要围绕文本、代码和工具调用展开的 Agent 工作流,现在可以把截图、图片等视觉信息纳入任务上下文

🖼️ 原生图片请求 📎 图文混合输入 🎯 /goal 支持图片 📋 /plan 支持图片 📁 @菜单文件引用 💬 会话引用 🧩 子代理视觉

标签云展示了 rc.8 在多模态方向的核心能力项,深色标签为本次更新中最关键的突破。

更新发布后,社区反应迅速。国内开发者感叹"DSH 支持多模态了,奔走相告",海外开发者同样把注意力放在这两项能力上,认为 DeepSeek Harness 正变得"越来越有意思"。

"DSH 支持多模态了,奔走相告!" —— 国内开发者
"越来越有意思了。多模态支持和更完善的子代理集成是一次明显推进。" —— 海外开发者

但真正让技术社区兴奋的,不是多模态本身,而是 Harness 为纯文本模型"拼出"视觉能力的独特方式。

03纯文本模型的"眼睛" 工具层视觉:OCR · 像素扫描 · 颜色统计

一个被开发者 Yinsen 扒出的细节,揭开了 DeepSeek Harness 最有趣的设计之一:当所调用的模型本身不支持图像输入时,直接调用 read_image 会首先失败——但任务并没有就此停下。

Harness 会退化到另一套工具链:

纯文本模型处理图片

先进行 OCR 文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。最后将结构化结果交给文本模型推理。

相当于给纯文本模型拼出一套工具层的"视觉"。

视觉模型处理图片

直接接收图片,通过视觉编码器理解图像内容,端到端完成推理。

原生视觉能力,无需工具层辅助。

对比卡展示了两种图片处理路径的差异。工具层视觉方案对于 PPT 截图、流程图、界面截图等结构明确的图片效果显著,但面对真实照片、复杂空间关系时,信息恢复能力受限于工具链的精度。

一个诚实的注脚:这种能力和视觉大模型直接理解图片仍然有明显区别。但对于 Agent Harness 而言,视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作——这个设计思路,比多模态本身更值得关注。

04一切皆可插拔 模型、工具、子代理,全部插件化

rc.8 继续强化了 DeepSeek Harness 自公测时就确立的核心设计思路:"一切皆插件"。模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力,都可以由不同插件组合和替换。

本次更新中,Claude Code 和 Codex 正式作为子代理接入 Harness 体系,支持按需安装。其中 Codex 支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同子代理。

接收意图 拆解任务 调用子代理 执行工具 验证结果

调用链展示了 DeepSeek Harness 的任务执行流程。其中"调用子代理"环节在 rc.8 中新增了 Claude Code 与 Codex 两个选项,使 Agent 可以根据任务类型动态选择最合适的子代理。

当 Agent Harness 拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。这背后的逻辑是:优秀的系统架构与工程实现,能显著释放模型潜力。

同一底座模型搭载不同框架,最终得分会拉开明显差距——这个观点在 PinchBench 等综合评测中已被反复验证。而 DeepSeek Harness 的插件化架构,正在将这种"框架红利"推向极致。

编辑核心判断

当工具层可以"拼出"视觉能力,模型的边界就不再是能力的边界。
Agent 框架的工程能力,正在成为比模型参数更重要的竞争维度。

现在就体验

rc.8 已正式发布并同步开源,所有更新细节与完整发布说明可在 GitHub 仓库查看。

GitHub 仓库 → 查看发布说明