DeepSeek Harness 昨夜发布重大更新:14项调整补齐多模态,纯文本模型也能"看图"做任务
8 月 20 日,DeepSeek Harness 迎来公测后首次重要版本迭代——v0.1.0-rc.8 正式上线,多模态能力成为本次更新的重头戏。14 项调整覆盖多模态输入、子代理协作、终端体验、工具调用与开发者支持五大方向,Agent 工作流从纯文本正式迈向图文混合。
8 月 20 日,DeepSeek Harness 迎来公测后首次重要版本迭代——v0.1.0-rc.8 正式上线,多模态能力成为本次更新的重头戏。14 项调整覆盖多模态输入、子代理协作、终端体验、工具调用与开发者支持五大方向,Agent 工作流从纯文本正式迈向图文混合。
从 8 月 13 日公测到 rc.8,仅过去不到一周。这次更新不是小修小补,而是系统性地补齐了多模态能力,同时优化了子代理协作与终端体验。以下是五大方向的具体改进:
数字格展示了 rc.8 版本在 5 个主要方向的改进项数量,总计 14 项调整。每个方向内的改进项按官方更新日志归类统计。
但数据只是框架的骨架。真正的变化,藏在多模态能力的补齐方式里。
rc.8 最明显的变化,就是 DeepSeek Harness 正式补齐了多模态输入。对于具备视觉能力的模型,Harness 可以直接把图片送进模型;/goal、/plan 等指令也已支持图文混合输入。同时,输入框中的 @菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。
这意味着,过去主要围绕文本、代码和工具调用展开的 Agent 工作流,现在可以把截图、图片等视觉信息纳入任务上下文。
标签云展示了 rc.8 在多模态方向的核心能力项,深色标签为本次更新中最关键的突破。
更新发布后,社区反应迅速。国内开发者感叹"DSH 支持多模态了,奔走相告",海外开发者同样把注意力放在这两项能力上,认为 DeepSeek Harness 正变得"越来越有意思"。
但真正让技术社区兴奋的,不是多模态本身,而是 Harness 为纯文本模型"拼出"视觉能力的独特方式。
一个被开发者 Yinsen 扒出的细节,揭开了 DeepSeek Harness 最有趣的设计之一:当所调用的模型本身不支持图像输入时,直接调用 read_image 会首先失败——但任务并没有就此停下。
Harness 会退化到另一套工具链:
先进行 OCR 文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。最后将结构化结果交给文本模型推理。
直接接收图片,通过视觉编码器理解图像内容,端到端完成推理。
对比卡展示了两种图片处理路径的差异。工具层视觉方案对于 PPT 截图、流程图、界面截图等结构明确的图片效果显著,但面对真实照片、复杂空间关系时,信息恢复能力受限于工具链的精度。
一个诚实的注脚:这种能力和视觉大模型直接理解图片仍然有明显区别。但对于 Agent Harness 而言,视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作——这个设计思路,比多模态本身更值得关注。
rc.8 继续强化了 DeepSeek Harness 自公测时就确立的核心设计思路:"一切皆插件"。模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等 Agent 能力,都可以由不同插件组合和替换。
本次更新中,Claude Code 和 Codex 正式作为子代理接入 Harness 体系,支持按需安装。其中 Codex 支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同子代理。
调用链展示了 DeepSeek Harness 的任务执行流程。其中"调用子代理"环节在 rc.8 中新增了 Claude Code 与 Codex 两个选项,使 Agent 可以根据任务类型动态选择最合适的子代理。
当 Agent Harness 拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。这背后的逻辑是:优秀的系统架构与工程实现,能显著释放模型潜力。
同一底座模型搭载不同框架,最终得分会拉开明显差距——这个观点在 PinchBench 等综合评测中已被反复验证。而 DeepSeek Harness 的插件化架构,正在将这种"框架红利"推向极致。
当工具层可以"拼出"视觉能力,模型的边界就不再是能力的边界。
Agent 框架的工程能力,正在成为比模型参数更重要的竞争维度。
rc.8 已正式发布并同步开源,所有更新细节与完整发布说明可在 GitHub 仓库查看。
GitHub 仓库 → 查看发布说明