🧠 模型 · 技术发布

说好多模态不是主线,他却发了视觉模型——DeepSeek V4 Flash Vision Exp 的 Agent 宣言

2026 年 8 月 21 日,DeepSeek 上线了 V4 Flash Vision Exp,一个多模态视觉理解模型。没有技术报告,没有开源,只有一张性能表和几个演示案例。但评测列表里放的,全是 Agent 基准

综合公开信息整理 2026-08-23 全文约 4 分钟读完
#DeepSeek #V4 Flash Vision Exp #多模态 #Agent #视觉原语
📅 8·21 上线日期 · 实验性模型
83.9 Terminal Bench 2.1
59.3 DeepSWE

注:三项核心指标分别对应发布日期、Agent 工程基准与软件工程基准,均为官方公开数据。

⚡ 30 秒速览

  • 矛盾?一致:梁文锋曾明确表示多模态不是 AGI 主线,V4 Flash Vision Exp 实际上是 Agent 主线的延伸——它刚好也是"多模态"。
  • 没有技术报告,没有开源:官方只给了一张性能表和几个演示案例,与 V4 Flash 和 V4 Pro 的发布方式截然不同。
  • 评测全是 Agent 方向:Terminal Bench 2.1(83.9)、DeepSWE(59.3)、Chartography、ApexBench——没有一项是传统"看图答题"。
  • 技术核心:视觉原语:把点坐标和边界框嵌入推理链,让模型从"左边那个男的"变成"我手指的这个"。
  • DSH 生态同步进化:rc.8 版本实现多模态"两条腿走路"——原生直通 + 工具层视觉,社区也在补足最后一公里。

01发布全景 实验性模型,用意不在"看图"

8 月 21 日,DeepSeek 上线了 V4 Flash Vision Exp。与 V4 Flash 和 V4 Pro 不同,这个模型没有技术报告,没有开源,官方只给了一张性能表和几个演示案例。

它不像 DeepSeek OCR 那样只是一个"组件"——它更像是一个"主线"模型。

但梁文锋的观点并没有改变。他在此前明确表示,多模态对产品很重要,但对智能的上限而言,它是一个组件,不是主线本身。V4 Flash Vision Exp 所做的事,正是把多模态嵌入到 Agent 与推理这条主线上。

传统多模态模型

发布时展示 MMMU、MathVista、DocVQA、ChartQA、OCRBench——考"看图答题"。

V4 Flash Vision Exp

评测列表放的是 Terminal Bench、DeepSWE、Chartography、ApexBench——考"看完图,把事做下去"。

注:对比揭示了两类模型的核心差异——前者评估识别能力,后者评估 Agent 执行力。

02评测信号 放什么基准,就说明它想成为什么

V4 Flash Vision Exp 的评测列表,透露了它的真实定位。传统的多模态基准一个都没放,取而代之的是清一色的 Agent 方向:

🥇 Terminal Bench 2.1Agent 工程基准
83.9
DeepSWE软件工程基准
59.3
Chartography专业图表决策
ApexBench多模态 Agent 基准
Agents' Last Exam通用 Agent 评测

注:柱形为相对示意,非精确比例;分数标注以官方数据为准。全部基准均围绕"执行任务"而非"识别内容"设计。

这张跑分图本身就是一种暗示。DeepSeek 想传递的信息是:多模态从来不是让你"看图聊天",而是让 Agent 看懂网页截图、读懂图表数据、理解 UI 布局,然后把任务做下去。

03技术解码 视觉原语:边推理边指向

4 月 29 日,DeepSeek 多模态负责人 陈小康 预告了多模态识图功能的灰度测试。第二天,一篇论文《Thinking with Visual Primitives》发布,随后被删除——但社区保留了拷贝。

这篇论文的核心思想:模型能看见,但不一定能想清楚。

传统多模态模型用自然语言描述图片里的对象,比如"左边那个男的""右边那个高的"。在复杂场景中,这种描述非常模糊,模型容易越推越乱。DeepSeek 的解法,是把 点坐标和边界框提升为"思维的最小单元",直接嵌进推理链。

🎯 从"左边那个男的"到"我手指的这个"

  • 传统方式:用自然语言描述对象位置,在多人场景中极易混淆,推理链越长越容易崩塌。
  • 视觉原语:把坐标和边界框作为推理单元,让模型在计数、空间推理、迷宫导航等任务上精确锚定到图像坐标。
  • 效果:就像人数东西时会伸出手指,一个一个点着数——模型边推理边指向,逻辑链条更稳。
技术验证:论文实验基于 DeepSeek-V4-Flash 作为语言骨干,V4 Flash Vision Exp 沿用了同一套方案。

6 月,DeepSeek 在客户端和网页端上线的 Vision 模式,底层就是这套机制。V4 Flash Vision Exp 则是把同一技术嫁接到 API 基座上,重点强化多模态 Agent 能力。

04产品版图 DSH 生态与社区的"最后一公里"

V4 Flash Vision Exp 不是孤立的模型发布。同一天,DSH(DeepSeek Harness)更新了 rc.8 版本,多模态能力"两条腿走路":

🦿 原生直通

底层模型声明支持视觉输入时,图片原封不动送进模型,不做任何中间加工。

GLMQwenV4-Flash-Vision-Exp

🛠️ 工具层视觉

纯文本模型自动降级为 OCR + 结构化信息提取,拆成证据后交给模型推理。

OCR颜色比例像素扫描

rc.8 之前,DSH 连"伪视觉"都没有,全靠社区插件补位。如今两条腿并行,意味着 DeepSeek 在多模态 Agent 这条路上,正在从"借别人的眼睛"走向"用自己的眼睛"。

社区也在补足最后一公里。

DSH 的开源生态催生了多个第三方项目:一键安装的桌面版、侧边栏增强插件、插件市场搜索雷达。这些项目降低了 DSH 的使用门槛,也在反向推动官方完善产品体验。

视觉输入理解画面决定行动调用工具验证结果

注:链路展示 DSH 多模态 Agent 的完整工作流,视觉理解不再是孤立的"识别"环节,而是推理链的一部分。

编辑核心判断

多模态从来不是目的,而是手段。DeepSeek V4 Flash Vision Exp 的真正价值,不是让模型"看图聊天",而是让 Agent 看懂世界之后,把任务做下去。在 Agent 时代,视觉理解能力正在成为推理链上的一环——谁先把它嵌入闭环,谁就多一张底牌。

现在就能用

V4 Flash Vision Exp 已通过 DeepSeek API 上线,Vision 模式同步在官网与客户端开放。点选「Vision」即可体验视觉原语驱动的 Agent 能力。

DeepSeek 官网 → 开启 Vision