说好多模态不是主线,他却发了视觉模型——DeepSeek V4 Flash Vision Exp 的 Agent 宣言
2026 年 8 月 21 日,DeepSeek 上线了 V4 Flash Vision Exp,一个多模态视觉理解模型。没有技术报告,没有开源,只有一张性能表和几个演示案例。但评测列表里放的,全是 Agent 基准。
注:三项核心指标分别对应发布日期、Agent 工程基准与软件工程基准,均为官方公开数据。
2026 年 8 月 21 日,DeepSeek 上线了 V4 Flash Vision Exp,一个多模态视觉理解模型。没有技术报告,没有开源,只有一张性能表和几个演示案例。但评测列表里放的,全是 Agent 基准。
注:三项核心指标分别对应发布日期、Agent 工程基准与软件工程基准,均为官方公开数据。
8 月 21 日,DeepSeek 上线了 V4 Flash Vision Exp。与 V4 Flash 和 V4 Pro 不同,这个模型没有技术报告,没有开源,官方只给了一张性能表和几个演示案例。
它不像 DeepSeek OCR 那样只是一个"组件"——它更像是一个"主线"模型。
但梁文锋的观点并没有改变。他在此前明确表示,多模态对产品很重要,但对智能的上限而言,它是一个组件,不是主线本身。V4 Flash Vision Exp 所做的事,正是把多模态嵌入到 Agent 与推理这条主线上。
发布时展示 MMMU、MathVista、DocVQA、ChartQA、OCRBench——考"看图答题"。
评测列表放的是 Terminal Bench、DeepSWE、Chartography、ApexBench——考"看完图,把事做下去"。
注:对比揭示了两类模型的核心差异——前者评估识别能力,后者评估 Agent 执行力。
V4 Flash Vision Exp 的评测列表,透露了它的真实定位。传统的多模态基准一个都没放,取而代之的是清一色的 Agent 方向:
注:柱形为相对示意,非精确比例;分数标注以官方数据为准。全部基准均围绕"执行任务"而非"识别内容"设计。
这张跑分图本身就是一种暗示。DeepSeek 想传递的信息是:多模态从来不是让你"看图聊天",而是让 Agent 看懂网页截图、读懂图表数据、理解 UI 布局,然后把任务做下去。
4 月 29 日,DeepSeek 多模态负责人 陈小康 预告了多模态识图功能的灰度测试。第二天,一篇论文《Thinking with Visual Primitives》发布,随后被删除——但社区保留了拷贝。
这篇论文的核心思想:模型能看见,但不一定能想清楚。
传统多模态模型用自然语言描述图片里的对象,比如"左边那个男的""右边那个高的"。在复杂场景中,这种描述非常模糊,模型容易越推越乱。DeepSeek 的解法,是把 点坐标和边界框提升为"思维的最小单元",直接嵌进推理链。
6 月,DeepSeek 在客户端和网页端上线的 Vision 模式,底层就是这套机制。V4 Flash Vision Exp 则是把同一技术嫁接到 API 基座上,重点强化多模态 Agent 能力。
V4 Flash Vision Exp 不是孤立的模型发布。同一天,DSH(DeepSeek Harness)更新了 rc.8 版本,多模态能力"两条腿走路":
底层模型声明支持视觉输入时,图片原封不动送进模型,不做任何中间加工。
纯文本模型自动降级为 OCR + 结构化信息提取,拆成证据后交给模型推理。
rc.8 之前,DSH 连"伪视觉"都没有,全靠社区插件补位。如今两条腿并行,意味着 DeepSeek 在多模态 Agent 这条路上,正在从"借别人的眼睛"走向"用自己的眼睛"。
社区也在补足最后一公里。
DSH 的开源生态催生了多个第三方项目:一键安装的桌面版、侧边栏增强插件、插件市场搜索雷达。这些项目降低了 DSH 的使用门槛,也在反向推动官方完善产品体验。
注:链路展示 DSH 多模态 Agent 的完整工作流,视觉理解不再是孤立的"识别"环节,而是推理链的一部分。
多模态从来不是目的,而是手段。DeepSeek V4 Flash Vision Exp 的真正价值,不是让模型"看图聊天",而是让 Agent 看懂世界之后,把任务做下去。在 Agent 时代,视觉理解能力正在成为推理链上的一环——谁先把它嵌入闭环,谁就多一张底牌。
V4 Flash Vision Exp 已通过 DeepSeek API 上线,Vision 模式同步在官网与客户端开放。点选「Vision」即可体验视觉原语驱动的 Agent 能力。
DeepSeek 官网 → 开启 Vision