🎯 多模态 · 模型上新

DeepSeek 多模态视觉模型上线:384 token 看懂《牛来》,26 秒截图变代码

8 月 21 日,DeepSeek V4-Flash-Vision-Exp 正式上线 API 平台,多模态能力接近 Opus-4.8,定价与 V4-Flash 一致,纯文本能力不降级。每张图片仅消耗 384 个 token,不到竞品一半。

综合公开信息整理 2026-08-22 全文约 4 分钟读完
#DeepSeek #多模态 #V4-Flash-Vision #视觉理解
384 每张图片 token 消耗,竞品 800–1100
接近 Opus-4.8 多模态 Agent Benchmark 表现
定价不变 与 V4-Flash 一致,无视觉溢价

⚡ 30 秒速览

  • 核心能力:多模态视觉理解,每张图仅占 384 token,不到 GPT/Claude 的一半。
  • 定价策略:与 V4-Flash 一致,按 token 计费,没有额外视觉处理溢价。
  • 纯文本能力:不降级,在 Agent、推理、世界知识等基准上与 V4-Flash 正式版持平。
  • Agent 表现:多模态 Agent 能力"已接近 Opus-4.8",相比纯文本版本大幅跃升。
  • 开发者注意:thinking 模式会吞掉全部输出预算,视觉任务中务必关闭或调大 max_tokens。

01关键能力 视觉理解 + 纯文本不降级

DeepSeek 此次上线的 Vision-Exp 不是"为看图牺牲了文本能力"的特化模型,而是在 Flash 基础上叠加了视觉理解。官方强调,在 Agent、推理、世界知识等纯文本基准上,Vision-Exp 与 V4-Flash 正式版持平。

它与传统多模态方案的区别在哪里?

传统多模态方案

将整张图拆成密集的图像 patch,每张图消耗 800–1100 个 token,视觉成本高,且常伴随文本能力下降。

DeepSeek Vision-Exp

基于"Thinking with Visual Primitives"框架,将视觉元素压缩为空间坐标式原语,384 token 完成理解,纯文本能力完整保留。

384每张图 token 消耗
≈ Opus-4.8多模态 Agent 能力
定价不变与 Flash 一致
Files API同步上线,免费使用

注:Files API 允许开发者先上传图片获取 file_id,同一张图多次调用无需重复传输,适合 Agent 工作流。

更关键的是,DeepSeek 选择先在 Flash 上试水视觉能力,而非旗舰 Pro。284B 参数的 MoE 模型推理成本远低于 1.6T 的 Pro,让多模态调用在经济上真正可行——每张图 384 token 的消耗,叠加 Flash 的低价基底,意味着开发者可以用极低的成本规模化使用视觉理解。

02它到底能做什么?两个真实测试

我们做了两个测试,从"看懂"到"动手"——视觉理解与代码生成叠加时,AI 能做的事情比单独拥有任何一项要多得多。

🎬 看懂《牛来》,35 秒画出一头萌系牛 384 token · 35 秒

  • 将《牛来》经典"妈妈"特写截图喂给模型,准确识别了牛的橙色配色、皱着眉毛、厚嘴唇和"既凶又委屈"的表情,还保留了画面底部的"妈妈"字幕。
  • 输出 SVG + CSS 代码,渲染出一头有渐变光泽、圆润线条的卡通牛——从"恐怖谷"直接跳到了"萌系"。
  • 整个过程仅 35 秒,图片消耗 384 个 token
网友说"AI 都比原片更像电影"——现在有了实锤。

🖥️ 看设计稿写代码,26 秒交付完整 HTML 26 秒 · 全匹配

  • 制作了一张支付产品 Landing Page 设计稿——深色渐变背景、导航栏、大标题、代码区域语法高亮、双按钮、三个 feature 卡片——截图喂给模型。
  • 26 秒后输出完整响应式 HTML,渐变背景色、导航栏布局、按钮样式、语法高亮颜色全部精确匹配,甚至自主添加了 hover 动效和入场动画。
  • 这个能力直接指向 Agent 核心场景:理解网页界面结构,把视觉稿快速变成前端代码。
视觉理解不再是"锦上添花",而是"能不能干活"的前提。

03为什么是 Flash?产品决策背后的逻辑

一个值得注意的产品决策是:DeepSeek 选择先在 Flash 上试水视觉能力,而不是旗舰 Pro。这不是能力不足,而是经济性与节奏感的双重考量

从成本看,Flash 是 284B 参数的 MoE 模型,推理成本远低于 1.6T 的 Pro。每张图片至少 384 token 的输入预算,如果叠加在 Pro 的定价上,成本会迅速膨胀。Flash 的低价基底让多模态调用在经济上可行。

从节奏看,就在前一天,DeepSeek Harness 框架刚发布了 RC.8 版本,新增了原生图片请求的支持。Harness 在框架层打通了多模态 Agent 的管道,Flash Vision 在模型层补上了视觉理解的引擎——

Harness 框架打通管道Flash Vision 补上引擎Agent 真正"看得见"

回看这四个月的多模态补课时间线:4 月底灰度识图模式,5 月大范围开放网页端,6 月全量上线 App,8 月 Harness 框架支持多模态,同一天 Flash Vision API 开放——每一步都踩在前一步的基础上。没有发布会,只有一个带着"Exp"后缀的模型名,悄悄把门推开。

04开发者须知 一个已经踩过两次的坑

测试中遇到了一个熟悉的问题。在开启默认的 thinking 模式时,模型的推理 token 会疯狂膨胀,吞掉全部输出预算。

数字说明一切:

在场景理解测试中,我们观察到 2001 个 completion token 里,2001 个全是 reasoning token——实际输出为零。模型想了半天,一个字都没说出来。

⚠️ 硬规则:视觉任务中关闭 thinking 模式

设置 reasoning_effort: "none" 关掉思考模式。关掉后,同一个测试从 23 秒缩短到 7.9 秒,输出完整且质量上乘。如果必须保留 thinking,请设置足够大的 max_tokens,否则大概率拿到空响应。

这已经是连续两个版本复现的同一个问题(V4 Pro 正式版 + Flash Vision Exp)。经验替你踩过了。

对于正在构建多模态 Agent 的团队来说,一个 token 消耗不到竞品一半、纯文本能力没有降级的视觉模型,可能是当下性价比最高的选项。只是,别忘了关掉 thinking 模式。

编辑核心判断

多模态能力正在从"锦上添花"变成"能不能干活"的前提。DeepSeek 选择在 Flash 上以低成本低门槛先铺开视觉能力,而不是等 Pro 准备完美再发布——这个"Exp"后缀背后,是实用主义对完美主义的胜利。对于开发者,性价比最高的多模态入口已经打开,但工具链的成熟度(如 thinking 模式的兼容问题)仍是需要自己填的坑。

现在就能用

API 平台已开放,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 直接调用,支持 base64 内联、外部 URL、Files API 三种图片传入方式。

DeepSeek API 平台 → 选择 Vision-Exp

* 体验入口以官方最新公告为准