DeepSeek 多模态视觉模型上线:384 token 看懂《牛来》,26 秒截图变代码
8 月 21 日,DeepSeek V4-Flash-Vision-Exp 正式上线 API 平台,多模态能力接近 Opus-4.8,定价与 V4-Flash 一致,纯文本能力不降级。每张图片仅消耗 384 个 token,不到竞品一半。
8 月 21 日,DeepSeek V4-Flash-Vision-Exp 正式上线 API 平台,多模态能力接近 Opus-4.8,定价与 V4-Flash 一致,纯文本能力不降级。每张图片仅消耗 384 个 token,不到竞品一半。
DeepSeek 此次上线的 Vision-Exp 不是"为看图牺牲了文本能力"的特化模型,而是在 Flash 基础上叠加了视觉理解。官方强调,在 Agent、推理、世界知识等纯文本基准上,Vision-Exp 与 V4-Flash 正式版持平。
它与传统多模态方案的区别在哪里?
将整张图拆成密集的图像 patch,每张图消耗 800–1100 个 token,视觉成本高,且常伴随文本能力下降。
基于"Thinking with Visual Primitives"框架,将视觉元素压缩为空间坐标式原语,384 token 完成理解,纯文本能力完整保留。
注:Files API 允许开发者先上传图片获取 file_id,同一张图多次调用无需重复传输,适合 Agent 工作流。
更关键的是,DeepSeek 选择先在 Flash 上试水视觉能力,而非旗舰 Pro。284B 参数的 MoE 模型推理成本远低于 1.6T 的 Pro,让多模态调用在经济上真正可行——每张图 384 token 的消耗,叠加 Flash 的低价基底,意味着开发者可以用极低的成本规模化使用视觉理解。
我们做了两个测试,从"看懂"到"动手"——视觉理解与代码生成叠加时,AI 能做的事情比单独拥有任何一项要多得多。
一个值得注意的产品决策是:DeepSeek 选择先在 Flash 上试水视觉能力,而不是旗舰 Pro。这不是能力不足,而是经济性与节奏感的双重考量。
从成本看,Flash 是 284B 参数的 MoE 模型,推理成本远低于 1.6T 的 Pro。每张图片至少 384 token 的输入预算,如果叠加在 Pro 的定价上,成本会迅速膨胀。Flash 的低价基底让多模态调用在经济上可行。
从节奏看,就在前一天,DeepSeek Harness 框架刚发布了 RC.8 版本,新增了原生图片请求的支持。Harness 在框架层打通了多模态 Agent 的管道,Flash Vision 在模型层补上了视觉理解的引擎——
回看这四个月的多模态补课时间线:4 月底灰度识图模式,5 月大范围开放网页端,6 月全量上线 App,8 月 Harness 框架支持多模态,同一天 Flash Vision API 开放——每一步都踩在前一步的基础上。没有发布会,只有一个带着"Exp"后缀的模型名,悄悄把门推开。
测试中遇到了一个熟悉的问题。在开启默认的 thinking 模式时,模型的推理 token 会疯狂膨胀,吞掉全部输出预算。
数字说明一切:
在场景理解测试中,我们观察到 2001 个 completion token 里,2001 个全是 reasoning token——实际输出为零。模型想了半天,一个字都没说出来。
设置 reasoning_effort: "none" 关掉思考模式。关掉后,同一个测试从 23 秒缩短到 7.9 秒,输出完整且质量上乘。如果必须保留 thinking,请设置足够大的 max_tokens,否则大概率拿到空响应。
这已经是连续两个版本复现的同一个问题(V4 Pro 正式版 + Flash Vision Exp)。经验替你踩过了。
对于正在构建多模态 Agent 的团队来说,一个 token 消耗不到竞品一半、纯文本能力没有降级的视觉模型,可能是当下性价比最高的选项。只是,别忘了关掉 thinking 模式。
多模态能力正在从"锦上添花"变成"能不能干活"的前提。DeepSeek 选择在 Flash 上以低成本低门槛先铺开视觉能力,而不是等 Pro 准备完美再发布——这个"Exp"后缀背后,是实用主义对完美主义的胜利。对于开发者,性价比最高的多模态入口已经打开,但工具链的成熟度(如 thinking 模式的兼容问题)仍是需要自己填的坑。
API 平台已开放,开发者可通过设置 model='deepseek-v4-flash-vision-exp' 直接调用,支持 base64 内联、外部 URL、Files API 三种图片传入方式。
DeepSeek API 平台 → 选择 Vision-Exp* 体验入口以官方最新公告为准