🖼️ 多模态 · 模型发布

DeepSeek 多模态 API 终于上线:V4-Flash-Vision-Exp 开放,一张图最高 0.001 元

8 月 21 日,DeepSeek 宣布全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp(实验性质)上线 API 平台。纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Claude Opus 4.8——这是 DeepSeek 首个面向开发者的官方视觉 API。

来源:综合公开信息整理 2026-08-21 全文约 3 分钟读完
#DeepSeek #多模态 #V4-Flash-Vision-Exp #视觉理解API
0.001152 高峰时段单张图片最高成本
384 tokens 单张图片计费折算上限
≈ Opus 4.8 多模态 Agent 能力对标水平

⚡ 30 秒速览

  • 发生了什么:DeepSeek 上线首个官方多模态视觉模型 V4-Flash-Vision-Exp,API 即刻可用。
  • 能力定位:纯文本(Agent、推理、世界知识)与 V4-Flash 正式版持平;多模态 Agent 能力大幅提升,接近 Opus 4.8。
  • 价格逻辑:图片先进 token 再按原单价计费,单张上限 384 tokens,高峰单图最高约 0.001 元。
  • 怎么调用:模型参数设置为 deepseek-v4-flash-vision-exp,兼容三种 API 格式,支持图文混合输入。
  • 配套福利:Files API 免费上线,图片上传一次、凭 file_id 反复引用,省掉重复传输开销。

01文本不掉队,视觉补上了 多模态 Agent 接近 Opus 4.8

这是 DeepSeek 第一次把视觉能力打包成 API 交给开发者。新模型在 V4-Flash 的基础上长出视觉:官方基准显示,Agent、推理、世界知识三大纯文本维度与正式版持平——文本底子没有被多模态牺牲掉。

变的是视觉,稳的是文本。

纯文本任务

Agent、推理、世界知识等维度——与 V4-Flash 正式版持平,能力没有因多模态而回退。

多模态 Agent 任务

需要看懂图片的任务中,相比 V4-Flash 大幅提升,整体能力接近 Claude Opus 4.8

Claude Opus 4.8多模态参照系
基准
V4-Flash-Vision-ExpDeepSeek · 多模态实验版
接近
V4-FlashDeepSeek · 文本正式版
基线

注:条形长度按官方「接近 Opus 4.8」「相比 V4-Flash 大幅提升」的能力关系映射,非基准精确得分;「接近」为 DeepSeek 官方对比表述。

02为什么能便宜到 1 厘钱 多模态没有「功能税」

DeepSeek 的定价思路很直接:图片先折算成 token,再按原有单价计费——多模态不是增值收费项,而是把图片翻译成模型本来就认识的 token。单张图片最多算 384 tokens,高峰时段折合下来最高 0.001152 元

图片输入折算 token(上限 384)按 V4-Flash 原单价高峰单图 0.001152 元
384单图上限 tokens
≈3×10⁻⁶折算单 token 均价(元)
0 元Files API 上传费用
3 种兼容 API 格式

注:单 token 均价由「单图上限 384 tokens」与「峰值成本 0.001152 元」倒推,实际价格随计费时段浮动,以平台面板为准。峰值单价下,一万张图片的理解成本约 11.52 元。

这个价格意味着什么?批量识别截图、扫描件、UI 稿这类任务,成本已经从「按次付费的功能费」滑向「按流量计的带宽费」。识图第一次变得像流量一样便宜——这正是后续 Agent 工作流敢把图片塞给模型的底气。

03官方验证过的两类玩法 不是只能认个字、识个图

📊 风格化 PPT 内容制作抽象风格理解

  • 用户提供真实摄影风格图片,模型能理解「野性」「原始」「探索感」这类抽象的风格化要求。
  • 视觉风格理解与内容生成一次完成,直接服务于日常办公创作链路。
关键点在于:风格词不是画面内容,而是审美判断——这需要模型真正「看懂」图片的气质,而非识别物体。

🎨 视觉编程:给网站做视觉二创多模态 + 代码生成

  • 对 DeepSeek Harness 官网进行二次创作,叠加黑蓝深海、玻璃 UI、ASCII 原子像素等视觉要素。
  • 官方展示的成品动画流畅、文字质感出色,视觉特效完成度相当高。
这是「图片理解 + 风格迁移 + 前端生成」的组合任务,单模态模型无法完成

🤖 接入 Agent 工具链三种 API 格式

  • 同时兼容 Chat Completions / Messages / Responses 三种调用方式,方便接入各类 Agent 框架。
  • 图片支持 base64 内联、外部 URL 两种直传方式;配合免费的 Files API,上传一次、重复引用
官方称,该模型在各类 Agent 框架内展现出较好的多模态适配能力,能够配合工具解锁更多工作场景。

04迟到的多模态,怎么补上的 四个月走完一整条链路

为什么说「终于」?因为多模态理解早已是主流大模型的标配,截图、文档、网页、UI 界面——真实工作大多绕不开看图这一步。而在这条赛道上,DeepSeek 长期是个例外。

4 月底

识图模式以灰度测试方式上线,只对部分用户开放。

6 月

网页端与 App 端全量开放识图能力,C 端用户率先用上。

8 月 19 日

DeepSeek Harness 先行更新,把多模态输入、子代理协作、工具调用作为升级重点。

8 月 21 日

V4-Flash-Vision-Exp 上线 API,模型适配器新增多模态选项,并支持配置原生图片请求。

从灰度识图到 C 端全量,再到开发者的 API 与 Agent 框架适配——四个月,DeepSeek 把多模态短板补成了一条完整链路

一个诚实的注脚:这是 Exp 实验模型,长尾视觉任务与复杂风格化的稳定性,还要等开发者把它压进生产环境才能验证。

编辑核心判断

DeepSeek 的入场方式,是把多模态溢价直接清零。当头部厂商还在把「看图」当作增值卖点时,1 厘钱的单价已经把视觉理解推进基础设施的水位——下一轮竞争不再是「模型能不能看图」,而是「Agent 能不能把看图变成生意」。

开发者现在就能用

⚙️ 调用方式 · 三选一,均为官方支持

模型参数设置为:

deepseek-v4-flash-vision-exp
  • 图片传入支持 base64 内联外部 URL 两种方式;图文可混合输入。
  • 可先将图片上传至免费的 Files API,后续请求凭 file_id 直接引用,无需重复上传。
  • 兼容 Chat Completions / Messages / Responses 三种格式,接入现有 Agent 工具链无需额外改造。

核心能力已落地 DeepSeek API 平台,进入控制台即可创建调用。

platform.deepseek.com → 进入控制台