DeepSeek 多模态 API 终于上线:V4-Flash-Vision-Exp 开放,一张图最高 0.001 元
8 月 21 日,DeepSeek 宣布全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp(实验性质)上线 API 平台。纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Claude Opus 4.8——这是 DeepSeek 首个面向开发者的官方视觉 API。
8 月 21 日,DeepSeek 宣布全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp(实验性质)上线 API 平台。纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Claude Opus 4.8——这是 DeepSeek 首个面向开发者的官方视觉 API。
这是 DeepSeek 第一次把视觉能力打包成 API 交给开发者。新模型在 V4-Flash 的基础上长出视觉:官方基准显示,Agent、推理、世界知识三大纯文本维度与正式版持平——文本底子没有被多模态牺牲掉。
变的是视觉,稳的是文本。
Agent、推理、世界知识等维度——与 V4-Flash 正式版持平,能力没有因多模态而回退。
需要看懂图片的任务中,相比 V4-Flash 大幅提升,整体能力接近 Claude Opus 4.8。
注:条形长度按官方「接近 Opus 4.8」「相比 V4-Flash 大幅提升」的能力关系映射,非基准精确得分;「接近」为 DeepSeek 官方对比表述。
DeepSeek 的定价思路很直接:图片先折算成 token,再按原有单价计费——多模态不是增值收费项,而是把图片翻译成模型本来就认识的 token。单张图片最多算 384 tokens,高峰时段折合下来最高 0.001152 元。
注:单 token 均价由「单图上限 384 tokens」与「峰值成本 0.001152 元」倒推,实际价格随计费时段浮动,以平台面板为准。峰值单价下,一万张图片的理解成本约 11.52 元。
这个价格意味着什么?批量识别截图、扫描件、UI 稿这类任务,成本已经从「按次付费的功能费」滑向「按流量计的带宽费」。识图第一次变得像流量一样便宜——这正是后续 Agent 工作流敢把图片塞给模型的底气。
为什么说「终于」?因为多模态理解早已是主流大模型的标配,截图、文档、网页、UI 界面——真实工作大多绕不开看图这一步。而在这条赛道上,DeepSeek 长期是个例外。
识图模式以灰度测试方式上线,只对部分用户开放。
网页端与 App 端全量开放识图能力,C 端用户率先用上。
DeepSeek Harness 先行更新,把多模态输入、子代理协作、工具调用作为升级重点。
V4-Flash-Vision-Exp 上线 API,模型适配器新增多模态选项,并支持配置原生图片请求。
从灰度识图到 C 端全量,再到开发者的 API 与 Agent 框架适配——四个月,DeepSeek 把多模态短板补成了一条完整链路。
一个诚实的注脚:这是 Exp 实验模型,长尾视觉任务与复杂风格化的稳定性,还要等开发者把它压进生产环境才能验证。
DeepSeek 的入场方式,是把多模态溢价直接清零。当头部厂商还在把「看图」当作增值卖点时,1 厘钱的单价已经把视觉理解推进基础设施的水位——下一轮竞争不再是「模型能不能看图」,而是「Agent 能不能把看图变成生意」。
模型参数设置为:
deepseek-v4-flash-vision-exp核心能力已落地 DeepSeek API 平台,进入控制台即可创建调用。
platform.deepseek.com → 进入控制台