👁 多模态 · 模型速递

DeepSeek 上线多模态实验模型:V4 系列首次开放视觉输入,Agent 能力同步大涨

8 月 20 日,代号 deepseek-v4-flash-vision-exp 先一步出现在开源仓库的源码里;如今,它已正式在 API 平台开放图像理解。这不仅是 V4 系列第一次支持视觉输入——随之上线的,还有一轮 Agent 能力的整体上涨:七项评测,五项提升。

来源:综合公开信息整理 2026-08 全文约 3 分钟读完
#DeepSeek #多模态 #Vision-Exp #Agent #API
👁 首次 V4 系列首个多模态 API,官方开放视觉输入
384 tokens 单张图片计费上限,价格与 V4-Flash 一致
5 / 7 Agent 评测五项提升,一项小幅回落

⚡ 30 秒速览

  • 发生了什么:deepseek-v4-flash-vision-exp 上线 API,图片转为 token 后统一计费,单张最多 384 tokens。
  • 强在哪:七项 Agent 评测五项上涨——Toolathlon +5.6、DeepSWE +4.9,工具调用与真实代码修改提升最明显。
  • 意味着什么:不是简单外接视觉编码器。理解环境、规划任务、调用工具的能力,在同一轮后训练中被同步强化。
  • 诚实的一面:对比 Opus 4.8,多数文本 Agent 测试仍稍弱;但 DeepSWE 反超 1.3 分,Toolathlon 仅差 0.3 分。
  • 去哪体验:DeepSeek 开放平台 API 文档,支持三种调用格式、三种图片传入方式。

01V4 系列,第一次睁开眼睛 视觉能力正式上线

DeepSeek 在 API 平台上线实验模型 deepseek-v4-flash-vision-exp,正式提供图像理解服务。在此之前,V4 系列以文本推理、代码生成和 Agent 能力见长,视觉输入一直是缺席的一块拼图。

这一次,"小鲸鱼"真的长出了眼睛。

按照官方文档,图片在 API 服务中会转换成 token 后按 token 计费——价格与 V4-Flash 一致,接入成本并没有因为多模态而变贵。同时支持图文混合输入,可以方便地接入各类 Agent 工具链。

3 种调用格式Chat Completions / Messages / Responses兼容主流 Agent 开发框架,迁移成本低。
3 种图片传入base64 内联 / 外部 URL / Files API本地文件、远程图片皆可,灵活适配不同场景。
384 tokens单图上限图片按 token 计费,一张图最多计 384 tokens。
与 V4-Flash 同价计费规则不变多模态能力上线,但视觉输入没有额外溢价。

注:以上为 API 规格层面的公开信息整理;实际计费以官方文档为准。

02七项评测,五项上涨 Agent 能力跟着变强了

官方同步放出了 Vision-Exp 与 V4-Flash-0731 的对照数据。七项 Agent 测试中,六项发生变化——五项提升,一项小幅回落

涨得最多的,恰好是最"动手"的两项。

Toolathlon-Verified工具调用综合
+5.6
DeepSWE真实代码库修改
+4.9
DSBench-Hard数据科学任务
+4.0
NL2Repo自然语言生成仓库
+3.5
Terminal Bench 2.1终端操作
+1.2
AutomationBench自动化执行
+0.6
Cybergym网络安全对抗
−1.4

注:柱形以 0 为基线,向右为提升、向左为回落;长度按绝对值比例绘制,+5.6 为满格。数据来自官方对比 V4-Flash-0731 的测试结果。

一个值得注意的细节:视觉编码器本身并不会让代码生成变好。Toolathlon 考的是工具调用,DeepSWE 考的是真实代码库修改——它们都属于长周期 Agent 执行。变好的不是"看",而是模型"看懂环境、规划步骤、调用工具"的整体能力。

03为什么加眼睛,动手能力反而变强了?

最直接的猜测是"外接一个视觉编码器"。但如果只是这样,文本类 Agent 评测不应该有明显变化。

旧假设:外接视觉编码器

改动停留在感知层,模型"看见"图片,但规划与执行能力不动——文本 Agent 分数不应上涨。

新现实:多模态 + Agent 联合后训练

理解环境、规划任务、调用工具的能力被同步强化——文本 Agent 评测随之上涨,且涨幅集中在执行类任务。

Vision-Exp 更像是一次方向声明:视觉不是孤立功能,而是 Agent 感知层的补完。

读图识别环境规划任务步骤调用代码与工具交付可验证结果

注:链路为编辑根据评测任务特征归纳的执行路径,帮助理解视觉输入如何接入 Agent 工作流。

04一个诚实的注脚 还没全面超过 Opus 4.8

Vision-Exp 的文本 Agent 能力到底是什么水位?把它和当前最强基线之一放在一起,结论才完整。

▍仍稍弱的部分

  • NL2Repo:低 12 分
  • DSBench-Hard:低 8.1 分

▍已反超的部分

  • DeepSWE:59.3 vs 58.0,反超 1.3 分
  • Toolathlon:75.9 vs 76.2,仅差 0.3 分

注:对比对象为 Opus 4.8(官方口径梳理);分数均为公开测试结果。

更准确的结论是:整体接近 Opus 4.8,在个别代码 Agent 测试上实现反超,但尚未全面超过。

另外别忘了,它还带着 "Exp" 后缀——官方明确将其定义为实验性模型。

05一条清晰的演进路径 从纯文本到能看、能想、能动手

Vision-Exp 不是凭空出现的。把时间线拉长,V4 系列的方向一直很明确。

V4-Flash 发布

混合专家架构,总参数量 2840 亿、单 token 激活约 130 亿;把 100 万 token 上下文做成默认配置。

V4-Flash-0731 更新

新一轮后训练,重点强化工具调用与长周期 Agent 任务。

源码先露头

开发者在 DeepSeek Harness 源码中发现 vision 相关配置;当时 API 尚未开放,图片请求会返回错误。

Vision-Exp 上线

实验模型开放图像理解,Agent 评测同步上涨——视觉与行动力在同一条逻辑线上汇合。

注:时间线按公开信息整理;"现在"指 API 正式上线的时间点。

编辑核心判断

给模型加眼睛的价值,不在于"看",而在于看懂之后能"动手"。Vision-Exp 用一组上涨的 Agent 分数说明:多模态与行动力正在同一轮训练里被打通——感知和执行的耦合,才是下一代 Agent 的分水岭。

现在就能用

实验模型已上线 DeepSeek 开放平台,图像以 token 计费,成本与 V4-Flash 持平。开发者可直接接入既有 Agent 工具链。

DeepSeek 开放平台 → 开发者文档