DeepSeek 上线多模态实验模型:V4 系列首次开放视觉输入,Agent 能力同步大涨
8 月 20 日,代号 deepseek-v4-flash-vision-exp 先一步出现在开源仓库的源码里;如今,它已正式在 API 平台开放图像理解。这不仅是 V4 系列第一次支持视觉输入——随之上线的,还有一轮 Agent 能力的整体上涨:七项评测,五项提升。
8 月 20 日,代号 deepseek-v4-flash-vision-exp 先一步出现在开源仓库的源码里;如今,它已正式在 API 平台开放图像理解。这不仅是 V4 系列第一次支持视觉输入——随之上线的,还有一轮 Agent 能力的整体上涨:七项评测,五项提升。
DeepSeek 在 API 平台上线实验模型 deepseek-v4-flash-vision-exp,正式提供图像理解服务。在此之前,V4 系列以文本推理、代码生成和 Agent 能力见长,视觉输入一直是缺席的一块拼图。
这一次,"小鲸鱼"真的长出了眼睛。
按照官方文档,图片在 API 服务中会转换成 token 后按 token 计费——价格与 V4-Flash 一致,接入成本并没有因为多模态而变贵。同时支持图文混合输入,可以方便地接入各类 Agent 工具链。
注:以上为 API 规格层面的公开信息整理;实际计费以官方文档为准。
官方同步放出了 Vision-Exp 与 V4-Flash-0731 的对照数据。七项 Agent 测试中,六项发生变化——五项提升,一项小幅回落。
涨得最多的,恰好是最"动手"的两项。
注:柱形以 0 为基线,向右为提升、向左为回落;长度按绝对值比例绘制,+5.6 为满格。数据来自官方对比 V4-Flash-0731 的测试结果。
一个值得注意的细节:视觉编码器本身并不会让代码生成变好。Toolathlon 考的是工具调用,DeepSWE 考的是真实代码库修改——它们都属于长周期 Agent 执行。变好的不是"看",而是模型"看懂环境、规划步骤、调用工具"的整体能力。
最直接的猜测是"外接一个视觉编码器"。但如果只是这样,文本类 Agent 评测不应该有明显变化。
改动停留在感知层,模型"看见"图片,但规划与执行能力不动——文本 Agent 分数不应上涨。
理解环境、规划任务、调用工具的能力被同步强化——文本 Agent 评测随之上涨,且涨幅集中在执行类任务。
Vision-Exp 更像是一次方向声明:视觉不是孤立功能,而是 Agent 感知层的补完。
注:链路为编辑根据评测任务特征归纳的执行路径,帮助理解视觉输入如何接入 Agent 工作流。
Vision-Exp 的文本 Agent 能力到底是什么水位?把它和当前最强基线之一放在一起,结论才完整。
注:对比对象为 Opus 4.8(官方口径梳理);分数均为公开测试结果。
更准确的结论是:整体接近 Opus 4.8,在个别代码 Agent 测试上实现反超,但尚未全面超过。
另外别忘了,它还带着 "Exp" 后缀——官方明确将其定义为实验性模型。
Vision-Exp 不是凭空出现的。把时间线拉长,V4 系列的方向一直很明确。
混合专家架构,总参数量 2840 亿、单 token 激活约 130 亿;把 100 万 token 上下文做成默认配置。
新一轮后训练,重点强化工具调用与长周期 Agent 任务。
开发者在 DeepSeek Harness 源码中发现 vision 相关配置;当时 API 尚未开放,图片请求会返回错误。
实验模型开放图像理解,Agent 评测同步上涨——视觉与行动力在同一条逻辑线上汇合。
注:时间线按公开信息整理;"现在"指 API 正式上线的时间点。
给模型加眼睛的价值,不在于"看",而在于看懂之后能"动手"。Vision-Exp 用一组上涨的 Agent 分数说明:多模态与行动力正在同一轮训练里被打通——感知和执行的耦合,才是下一代 Agent 的分水岭。
实验模型已上线 DeepSeek 开放平台,图像以 token 计费,成本与 V4-Flash 持平。开发者可直接接入既有 Agent 工具链。
DeepSeek 开放平台 → 开发者文档