DeepSeek V4-Flash-Vision-Exp 上线多模态,Agent 能力逼近 Opus-4.8
8 月 21 日,深度求索发布全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,支持图片输入与多模态理解,在纯文本能力持平正式版的前提下,多模态 Agent 能力实现大幅跃升,已接近 Opus-4.8。
8 月 21 日,深度求索发布全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,支持图片输入与多模态理解,在纯文本能力持平正式版的前提下,多模态 Agent 能力实现大幅跃升,已接近 Opus-4.8。
DeepSeek-V4-Flash-Vision-Exp 的核心突破在于:它不再局限于文本输入,而是可以同时接收图片与文字,完成跨模态的理解与推理。这与传统视觉模型有本质区别。
通常只能做分类或检测,输出固定标签;无法理解复杂场景,也难以与推理、对话等能力结合。
将视觉理解与语言模型深度融合:描述图片、识别文字、分析图表一气呵成,且能在 Agent 框架内自主调用工具。
更关键的是,它的纯文本能力与 V4-Flash 正式版完全持平——这意味着多模态能力的加入没有牺牲原有的推理、Agent 和世界知识能力。在 AI 行业,能做到「加法却不做减法」的模型并不多见。
注:四种图片格式覆盖了日常网页、截图、照片、动图等绝大多数场景,开发者无需额外转码即可直接调用。
深度求索官方公布的数据显示,在需要视觉理解的 Agent Benchmark 上,Vision-Exp 相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。以下是基于公开信息整理的能力对比:
注:柱形长度为示意性对比,基于官方表述「接近 Opus-4.8」与「大幅跃升」整理,非精确分数。Vision-Exp 在纯文本维度与 V4-Flash 持平。
V4-Flash 本身已经是强推理模型,但在视觉相关的 Agent 任务上存在盲区。Vision-Exp 补上了这块拼图,且没有引入新的延迟或成本膨胀——这对开发者来说,意味着一条无痛升级路径。
多模态本身不是新鲜事。但 DeepSeek 这次的关键信号在于:多模态 Agent 能力接近 Opus-4.8——Opus-4.8 是 Anthropic 当前最强的多模态模型之一,在视觉 Agent 场景中有口皆碑。
换句话说,DeepSeek 用一个「实验版本」追平了行业顶尖水平。而它的纯文本能力原本就与 V4-Flash 持平,后者在推理和 Agent 维度已经属于第一梯队。
从行业视角看,多模态 + Agent 的组合正在成为下一代 AI 应用的标配。纯文本模型解决的是「思考」问题,多模态模型解决的是「感知」问题——两者结合,智能体才能从「聊天」走向「做事」。
多模态能力不再是「加分项」,而是 Agent 落地的「入场券」。
DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,开发者可直接调用多模态能力,集成到现有 Agent 工作流中。
DeepSeek API 平台 → 体验多模态