🎨 生成式媒体 · 模型发布

谷歌双发:4 秒出图的 Nano Banana 2 Lite 与对话式视频 Omni Flash 同步开放

6 月 30 日,Google DeepMind 同步推出两款面向开发者的生成式媒体模型——图像模型 Nano Banana 2 Lite(4 秒出图、$0.034/千张)与视频模型 Gemini Omni Flash(对话式编辑、$0.10/秒),已登陆 Google AI Studio、Gemini API 及企业平台,并接入搜索 AI Mode、Gemini App 等消费级入口。

来源:官方发布 2026-06-30 全文约 3 分钟读完
#Google DeepMind #Nano Banana #Gemini Omni #图像生成 #视频生成
4 Nano Banana 2 Lite 文生图延迟
$0.034 每千张 1K 分辨率图像成本
$0.10/秒 Omni Flash 视频生成单价,与 Veo 3.1 Fast 持平

⚡ 30 秒速览

  • 图像端:Nano Banana 2 Lite(gemini-3.1-flash-lite-image)定位高速、低成本,是初代 Nano Banana(gemini-2.5-flash-image)的官方推荐替代。
  • 视频端:Gemini Omni Flash(gemini-omni-flash-preview)首次向开发者开放,主打自然语言对话式编辑与多模态参考输入。
  • 组合拳:两模型可串联——Lite 出图 → Omni Flash 转视频,叠加 Interactions API 支持最多 3 次连续编辑。
  • 水印:均内置 SynthID 水印,可在 Gemini App、Chrome 及搜索中验证内容来源。
  • 限制:Omni Flash 当前仅支持 10 秒视频,不支持音频上传与场景扩展,跨镜头角色一致性仍有缺陷。

01Nano Banana 家族四档定位 从极速到专业

谷歌同时公布了 Nano Banana 家族的完整产品矩阵,按「速度—质量」天平分四档:

Nano Banana 2 Lite(本次新发)

定位:极速。4 秒出图、$0.034/千张,面向近实时、高吞吐管线。

Nano Banana 2

定位:通用主力。高质量 + 较低延迟,性能与成本的最佳平衡点。

Nano Banana Pro

定位:专业复杂。最强控制力与推理能力,用于精度优先场景。

Nano Banana(初代)

定位:遗留模型。官方建议迁移至 2 Lite,以获得更好质量、更快速度、更低成本。

注:Lite 版在速度与成本上极致优化,但仍保留可靠的提示词遵循、角色一致性及图内文字渲染能力。

02Omni Flash:把视频编辑变成对话

Gemini Omni Flash 是谷歌在 I/O 上预览、本次正式向开发者开放的视频模型。它的核心卖点不是单纯生成,而是对话式编辑——用自然语言逐步精修视频。

💬

对话式视频编辑

用自然语言下达修改指令,无需时间轴操作即可精修画面。

🖼️

多模态参考输入

将图像、文本、视频组合作为参考,维持场景控制力与一致性。

🌍

调用真实世界知识

借助 Gemini 的知识储备(历史、生物、叙事逻辑),构建有内在逻辑的视频内容。

🎬

文本与动作同步

通过简单提示词,将文字、图形直接绑定到视频动作上。

⚠️ 当前限制(官方明确披露):
  • 视频生成上限 10 秒,更长时长即将推出
  • 不支持音频参考上传与场景扩展
  • API 接受最长 3 秒视频参考,但模型当前无法正确处理
  • 换镜头或平移时的角色一致性仍有缺陷,官方称正在改进

03两个模型串联用:三个官方 Demo

谷歌强调,真正的价值在模型链式调用——Lite 高速出图,Omni Flash 接力转视频。配合 Interactions API 可保持会话上下文,最多叠加 3 次连续编辑。

Nano Banana 2 Lite 出图作为参考传入Omni Flash 动画化

📍 Anywhere:地标瞬移自拍图→视频

  • 上传一张自拍,Lite 将人物「传送」到数十个地标背景。
  • 点击任一生成的图片,Omni Flash 将其转化为该地标的动画短片

🛋️ Space Lift:室内设计即时预览图→视频

  • 上传房间照片,Lite 自动生成多种设计风格的完整概念图。
  • 选定风格后点击视频按钮,Omni 生成电影级空间展示,让用户在动工前看到新空间的效果。

🛒 Omni Product Studio:电商图转视频图→视频

  • Lite 生成的静态产品图,经 Omni 转化为电影感电商短视频
  • 演示了多模态输入与图生视频快速交互的完整链路。
编辑视角

本文所有数据、能力描述与限制清单均引自谷歌官方发布,属于企业产品通稿性质——尤其是速度与成本数字,未见第三方独立基准复测。读者在评估「4 秒」「$0.034/千张」等指标时,宜结合自身工作负载实测验证;Omni Flash 的限制清单是官方主动披露,可信度较高。

此外,Nano Banana 家族从「单一模型」演进到「四档矩阵 + 视频搭档」,折射出生成式媒体正从「能不能做」的演示阶段,进入按工作负载分档定价、按管线串联编排的工业化阶段。

当图像与视频模型被设计为可串联的「积木」,多模态生成的竞争焦点已从单点质量,转向谁能把全链路成本压到最低、把编辑摩擦减到最小。

现在就能用

两款模型已在 Google AI Studio 上线公开预览,可前往 Playground 实测;开发者可查阅 Gemini API 文档与提示词指南接入。

Google AI Studio → Playground