谷歌双发:4 秒出图的 Nano Banana 2 Lite 与对话式视频 Omni Flash 同步开放
6 月 30 日,Google DeepMind 同步推出两款面向开发者的生成式媒体模型——图像模型 Nano Banana 2 Lite(4 秒出图、$0.034/千张)与视频模型 Gemini Omni Flash(对话式编辑、$0.10/秒),已登陆 Google AI Studio、Gemini API 及企业平台,并接入搜索 AI Mode、Gemini App 等消费级入口。
6 月 30 日,Google DeepMind 同步推出两款面向开发者的生成式媒体模型——图像模型 Nano Banana 2 Lite(4 秒出图、$0.034/千张)与视频模型 Gemini Omni Flash(对话式编辑、$0.10/秒),已登陆 Google AI Studio、Gemini API 及企业平台,并接入搜索 AI Mode、Gemini App 等消费级入口。
谷歌同时公布了 Nano Banana 家族的完整产品矩阵,按「速度—质量」天平分四档:
定位:极速。4 秒出图、$0.034/千张,面向近实时、高吞吐管线。
定位:通用主力。高质量 + 较低延迟,性能与成本的最佳平衡点。
定位:专业复杂。最强控制力与推理能力,用于精度优先场景。
定位:遗留模型。官方建议迁移至 2 Lite,以获得更好质量、更快速度、更低成本。
注:Lite 版在速度与成本上极致优化,但仍保留可靠的提示词遵循、角色一致性及图内文字渲染能力。
Gemini Omni Flash 是谷歌在 I/O 上预览、本次正式向开发者开放的视频模型。它的核心卖点不是单纯生成,而是对话式编辑——用自然语言逐步精修视频。
用自然语言下达修改指令,无需时间轴操作即可精修画面。
将图像、文本、视频组合作为参考,维持场景控制力与一致性。
借助 Gemini 的知识储备(历史、生物、叙事逻辑),构建有内在逻辑的视频内容。
通过简单提示词,将文字、图形直接绑定到视频动作上。
谷歌强调,真正的价值在模型链式调用——Lite 高速出图,Omni Flash 接力转视频。配合 Interactions API 可保持会话上下文,最多叠加 3 次连续编辑。
本文所有数据、能力描述与限制清单均引自谷歌官方发布,属于企业产品通稿性质——尤其是速度与成本数字,未见第三方独立基准复测。读者在评估「4 秒」「$0.034/千张」等指标时,宜结合自身工作负载实测验证;Omni Flash 的限制清单是官方主动披露,可信度较高。
此外,Nano Banana 家族从「单一模型」演进到「四档矩阵 + 视频搭档」,折射出生成式媒体正从「能不能做」的演示阶段,进入按工作负载分档定价、按管线串联编排的工业化阶段。
两款模型已在 Google AI Studio 上线公开预览,可前往 Playground 实测;开发者可查阅 Gemini API 文档与提示词指南接入。
Google AI Studio → Playground