Google DeepMind 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型
Start building with Nano Banana 2 Lite and Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型和 Gemini Omni Flash 视频生成与编辑模型。
原文给出两款新模型的延迟与成本,以及视频对话式编辑能力,读者可据此评估如何将图像生成与视频创作串进同一流水线。
2026年6月30日
|
我们正在通过 Nano Banana 2 Lite(我们最快、最具成本效益的 Gemini 图像模型)和 Gemini Omni Flash(用于高质量视频生成和对话式编辑)让您更轻松地实验和扩展您的创意。
Alisa Fortin
产品经理,Google DeepMind
Anish Nangia
产品经理,Google DeepMind
今天,我们通过两大发布让您更快、更轻松地实验、完善和扩展创意:
- 推出 Nano Banana 2 Lite: 这是我们 Nano Banana 系列中迄今最快、最具成本效益的图像模型,专为高吞吐量、速度和规模而构建。Nano Banana 2 Lite 今天在 Google AI Studio、 Gemini API 和 Gemini Enterprise Agent Platform 中可用。它今天也正在推广到 Google 消费类产品中,包括搜索中的 AI 模式、Gemini 应用和许多其他产品。
- 将 Gemini Omni Flash 带给开发者: 我们用于视频生成和对话式编辑的高质量、高成本效益模型,现在首次在 Google AI Studio、 Gemini API 和 Gemini Enterprise Agent Platform 中提供。Omni Flash 也已在 Gemini 应用 和 Google Flow 中可用。
使用生成式媒体进行构建通常涉及创意迭代。借助这两个模型,开发者可以构建全面的端到端多媒体体验,将快速图像生成与视频创建和编辑连接起来。无论您的工作流程需要生成数千张图像还是编辑多轮视频序列,您现在都有两个新模型可以更快地构建、无缝迭代,并将您的创意愿景变为现实。
Nano Banana 2 Lite:我们最快、最具成本效益的 Gemini 图像模型
观看 Nano Banana 2 Lite 和 Nano Banana 2 使用简单提示进行图像生成速度和质量的并排比较。
Nano Banana 2 Lite(gemini-3.1-flash-lite-image)专为快速构思和高速度开发者流程而设计,在这些场景中速度和成本是主要限制因素。这是我们为当前使用我们第一版 Nano Banana(gemini-2.5-flash-image)的开发者推荐的替代品,您现在就可以替换它,以在关键性能维度上立即获得好处。
Nano Banana 2 和 2 Lite 与竞争对手 AI 图像模型的性能基准比较,评估生成/编辑质量(Elo 分数)、处理延迟和每 1K 分辨率图像成本之间的权衡。
Nano Banana 2 Lite 在以下方面表现出色:
- 延迟: 文本到图像输出时长 4 秒。这使其非常适合交互式原型设计和快速视觉草稿。
- 成本效益(每 1K 图像 $0.034): 对于专注于草稿、构思、管理运营预算或低带宽使用的开发者来说,这是一个经济高效的选择。
尽管优先考虑速度,Nano Banana 2 Lite 仍然保持可靠的提示遵循、强大的角色一致性和清晰的图像内文本渲染。
了解 Nano Banana 系列
- Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image): 专为速度而构建。针对近实时、高吞吐量工作流进行了优化,在这些场景中超低延迟至关重要。
- Nano Banana 2(Gemini 3.1 Flash Image): 通用型主力。在较低延迟下提供高质量,实现性能和成本的最佳平衡。
- Nano Banana Pro(Gemini 3 Pro 图像):针对复杂、专业的应用场景进行了优化。在准确性比速度更重要的任务中,它提供了最强大的控制和高级推理能力。
- Nano Banana(Gemini 2.5 Flash 图像):我们的旧版模型。我们建议升级到 Nano Banana 2 Lite,以获得更好的质量、更快的速度和更低的成本。
要查看完整的模型功能列表以及如何集成,请查看开发者文档。
除了在开发者平台发布外,Nano Banana 2 Lite 也将登陆 Google 消费者产品,包括搜索中的 AI 模式、Gemini 应用、NotebookLM、Google 相册、Stitch、Google Flow 和 Google Ads。
使用 Gemini Omni Flash 体验高质量、高性价比的视频编辑和生成。
观看某人使用 Gemini Omni 表演四个数字魔术,比如从手机中拉出一个 3D 气球文字,以及将屏幕中的水倒入玻璃杯。角落中有一个小小的“原始”视频,揭示了她实际上是如何在添加 Omni 生成的特效之前拍摄这些魔术的。
在 Google I/O 大会上,我们推出了Gemini Omni Flash,这是 Gemini 的多模态推理与视频生成和编辑相结合的模型。今天,Gemini Omni Flash(gemini-omni-flash-preview)正在通过 Gemini API 和 Google AI Studio 向开发者推出,原生支持从文本、图像和视频输入的组合中进行高质量视频生成和对话式编辑。该模型的定价具有竞争力,视频输出每秒 0.10 美元,与 Veo 3.1 Fast 相同。
Omni Flash 的亮点在于:
- 对话式视频编辑:使用自然语言精修和编辑视频。
- 多模态引用:结合图像、文本和视频等输入,以保持对场景的控制和一致性。
- 现实世界知识:Omni 利用 Gemini 的历史、生物学和叙事逻辑等知识来构建引人入胜的视频。
- 文本和动作同步:通过简单的提示,将文本和图形直接连接到视频动作。
如需全面的基准测试信息,请访问 Google DeepMind 的 Gemini Omni 网页。
限制:
- Omni 目前支持生成 10 秒的视频,更长时长的支持即将推出。
- 此模型在 Gemini API 中尚不支持上传音频参考和场景扩展。
- API 架构接受最长 3 秒的视频参考,但目前该模型无法正确处理这些参考。
- 在改变场景或平移动作时,角色一致性存在一些限制,但我们正在努力改进。
Gemini Omni 从今天开始在 Google AI Studio 和 Gemini API 中提供公开预览。要查看完整的模型功能列表和地区特定限制,请查看开发者文档。
立即使用这两个模型进行构建
当你将这些模型串联起来时,真正的魔法才会发生。使用 Nano Banana 2 Lite 作为高速图像生成模型,然后将该图像作为参考传递给 Gemini Omni Flash,将其动画化为高质量视频。此外,通过为这些多轮体验使用 Interactions API,你可以维护会话历史和上下文,以便用户最多可以进行三次连续编辑。
为了帮助你入门,我们创建了几个可重新混合的示例应用,让你体验如何将 Nano Banana 2 Lite 和 Gemini Omni Flash 配对到同一工作流程中。
Anywhere 是一个演示应用,旨在展示这两款模型的强大能力。拍一张自拍或上传一张照片,该应用就会使用 Nano Banana 2 Lite 瞬间将你传送到数十个标志性地标。然后,当点击图像时,会使用 Omni Flash 将生成的图像转换为该位置的动画片段。
Space Lift 是一款由 Nano Banana 2 Lite 和 Gemini Omni 驱动的演示室内设计应用,让你通过上传照片立即重新构想任何房间。该应用会自动生成跨越各种设计美学的完整概念。一旦你找到喜欢的外观,点击视频按钮,观看 Omni 以电影般的方式将设计变为现实,让你在实现之前先体验新空间的动态效果。
Omni 产品工作室 是一个演示应用,可将 Nano Banana 2 Lite 创建的静态图像转换为 Gemini Omni 创建的电影级电商视频。此演示展示了如何通过图像到视频输出的快速交互,融合多模态输入来构建交互式媒体。
以安全透明的方式构建
基于Google的安全基础设施,Gemini Omni和Nano Banana 2 Lite使用SynthID水印技术。你可以通过Gemini应用、Chrome中的Gemini或搜索来验证AI内容。了解更多关于我们如何扩展验证工具,帮助你在整个网络上理解内容的创建和编辑方式。
立即开始你的项目
Nano Banana 2 Lite 资源:
- 前往 Google AI Studio 在游乐场中体验该模型。
- 深入了解我们的 Gemini API 文档。
- 查看我们的 Nano Banana 提示指南,其中包含最佳实践和示例提示。
Gemini Omni Flash 资源:
- 前往 Google AI Studio 在游乐场中体验该模型。
- 深入了解我们的 Gemini API 文档。
- 查看我们的 Gemini Omni Flash 提示指南,其中包含最佳实践和示例提示。
来源:Google DeepMind · deepmind.google