Google 发布 Gemini Omni 1.1 Flash,强化可控视频生成能力
Gemini Omni 1.1 Flash lets you build with more control
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。
官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。
Aug 27, 2026
|
Omni 现在提供工作室级视频制作功能,包括场景扩展、首尾帧插值、清晰的4K提升、更快的原型制作等。
Anish Nangia
产品经理,Google DeepMind
Alisa Fortin
产品经理,Google DeepMind
收听文章
[[duration]] 分钟
此内容由Google AI生成。生成式AI是实验性的
今天,我们推出Gemini Omni 1.1 Flash,这是一套新的创意控制和生成式视频功能,旨在支持开发者。 Gemini Omni 为生成式创作带来了现实世界推理能力,而今天的更新让Omni 1.1通过Google AI Studio中的Gemini API为专业使用做好了生产准备。
无论你是在构建生成式视频工作流、创意工具,还是媒体编辑软件,这些更新都让生成式视频更具可控性、迭代更快,并为实际部署做好了精细打磨。以下是一览:
扩展场景以进行更长叙事
场景扩展允许你拍摄现有视频并从中断处无缝继续生成素材。
借助Omni 1.1,模型现在可以分析长达10秒的先前上下文——相比之前仅参考最后一秒的模型是一个飞跃。结果改善了视觉一致性和叙事连贯性,让你可以构建更长的故事或分支到新的创意方向。你可以以10秒为增量扩展视频,最长累计总时长可达40秒。
以下是如何使用Gemini API扩展场景:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)指定首尾帧
通过指定镜头的起始帧和结束帧来实现平滑过渡和摄像机运动。Omni 1.1在两个关键帧之间生成连续视频,非常适合复杂的摄像机环绕、缩放过渡或无缝循环片段。
提示1:一个穿着米色西装的时尚鼓手在大厅中演奏红色鼓组的特写低角度镜头,随着摄像机快速摇向侧面,揭示了一位年长的萨克斯手旁边一位穿着白色服装的芭蕾舞者在柔和的紫色舞台灯光下旋转。一个连续镜头,无跳切。
提示2:摄像机放大到电视屏幕,我们看到同一个女人和同一个场景从开头开始。无缝视频。一个连续镜头,无跳切。
以360p更高效地起草视频
生成360p分辨率的轻量预览,速度最高可提升60%*,成本仅为Omni 1.1标准720p分辨率的三分之一。这对于快速原型设计、故事板迭代和开发者平台中的快速渲染很有帮助。
*基于360p与720p分辨率的系统吞吐量,生成速度最高可提升60%
提示:带有虹彩色泽的海洋硅藻微观视图,展示复杂如玻璃般的硅质壳,具有惊人的自然对称性。颜色从深火山琥珀色和暖铜色到鲜艳的蓝绿色和紫色,模仿地球和海洋的丰富色调。微小的精致结构在干净的深色背景上柔和发光。高保真科学成像,清晰细节,有机纹理,微摄影。整个视频保持显微镜镜头效果。
提升至4K分辨率
生成精致的1080p或4K高清输出,可直接用于Omni 1.1的专业制作。
提示1:鱼游动的跟踪镜头
提示2:一只小花栗鼠从屏幕左侧的树林中窜出,好奇地嗅着空气,然后从右侧窜出画面
提示3:电影级微距特写,展示娇嫩枝头上鲜艳的金橙色日本枫叶,在柔和而有节奏的秋风中轻轻沙沙作响并摇曳。阳光透过半透明的树叶,营造出温暖、发光的效果。浅景深,梦幻般的散景背景,超精细纹理,照片级真实感,4K。
在多模态输入中添加视频参考
在构思场景时,可参考最长三秒的视频片段,让你能够根据视频参考保持视觉上下文和角色一致性。
提示:使用上传的三段舞者视频,并用提供的角色替换他们。让他们表演参考视频中的各自舞蹈,全部在提供图片中的宽敞开放空间内进行。
狗角色dog.png应表演来自dance3.mp4的古典舞。章鱼角色octo.png应表演来自dance1.mp4的嘻哈舞,熊角色bear.png应表演来自dance2.mp4的霹雳舞。最终结果应为无场景切换的连续镜头。
激发创造力:你可以构建什么
以下是一些想法,展示开发者如何将这些新功能应用于自定义工具和创意工作流中。
看看客户如何将Omni Flash投入生产
我们的客户已经通过Agent Platform API使用Gemini Omni Flash驱动真实世界的生产。查看他们创作的视频,并了解他们如何在下方使用该模型。
今天就使用Gemini Omni 1.1 Flash进行构建
Gemini Omni 1.1 Flash的定价表。
Omni 1.1正在谷歌开发者生态系统中推出:
- 在Google AI Studio中开始构建:直接在Google AI Studio中试用Omni 1.1。
- 在Gemini Enterprise Agent Platform上构建:企业可以直接通过Agent Platform API使用Omni 1.1进行构建。
- 探索开发者文档:查看官方文档、食谱和提示指南,了解如何将场景扩展、视频参考和超分辨率集成到你的应用程序中。
Omni 1.1今天起也面向全球所有Google AI Plus、Pro和Ultra订阅者在Google Flow中提供。场景扩展功能面向全球所有Google AI Plus、Pro和Ultra订阅者在Gemini应用中提供。
在收件箱中获取谷歌最新新闻
注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
您的信息将按照谷歌隐私政策使用。您可以随时退出。
来源:Google DeepMind · deepmind.google