使用 vLLM-Omni 在 SageMaker AI 上生成图像与视频(下)
本文演示如何在 Amazon SageMaker AI 上部署 vLLM-Omni,实现从文本提示词生成图像并动画化为短视频。方案部署两个端点:FLUX.2-klein-4B 图像生成模型运行在实时端点,Wan2.1-VACE-1.3B 视频生成模型运行在异步端点,输出 MP4 文件存储于 Amazon S3。
本文演示如何在 Amazon SageMaker AI 上部署 vLLM-Omni,实现从文本提示词生成图像并动画化为短视频。方案部署两个端点:FLUX.2-klein-4B 图像生成模型运行在实时端点,Wan2.1-VACE-1.3B 视频生成模型运行在异步端点,输出 MP4 文件存储于 Amazon S3。
武汉法院在AI生成短剧版权纠纷中,首次将token使用费和AI工具许可费计入侵权赔偿计算,判赔2万元人民币。法院认定该短剧为受保护的视听作品,因员工在脚本、提示词、输出选择和最终剪辑各环节都做了创造性决策,AI仅为工具;同时建议创作者保留脚本、提示词草稿等项目文件作为记录。
Simon Willison 用 Claude Opus 5.5 生成了包含 20 只新西兰鸮鹦鹉的像素动画派对页面,再让 Claude Code 通过 Playwright 自动点击并录制成 15 秒视频用于演讲闭幕。他在文中给出了完整 prompt 和 Playwright 脚本,可复用。
Latent Space 采访 Runway CTO、研究科学家及联创,解读 GWM Worlds 2 的 WorldPrompt 功能与实时世界模型的工程挑战。
YouTube在Made on YouTube活动上承诺今年晚些时候带来自定义信息流和更多AI功能。自定义信息流(Custom Feeds)可让用户通过描述生成新标签页,支持保存多个,先在美国的网页、移动和电视端推出;评论将支持GIF发布,私信也将新增群聊功能。
该方案在AWS上构建单一AI智能体,运行时按用户提问选择工具,对上传的视频返回自然语言答案。已分析内容的响应不到1秒,新视频初次分析需5–10分钟,代码已在GitHub开源。一家大型媒体娱乐公司采用后,对200多个多小时录音的手动审查时间减少约80%(未经独立验证)。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新视频功能,为小企业简化视频广告制作,并加快新创意工具上市。
Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。
推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。
推荐理由:官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型和 Gemini Omni Flash 视频生成与编辑模型。
推荐理由:原文给出两款新模型的延迟与成本,以及视频对话式编辑能力,读者可据此评估如何将图像生成与视频创作串进同一流水线。
Google DeepMind 推出 Omni 家族首个模型 Gemini Omni Flash,支持图像、音频、视频和文本任意组合输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:Gemini 把推理能力与视频生成结合,支持多模态输入和对话式编辑,可从能力边界判断其对现有创作流程的影响。