在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(第一部分)
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
本文演示如何在 Amazon SageMaker AI 上部署 vLLM-Omni,实现从文本提示词生成图像并动画化为短视频。方案部署两个端点:FLUX.2-klein-4B 图像生成模型运行在实时端点,Wan2.1-VACE-1.3B 视频生成模型运行在异步端点,输出 MP4 文件存储于 Amazon S3。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业用例中对浏览器工作流的准确率超过 90%。该方案结合 Amazon Bedrock AgentCore 托管代理执行,以 AgentCore Browser 提供隔离远程浏览器环境,并由 EventBridge Scheduler 调度、SNS 发送失败告警,实现完全托管的合成监控。
Amazon Textract 将 adapter ID 外部化到 AWS Systems Manager Parameter Store,实现跨账户的 adapter 生命周期自动化管理,生产更新从耗时数小时或数天的协调流程缩短至数秒,且无需应用重新部署。
该方案在AWS上构建单一AI智能体,运行时按用户提问选择工具,对上传的视频返回自然语言答案。已分析内容的响应不到1秒,新视频初次分析需5–10分钟,代码已在GitHub开源。一家大型媒体娱乐公司采用后,对200多个多小时录音的手动审查时间减少约80%(未经独立验证)。
GPT-6 改进了提示词缓存,实现更高的缓存命中率,并新增诊断功能、显式断点以及降低延迟和成本的控制手段。
NVIDIA 推出 DSX Ready 资格认证项目,面向满足 NVIDIA DSX AI 工厂参考设计要求的电源与冷却产品,首批涵盖电池储能系统(BESS)和冷却分配单元(CDU)。
埃及AI生态系统正从概念培育转向规模化生产,NVIDIA在开罗举办活动并推动当地开发者、初创企业与数据中心投资落地。NVIDIA Deep Learning Institute在埃及的学习者一年内增长超十倍;Hassan Allam数据中心获埃及监管机构许可,拟投资约4亿美元建设新设施。
NVIDIA 主张将 AI 安全作为工程问题处理,在智能体栈各层级落实安全要求、可控策略与责任归属,强调运行时环境须在智能体推理之外独立施加边界限制。NVIDIA OpenShell 提供开源安全运行时,在智能体能力之外强制策略并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已基于其构建治理与技能扫描能力。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 评测,在 Qwen3-VL 上吞吐量最高可达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上提升达 2.5 倍。GB300 NVL72 四机架扩展效率达 99%,软件优化较 v6.0 提升最高 1.6 倍。
推荐理由:原文给出了 Vera Rubin 在 MLPerf 上相对 GB300 的具体吞吐提升倍数和扩展效率,读者可据此评估新一代平台在推理经济性上的实际价值。
NVIDIA 在 AI 基础设施峰会上将AI工厂能效列为核心议题,其 DSX MaxLPS 软件在 Lambda 的首次验证中,于相同功率预算下将集群 token 吞吐量提升 24%,性能每瓦提升 23%。
费城儿童医院(CHOP)基于 NVIDIA 联合创立的开源医学影像框架 MONAI 构建心脏建模服务,将原本需专业研究员四小时的工作缩短至数秒,达到常规临床可用标准。
GRASP是一种新的基于梯度的规划器,用于学习动力学(世界模型),通过将轨迹提升为虚拟状态实现时间并行优化、直接向状态迭代添加随机性进行探索、重塑梯度以避免高维视觉模型中的脆弱梯度,从而让长视野规划变得实用。这项工作针对现代世界模型在长视野规划中的病态优化、非贪心局部极小和高维空间失效问题,提出了更鲁棒的梯度规划方法。