在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(第一部分)
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音对话模型,主打近实时推理。
推荐理由:官方基准显示新模型在语音智能体任务上领先并在成本上有竞争力,可据此判断生产环境中的应用价值。
Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。
推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。
Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。
推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。