Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型
Gemini 3.8 text-to-speech says hello
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
2026年9月23日
|
Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今为止表现力最强的音频生成模型。可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中生成自定义角色声音和直接场景对话。
Leland Rechis
集团产品经理
Alan Cowen
研究科学总监,代表 Gemini 音频团队
今天,我们向 Gemini 家族推出两款新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型使创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时改善诸如 Gemini Notebook 和 Google Vids 等产品中的用户体验。
- Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示从零开始创建全新声音,为游戏、沉浸式有声书、播客和互动媒体中的角色注入生命。通过逐行控制表演,精准指导表演提示、节奏、方言转换和回应声。
- Gemini 3.8 Flash-Lite TTS:专为高容量、高成本效益的规模化而设计。针对高容量配音、音频内容创作和表现力丰富的语音代理进行了优化,可精细控制语调、节奏和表现力细节。
这些模型补充了我们快速发展的 Gemini 音频家族,紧随 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking 之后。
创建并定制你自己的声音
从 30 种原始声音扩展至无限库。无论你需要一个完全原创的角色声音,还是一个一致的品牌代言人,我们的 3.8 Flash TTS 模型都能提供完整的语音工作室。这使你能够为每个时刻创建并使用富有表现力、自然动听的声音,同时赋能开发者和企业轻松构建自定义音频体验。
- 生成式声音设计:借助 Gemini 3.8 Flash TTS,通过自然语言提示自定义角色、口音和声音特征,覆盖 100 多种语言和方言,从零开始创建定制声音——无论是打造一个戏剧性的喷火龙,还是塑造一位具有独特地域节奏的魅力叙述者。
- 丰富的声音库:可访问 2000 多种生产就绪的声音,广泛覆盖多种语言——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
- 声音复制:仅需 30 秒的音频样本(你的声音或你有权使用的声音),即可重建一致的语音档案,并内置同意验证、SynthID 水印和 C2PA 凭证,以保护开发者及其配音人才。
- 保存和扩展:保存并管理你设计的自定义声音,确保在持续项目中的一致表现和最小漂移。
- 声音混音:即将推出——从我们的声音库中选择一个声音,并微调音色、音高、节奏和口音。使用提示来调整特征(例如“添加微妙的美国南部口音”或“缓和表达方式”)。
逐行指导表演
选定声音后,两款 TTS 模型都能让你精确控制每一行的呈现方式。
- 逐行直接表演控制: 编写你自己的舞台指示,或让 Gemini 通过自然脚本提示来引导表演——从平静的客服代表到轻声细语的悬疑场景。
- 长篇生成: 在数小时的连续音频中保持高音质、自然节奏和角色音色,且说话人漂移极小——非常适合播客和有声书。
- 原生双说话人场景编排: 从单个脚本无缝导演多轮对话——无论是播客还是戏剧叙事——同时保持两个声音清晰分离,并带有自然的对话轮换。
- 脚本化的声音爆发与反馈插话: 使用非语言提示(如 <laughs>、<sigh>、<gasp>)和积极倾听的插话(如 |mhm| 或 |yeah|)添加逼真的对话质感,以实现精准的喜剧节奏和反应拍点。
获得面向全球规模的高表现力语音生成能力
Gemini 3.8 Flash TTS 提供了领先的语音定制能力,在 Hume AI 的语音设计基准(71.4分)中整体排名第一,同时在口音建模(60.8分)方面也处于领先地位。
Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 在不牺牲可靠性的前提下实现了真正富有表现力的表演,在 Hume AI 的总体质量指数中分别占据第一和第二的位置。与 Gemini 3.1 Flash TTS 相比,该模型在长篇内容和双说话人剧本控制等多种用例上表现出显著改进。
在 Voice Arena 的盲选人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在全球关键语言中领先于竞争对手,包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语。这些模型支持超过100种语言,赋能创作者、开发者和企业在全球范围内构建高质量的多语言语音体验。
以信任、同意和透明度为基础进行构建
我们构建语音创建和复制能力时,采用了严格的保护措施,以帮助保护配音人才、尊重身份并确保内容透明度。对于语音复制,我们的系统利用同意验证:用户必须提供与参考说话人匹配的语音所有者口头同意录音,才能创建语音。
更广泛地说,我们 Gemini 音频模型生成的每个音频片段都带有 SynthID 水印。这种不可感知的水印直接嵌入音频输出中,确保 AI 生成的语音保持可检测性,以帮助防止错误信息。有关我们安全和责任方法的更多详细信息,请查看 模型卡。
试用我们全新的 Google AI Studio 音频工作台
从今天起,开发者可以在 Google AI Studio 中体验这些新的语音生成功能。它就像一个语音设计工作空间,你可以从零提示出全新的声音身份,或复制你自己的声音 1 ,然后直接将它们带入双说话人剧本编辑器,逐行指导表演。
在 Google AI Studio 中尝试语音复制。
轻松部署高性能语音界面
通过使用 Gemini API,诸如 Agora、LiveKit、Pipecat、Vercel 等开发者平台使开发者能够轻松构建和部署高性能的语音生成体验。
我们正在与Figma、HeyGen、Linguana、Wondercraft、99.co和Ollang等公司合作,他们正在集成我们最新的TTS模型,以加速全球配音、用细腻的地域口音本地化媒体,并大规模驱动对话式语音代理。
开始使用我们最新的Gemini音频模型:
Gemini 3.8 Flash TTS 从今天开始推出:
- 面向开发者:在 Gemini API 和 Google AI Studio 中
- 面向企业:即将通过 Gemini Enterprise 中的API提供
- 面向所有人:在 Gemini Notebook 中。
Gemini 3.8 Flash-Lite TTS 从今天开始推出:
- 面向开发者:在 Gemini API 和 Google AI Studio 中
- 面向企业:即将通过 Gemini Enterprise 中的API提供
- 面向所有人:在 Google Vids 中
在您的收件箱中获取来自Google的最新消息
注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
您的信息将按照Google的隐私政策使用。您可以随时退出。
来源:Google DeepMind · deepmind.google