Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。
原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。
2026年4月15日
|
我们最新的音频模型引入了细粒度的音频标签,让您能够精确控制AI语音,实现富有表现力的音频生成。
Vilobh Meshram
高级产品经理
Max Gubin
代表Gemini团队的首席研究工程师
收听文章
[[duration]]分钟
此内容由Google AI生成。生成式AI处于实验阶段
今天,我们推出Gemini 3.1 Flash TTS,这是最新的文本转语音模型,提供了更好的可控性、表现力和质量——赋能开发者、企业和日常用户构建下一代AI语音应用。
从今天起,3.1 Flash TTS开始推出:
- 面向开发者的预览版,可通过Gemini API和Google AI Studio获取
- 面向企业的预览版,可在Vertex AI上获取
- 面向Workspace用户,通过Google Vids获取
改进的语音质量和可控性
我们改进了Gemini 3.1 Flash TTS的整体语音质量,使其成为迄今为止最自然、最富有表现力的模型。在Artificial Analysis TTS排行榜(一个包含数千次盲测人类偏好的基准测试)上,3.1 Flash TTS取得了令人瞩目的Elo评分1211分。
Artificial Analysis还将Gemini 3.1 Flash TTS列入了其“最具吸引力象限”,因为它在高质量语音生成和低成本之间实现了理想平衡。该模型还凭借原生多说话人对话、支持70多种语言以及通过自然语言进行细粒度创意控制而脱颖而出。
新的音频标签带来更富有表现力的语音生成
3.1 Flash TTS还引入了音频标签——一种直观控制声音风格、节奏和演绎方式的方法。通过直接在文本输入中嵌入自然语言命令,您可以用更细的粒度来控制AI语音输出。
3.1 Flash TTS使企业能够在Vertex AI中使用音频标签,赋能下一代企业应用。
3.1 Flash TTS让您可以使用音频标签来试验语音的表现力、节奏和演绎方式。
3.1 Flash TTS让您可以集成富有表现力的语音能力,将普通的天气应用变成引人入胜的体验。
3.1 Flash TTS支持一系列音频标签,可为同义词寻宝应用添加细腻且引人入胜的演绎。
您可以开始尝试这些音频标签,以及Google AI Studio中开发者体验的其他更新,可配置的控制让开发者坐上“导演椅”:
- 场景指示:通过定义环境并提供具体的对话指令来设定舞台。这种世界构建上下文有助于角色在多轮对话中保持“角色一致性”,并自然地相互回应。
- 说话人级别特异性:使用独特的音频配置文件来“选角”,然后指定导演笔记以切换节奏、语气和口音。使用内联标签,说话者可以在句子中途偏离这些高级设置来改变表达。
- 无缝导出:一旦表演完善,这些精确参数可以导出为Gemini API代码,确保在不同项目和平台上保持一致且可识别的语音。
借助这些新配置,开发者可以在特定场景中提高精确度,创造令人难忘的角色和沉浸式音频体验。
为全球规模而构建
Gemini 3.1 Flash TTS 提供高保真语音,并在70多种语言中实现更精确的控制。这些核心优化为主要市场带来了先进的风格、语速和口音控制——帮助开发者在全球范围内为用户打造本地化、富有表现力的语音体验。
早期开发者与企业测试者已经看到了 3.1 Flash TTS 的影响,并强调了其令人印象深刻的控制力和表现力。他们告诉我们,音频标签如何提供了新的创意精度水平,将简单的文本转化为高保真的声音表演。
使用 SynthID 加水印
Gemini 3.1 Flash TTS 生成的所有音频均使用 SynthID 加水印。这种不可感知的水印直接嵌入音频输出中,能够可靠地检测 AI 生成的内容,从而帮助防止虚假信息。有关我们的安全与责任方法的更多信息,您可以查看 模型卡。
在您的收件箱中获取来自 Google 的最新新闻
注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
您的信息将按照Google 隐私政策使用。您可以随时退出。
来源:Google DeepMind · deepmind.google