跳到正文
原文
Google DeepMind·· 2026-04-16精选AI 评分66

Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制

Gemini 3.1 Flash TTS: the next generation of expressive AI speech

AI 导读

Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。

推荐理由

原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。

正文 · AI 翻译

2026年4月15日

|

我们最新的音频模型引入了细粒度的音频标签,让您能够精确控制AI语音,实现富有表现力的音频生成。


Vilobh Meshram

高级产品经理

Max Gubin

代表Gemini团队的首席研究工程师


Gemini logo next to the text "3.1 Flash TTS", all over colored dots

收听文章

[[duration]]分钟

此内容由Google AI生成。生成式AI处于实验阶段

今天,我们推出Gemini 3.1 Flash TTS,这是最新的文本转语音模型,提供了更好的可控性、表现力和质量——赋能开发者、企业和日常用户构建下一代AI语音应用。

从今天起,3.1 Flash TTS开始推出:

改进的语音质量和可控性

我们改进了Gemini 3.1 Flash TTS的整体语音质量,使其成为迄今为止最自然、最富有表现力的模型。在Artificial Analysis TTS排行榜(一个包含数千次盲测人类偏好的基准测试)上,3.1 Flash TTS取得了令人瞩目的Elo评分1211分。

a gif showing artificial analysis text to speech arena quality elo

Artificial Analysis还将Gemini 3.1 Flash TTS列入了其“最具吸引力象限”,因为它在高质量语音生成和低成本之间实现了理想平衡。该模型还凭借原生多说话人对话、支持70多种语言以及通过自然语言进行细粒度创意控制而脱颖而出。

新的音频标签带来更富有表现力的语音生成

3.1 Flash TTS还引入了音频标签——一种直观控制声音风格、节奏和演绎方式的方法。通过直接在文本输入中嵌入自然语言命令,您可以用更细的粒度来控制AI语音输出。

3.1 Flash TTS使企业能够在Vertex AI中使用音频标签,赋能下一代企业应用。

3.1 Flash TTS让您可以使用音频标签来试验语音的表现力、节奏和演绎方式。

3.1 Flash TTS让您可以集成富有表现力的语音能力,将普通的天气应用变成引人入胜的体验。

3.1 Flash TTS支持一系列音频标签,可为同义词寻宝应用添加细腻且引人入胜的演绎。

您可以开始尝试这些音频标签,以及Google AI Studio中开发者体验的其他更新,可配置的控制让开发者坐上“导演椅”:

  • 场景指示:通过定义环境并提供具体的对话指令来设定舞台。这种世界构建上下文有助于角色在多轮对话中保持“角色一致性”,并自然地相互回应。
  • 说话人级别特异性:使用独特的音频配置文件来“选角”,然后指定导演笔记以切换节奏、语气和口音。使用内联标签,说话者可以在句子中途偏离这些高级设置来改变表达。
  • 无缝导出:一旦表演完善,这些精确参数可以导出为Gemini API代码,确保在不同项目和平台上保持一致且可识别的语音。

借助这些新配置,开发者可以在特定场景中提高精确度,创造令人难忘的角色和沉浸式音频体验。

为全球规模而构建

Gemini 3.1 Flash TTS 提供高保真语音,并在70多种语言中实现更精确的控制。这些核心优化为主要市场带来了先进的风格、语速和口音控制——帮助开发者在全球范围内为用户打造本地化、富有表现力的语音体验。

早期开发者与企业测试者已经看到了 3.1 Flash TTS 的影响,并强调了其令人印象深刻的控制力和表现力。他们告诉我们,音频标签如何提供了新的创意精度水平,将简单的文本转化为高保真的声音表演。

Quote from Jay of StyleUAI

Quote from CTO of AIM Intelligence

Quote from Idan Yonas of Artlist

Quote from Lydia Xu of Sierra

Quote from Shivam Rastogi of Invideo AI

Quote from Fernanda Bejarano of biia

Quote from John Wu of HeyGen

Quote from Soami Kapadia of You learn.AI

Quote from Angel Wen of Sylph.ai

Quote from Artugrul Cavusoglu of Mindlid

使用 SynthID 加水印

Gemini 3.1 Flash TTS 生成的所有音频均使用 SynthID 加水印。这种不可感知的水印直接嵌入音频输出中,能够可靠地检测 AI 生成的内容,从而帮助防止虚假信息。有关我们的安全与责任方法的更多信息,您可以查看 模型卡。

在您的收件箱中获取来自 Google 的最新新闻

注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。

您的信息将按照Google 隐私政策使用。您可以随时退出。

来源:Google DeepMind · deepmind.google