跳到正文

#语音

今日 0 条
9月29日周二
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。

    推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。

9月16日周三
8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

4月16日周四
  1. Google DeepMind66

    Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制

    Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。

    推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。