跳到正文

#语音

今日 0 条
9月29日周二
  1. TechCrunch · AI36

    祖父被深度伪造语音骗过之后,这位创始人创办了 DetectifAI

    祖父因无法分辨AI克隆语音而受骗后,Tarini Padmanabhuni创办了总部位于旧金山的DetectifAI,其紧凑型AI模型可直接在手机操作系统内运行,实时判断语音是否为AI生成,且音频无需离开设备。据FBI数据,美国人去年因AI骗局损失近9亿美元,较2024年增长24%。DetectifAI优先向手机厂商授权其SDK,已在印度为金融机构每月处理超过10万通AI语音代理电话。

9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。

    推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。

9月16日周三
8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

4月16日周四
  1. Google DeepMind66

    Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制

    Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。

    推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。