Modulate 融资 2500 万美元,用于语音模型与分析套件
总部位于波士顿的语音智能初创公司 Modulate 完成 2500 万美元新一轮融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投。
总部位于波士顿的语音智能初创公司 Modulate 完成 2500 万美元新一轮融资,由 Future Ventures 领投,Hyperplane 和 Lakestar 参投。
祖父因无法分辨AI克隆语音而受骗后,Tarini Padmanabhuni创办了总部位于旧金山的DetectifAI,其紧凑型AI模型可直接在手机操作系统内运行,实时判断语音是否为AI生成,且音频无需离开设备。据FBI数据,美国人去年因AI骗局损失近9亿美元,较2024年增长24%。DetectifAI优先向手机厂商授权其SDK,已在印度为金融机构每月处理超过10万通AI语音代理电话。
本教程演示如何在 Amazon SageMaker AI 上通过 AWS vLLM-Omni DLC 部署 Qwen3-TTS,实现在完整语音生成完成前就开始播放的流式输出,避免长时间静默。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音对话模型,主打近实时推理。
推荐理由:官方基准显示新模型在语音智能体任务上领先并在成本上有竞争力,可据此判断生产环境中的应用价值。
Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。
推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。
Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。
推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。