跳到正文
原文
Google DeepMind·· 2026-08-27精选AI 评分66

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

Intelligent transcription with Gemini 3.5 Transcribe

AI 导读

Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

推荐理由

相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

正文 · AI 翻译

2026年8月26日

|

我们最新的语音转文字模型,专为精准、智能的实时转写而设计。


迭戈·梅伦多·卡萨多

高级工程总监,Gemini Audio

卢克·莱昂哈德

Gemini Audio 幕僚长,代表 Gemini Audio 团队


Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 具有实验性

今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今最精准的语音转文字模型,专为智能语音交互而设计。与在背景噪音、复杂术语和口误清理方面表现不佳的传统语音识别模型不同,Gemini 3.5 Transcribe 可将原始音频直接转换为准确、精炼、格式化的文本。

在我们的 Gemini 应用和 Android 等产品中,我们看到用户已经通过新的语音功能受益于这一转写模型,例如 Android 上的 Rambler 以及 macOS 上的 Gemini 应用。现在,开发者可以在 Google AI Studio 的 Gemini API 和 Gemini 企业智能体平台 中,使用 Gemini 3.5 Transcribe 构建类似的功能。

我们构建的 3.5 Transcribe 可以无缝融入你的开发者工作流程,无论你是在构建语音智能体、实时字幕工具,还是通话后分析管道。该模型可通过两个独立的 API 使用:

  • 实时流式传输:通过 Live API 使用 gemini-3.5-transcribe-live. 为交互式语音应用提供亚秒级延迟的连续双向流式传输。
  • 预录音频处理:通过 Interactions API 使用 gemini-3.5-transcribe. 转写录制的音频、会议、通话记录等,并支持说话人归属和词级时间戳。

获得更精准、更智能的转写

Gemini 3.5 Transcribe 旨在捕捉你的自然说话风格,以更好地理解你的意图并识别自定义词汇,从而让你用语音执行任务。

  • 智能转写:无缝处理自我纠正(如 “我们周二见面——不,周三”),移除填充词(“嗯”和“啊”),并自动格式化文本。
  • 函数调用:该模型可以通过函数调用将复杂任务(如图像生成和文件分析)委派给其他 Gemini 模型。目前可在 Gemini macOS 应用 中使用。
  • 更精准的转写:根据 Artificial Analysis 的测量,流式用例的平均词错误率(WER)为 4.0%,非流式用例为 2.6%。它在嘈杂的真实环境中表现出色,能准确识别邮政编码和订单 ID 等字母数字实体。
  • 自定义词汇:通过无缝调整转写结果以适应你提供的自定义词汇,识别专业术语和独特拼写。
  • 全球语言支持:自动检测并转写超过 85 种语言,无缝处理地区口音和多样方言。
  • 多说话人识别:在预录音频中准确归属语音,并为最多三位说话人提供时间戳(支持 3 位以上说话人仍处于实验阶段)。

Gemini 3.5 Transcribe 的性能相比我们之前的转录模型 Chirp 3 有了重大进步,提供了新功能、更低的词错误率和显著改善的延迟。例如,根据 Artificial Analysis 的测量,最终转录时间提升了70%。在覆盖多种顶级语言和地区的 FLEURS 基准测试中,该模型提供了精确的多语言性能,优于 Chirp 3,在流式模式下实现了5.50%的词错误率,在非流式用例中实现了5.04%的词错误率。

Graph of streaming speech recognition accuracy

Graph of streaming speech recognition accuracy

体验智能转录和高级听写

除了 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 之外,3.5 Transcribe 超越了标准的语音转文字,让在 Google 中的工作变得更加自然和直观。通过将上下文感知理解直接带入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常界面,它轻松捕捉细微差别、意图和内联编辑。

  • 在 Android 上的 Gboard 上,通过新的 Rambler 功能,3.5 Transcribe 将口述的想法转换为格式良好的文本,过滤掉填充词。您还可以使用语音进行编辑、纠正拼写错误和更改写作风格。
  • 在 Google Antigravity 上,3.5 Transcribe 在您的许可下结合屏幕上下文和聊天历史,确保对文件名、智能体想法和活动文档进行精准转录。
  • 在 Google AI Studio 中,您可以在构建模式下使用 3.5 Transcribe,通过语音即时编写代码应用。
  • 在 macOS 上的 Gemini 应用 中,3.5 Transcribe 不仅将您的自然语音转录为干净的格式化文本,还实现了可与屏幕上下文无缝结合的语音命令,以支持复杂工作流。通过在后台调用其他 Gemini 模型来处理繁重任务,该模型让您仅需使用语音即可轻松总结本地文件、跨应用重用文本或在光标处生成图像。
  • 即将在 Chrome 中推出,您将能够在任何网页字段中通过语音输入——让在 Chrome 中使用语音更自然、更轻松地进行回复、撰写帖子或提示 Gemini。

阅读早期评测

通过利用 Gemini Live API,诸如 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者完全专注于打造用户体验。

vivo、Intellitek Health 和 Lingopal 等公司也对 3.5 Transcribe 给予了积极反馈,称赞其出色的延迟、准确性和广泛的语言支持。

vivo testimonial

IntelliTek testimonial

Lingopal testimonial

Stream testimonial

Agora testimonial

fishjam testimonial

立即开始使用 3.5 Transcribe

在收件箱中获取来自 Google 的最新新闻

注册我们的新闻通讯,获取产品更新、活动信息、特别优惠等。

您的信息将按照Google 隐私政策使用。您可以随时选择退出。

来源:Google DeepMind · deepmind.google