Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音对话模型,主打近实时推理。
推荐理由:官方基准显示新模型在语音智能体任务上领先并在成本上有竞争力,可据此判断生产环境中的应用价值。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。
推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。
Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。
推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。
推荐理由:官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。
Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。
推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。
Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。
推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。
Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。
推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。
Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。
推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。
推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。
推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:官方放出三款Flash模型的token效率、速度与价格数据,可据此评估它们对规模化智能体工作流的实际价值。
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型和 Gemini Omni Flash 视频生成与编辑模型。
推荐理由:原文给出两款新模型的延迟与成本,以及视频对话式编辑能力,读者可据此评估如何将图像生成与视频创作串进同一流水线。
Google DeepMind 将 computer use 集成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端与桌面端的智能体。
推荐理由:官方博客交代了此前独立模型的集成路径、开发入口与两套企业级防护机制,读者可据此评估它适合哪些自动化场景。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。
推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。
Google DeepMind 推出 Omni 家族首个模型 Gemini Omni Flash,支持图像、音频、视频和文本任意组合输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:Gemini 把推理能力与视频生成结合,支持多模态输入和对话式编辑,可从能力边界判断其对现有创作流程的影响。
谷歌宣布将SynthID和C2PA内容凭证验证能力扩展至Search、Gemini、Chrome和Pixel设备,并在Gemini应用中新增C2PA验证。SynthID已为超1000亿张图片视频和6万小时音频添加水印,验证功能已使用5000万次。谷歌还推出面向企业的AI内容检测API,并与OpenAI、ElevenLabs、Meta等公司合作,让更多平台识别和标注AI生成内容。
推荐理由:原文说明了水印技术覆盖规模和验证能力从Pixel扩展到搜索与浏览器的落地进度,读者可据此判断内容溯源工具的实际可用范围。
Google DeepMind 发布 Gemini 3.5 系列,首批推出 3.5 Flash,主打智能体与编码,今天面向 Gemini 应用、Google 搜索 AI 模式及 Antigravity 等平台开放。
推荐理由:官方给出了 3.5 Flash 的基准成绩和开放渠道,可据此判断它在智能体任务上的速度与成本取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,通过生成想法、辩论、演化三阶段循环迭代,自动产生并排序新颖的科学假说。该系统已通过 Hypothesis Generation 工具向个人研究者开放,注册入口在 labs.google/science。
推荐理由:介绍了多智能体系统如何通过生成、辩论、演化三阶段迭代产出科学假说,并用具体合作案例展示其实际成效。
Google DeepMind 发布新的分布式训练架构 Decoupled DiLoCo,通过解耦计算岛实现跨数据中心低带宽训练,并在硬件故障时隔离影响继续训练。该架构在 120 亿参数模型上跨美国四个区域以 2-5 Gbps 网络训练成功,速度比传统同步方法快 20 倍以上,并支持混合不同代际硬件(如 TPU v6e 和 v5p)。
推荐理由:该架构以解耦计算岛实现低带宽跨数据中心训练,抗硬件故障并支持混合硬件代际,可帮助理解分布式训练的前沿方向。