谷歌关停Gemini的Gems功能,将其迁移为“skills”
Google宣布关闭Gemini的Gems功能,将其自动迁移为可供不同AI任务使用的“skills”,迁移自2026年11月17日起生效,用户无需任何操作。2024年推出的Gems此前支持用户构建学习教练、编程伙伴等自定义AI助手,迁移后用户需在任务线程中输入“/”来调用技能。
Google宣布关闭Gemini的Gems功能,将其自动迁移为可供不同AI任务使用的“skills”,迁移自2026年11月17日起生效,用户无需任何操作。2024年推出的Gems此前支持用户构建学习教练、编程伙伴等自定义AI助手,迁移后用户需在任务线程中输入“/”来调用技能。
谷歌的 Suncatcher 轨道数据中心试验卫星 MVP 将于 10 月 1 日发射,用于验证在太空运行 AI 计算的可行性。卫星约冰箱大小,内置四块谷歌自研 TPU,依靠约 1 千瓦的太阳能供电,卫星本体由 Planet Labs 提供。初始计划 2027 年发射两颗定制卫星,此次提前进行集成测试。
YouTube在Made on YouTube活动上承诺今年晚些时候带来自定义信息流和更多AI功能。自定义信息流(Custom Feeds)可让用户通过描述生成新标签页,支持保存多个,先在美国的网页、移动和电视端推出;评论将支持GIF发布,私信也将新增群聊功能。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。
推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。
本期 Latent Space 访谈邀请拥有奥斯卡奖、两颗以自己命名的小行星的 Google 科学家 John Platt,重点讨论其团队开发的 Empirical Research Assistance(ERA)。
AINews 汇总 9/16-9/17 AI 动态:Anthropic 在 Claude Code 推出 Projects,支持单对话生成并行云端会话并在用户离开后继续运行;OpenAI 发布 Astra for Law,含 26 个合作伙伴插件与 47 个社区插件,宣称在合法基准上全价位胜过通用 GPT-6 Astra 加网页搜索。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心能根据电网状况动态调整用电,以换取更快、更大的并网接入。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款新语音对话模型,主打近实时推理。
推荐理由:官方基准显示新模型在语音智能体任务上领先并在成本上有竞争力,可据此判断生产环境中的应用价值。
Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。
推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。
Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。
推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 正式开放,新增场景扩展、首末帧指定、视频参考等生成视频能力。
推荐理由:官方给出了场景扩展、4K 放大等具体能力规格和定价,可帮助开发者评估能否直接接入生产工作流。
Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。
推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。
Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。
推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。
Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。
推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。
Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。
推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。
推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。
Google DeepMind今天在Google Flow Music中发布新一代音乐生成模型Lyria 3.5,提升音乐性、歌词、人声和创作控制。新模型支持更自然复杂的旋律结构、更好提示词遵循和结构意识的歌词、更具情感表现力的人声与更清晰发音,并让用户更易控制输出节奏和时长。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。
推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。
Google 宣布向 Genesis Mission 承诺 4000 万美元的 AI tokens 和 credits,用于加速科学发现的前沿研究。这笔资金将以 Google 的 AI 资源形式投入该任务。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:官方放出三款Flash模型的token效率、速度与价格数据,可据此评估它们对规模化智能体工作流的实际价值。
Google DeepMind 于 2026 年 7 月推出 ATL Saathi,一个基于 Gemini 的网页应用,为印度 Atal Tinkering Labs 教师提供 24/7 教学规划与培训助手。
Google DeepMind 与 A24 宣布建立一项首创性研究合作,双方将围绕多个项目开展长期研发,帮助艺术家开发新的工作流与技巧,使未来工具由创作者塑造。此外,Google 已对 A24 进行投资,具体目标与技术成果将随合作推进而演变。
Google DeepMind 发布 Nano Banana 2 Lite 图像生成模型和 Gemini Omni Flash 视频生成与编辑模型。
推荐理由:原文给出两款新模型的延迟与成本,以及视频对话式编辑能力,读者可据此评估如何将图像生成与视频创作串进同一流水线。
Google DeepMind 将 computer use 集成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端与桌面端的智能体。
推荐理由:官方博客交代了此前独立模型的集成路径、开发入口与两套企业级防护机制,读者可据此评估它适合哪些自动化场景。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org,宣布一项面向全球研究人员、总额最高 1000 万美元的技术研究资助,聚焦大规模多智能体 AI 系统在群体交互中的安全与稳定性。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。
推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。
Google DeepMind 在亚太地区推出首届 Accelerator 项目,聚焦“AI for the Planet”,以应对该区域日益加剧的环境风险。项目为期三个月,面向初创团队、研究团队和非营利组织,支持其利用前沿 AI 解决自然、气候、农业、能源等问题。入选机构将获得 Google AI 专家的指导及整合前沿 AI 和科学 AI 模型的支持。
Google DeepMind 在 Project Genie 中接入 Google Street View 街景,让用户基于真实地点生成交互式 3D 世界。该能力目前仅限美国地点,即日起向全球 Google AI Ultra $200 订阅者(18 岁以上)逐步开放。
Google DeepMind 推出 Omni 家族首个模型 Gemini Omni Flash,支持图像、音频、视频和文本任意组合输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:Gemini 把推理能力与视频生成结合,支持多模态输入和对话式编辑,可从能力边界判断其对现有创作流程的影响。
Google DeepMind 发布 Gemini for Science,包含基于 Co-Scientist、AlphaEvolve 和 NotebookLM 构建的 Hypothesis Generation。
谷歌宣布将SynthID和C2PA内容凭证验证能力扩展至Search、Gemini、Chrome和Pixel设备,并在Gemini应用中新增C2PA验证。SynthID已为超1000亿张图片视频和6万小时音频添加水印,验证功能已使用5000万次。谷歌还推出面向企业的AI内容检测API,并与OpenAI、ElevenLabs、Meta等公司合作,让更多平台识别和标注AI生成内容。
推荐理由:原文说明了水印技术覆盖规模和验证能力从Pixel扩展到搜索与浏览器的落地进度,读者可据此判断内容溯源工具的实际可用范围。
Google DeepMind 与新加坡政府达成新的国家 AI 合作伙伴关系,启动多项项目,将前沿 AI 应用于医疗、科研与教育。合作包括为所有中小学教师提供 Gemini for Education、探索 AI 辅助临床决策,并获 Google.org 700 万美元资助传染病研究。预计到 2040 年,这项合作可通过加速研发为新加坡创造 33 亿新元(约 25 亿美元)经济价值。
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 梳理衰老生物学中分散的发现,提出值得检验的假设。团队在整合应激反应(ISR)研究中生成关于代谢如何调节 ISR 的新假说,并借助工具优化实验设计,实验结果对 ISR 在健康与疾病中的作用具有重要含义,计划发表。
Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 结合各自专长,加速 ALS 研究。该工具将通常需数月掌握的文献梳理压缩为快速证据评估,生成可检验假说并排序可行方向,促成两人合作聚焦细胞表面 RNA 介导的信号机制,以寻找新型 RNA 靶向疗法。
Google DeepMind 发布 Gemini 3.5 系列,首批推出 3.5 Flash,主打智能体与编码,今天面向 Gemini 应用、Google 搜索 AI 模式及 Antigravity 等平台开放。
推荐理由:官方给出了 3.5 Flash 的基准成绩和开放渠道,可据此判断它在智能体任务上的速度与成本取舍。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,通过生成想法、辩论、演化三阶段循环迭代,自动产生并排序新颖的科学假说。该系统已通过 Hypothesis Generation 工具向个人研究者开放,注册入口在 labs.google/science。
推荐理由:介绍了多智能体系统如何通过生成、辩论、演化三阶段迭代产出科学假说,并用具体合作案例展示其实际成效。
Google DeepMind在AlphaGo十周年之际宣布与韩国科学技术信息通信部建立合作伙伴关系,以支持韩国的AI战略和科研生态。
Google DeepMind 发布新的分布式训练架构 Decoupled DiLoCo,通过解耦计算岛实现跨数据中心低带宽训练,并在硬件故障时隔离影响继续训练。该架构在 120 亿参数模型上跨美国四个区域以 2-5 Gbps 网络训练成功,速度比传统同步方法快 20 倍以上,并支持混合不同代际硬件(如 TPU v6e 和 v5p)。
推荐理由:该架构以解耦计算岛实现低带宽跨数据中心训练,抗硬件故障并支持混合硬件代际,可帮助理解分布式训练的前沿方向。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 建立合作,推动前沿 AI 在各行业的规模化应用。
Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。
推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。