跳到正文

#Google

今日 0 条
9月29日周二
  1. TechCrunch · AI34

    谷歌关停Gemini的Gems功能,将其迁移为“skills”

    Google宣布关闭Gemini的Gems功能,将其自动迁移为可供不同AI任务使用的“skills”,迁移自2026年11月17日起生效,用户无需任何操作。2024年推出的Gems此前支持用户构建学习教练、编程伙伴等自定义AI助手,迁移后用户需在任务线程中输入“/”来调用技能。

9月25日周五
9月24日周四
9月23日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款文本转语音模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建人物声音,并逐行控制台词演绎。

    推荐理由:原文给出了自定义声音与逐行导演的具体入口和能力边界,读者可据此判断新模型如何改变配音和语音交互的工作流。

9月18日周五
9月16日周三
9月3日周四
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,3.8 Flash 保持与 3.7 Flash 相同的每百万输入 token 0.75 美元、输出 3.75 美元定价。

    推荐理由:原文给出 3.8 Flash 的定价、编码与智能体基准成绩,以及 Cyber 版的安全管控方式,可据此判断其在企业自动化中的定位。

9月2日周三
  1. Google DeepMind73

    Google DeepMind发布Gemini智能体视频理解,token消耗最高降88%

    Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。

    推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。

8月28日周五
8月27日周四
  1. Google DeepMind66

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文字模型

    Google DeepMind 于 2026 年 8 月推出 Gemini 3.5 Transcribe 语音转文字模型,支持流式与非流式两种 API,面向开发者已在 Google AI Studio 和 Gemini Enterprise Agent Platform 公开预览,并开放给 Gemini macOS 应用和 Android Rambler。

    推荐理由:相比此前的 Chirp 3,新模型在 WER 与延迟上明显提升,读者可据此评估它对实时语音应用的价值。

8月14日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.7 Flash,面向编码与智能体的工作负载模型

    Google DeepMind 今日推出 Gemini 3.7 Flash,定位为迄今最智能的编码与智能体工作负载模型,距离 3.6 Flash 发布仅三周。相比 3.6 Flash,它在编码基准 FrontierCode 1.1(43.6% 对 34.4%)和 DeepSWE v1.1(65.3% 对 49.0%)上显著提升,并改善网页开发与多领域知识推理能力。

    推荐理由:原文给出了 3.7 Flash 相比 3.6 Flash 在编码、网页开发和领域推理上的基准提升数据及首发优惠价,可帮开发者判断升级价值与性价比。

8月12日周三
  1. Google DeepMind79

    Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

    推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。

8月6日周四
  1. Google DeepMind77

    Google DeepMind 开源 WeatherNext 模型,气旋预测可提前一天

    Google DeepMind 在 Nature 发表论文,宣布 WeatherNext 模型在预测气旋轨迹、强度和风场结构上达到当前最优,平均比先前模型多出一天预测时间,并将代码和权重开源。

    推荐理由:文章给出WeatherNext在气旋预测上平均多出一天提前量的具体成绩并宣布开源,可帮助读者理解这项技术对气象预报的实用价值。

7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。

    推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。

7月28日周二
  1. Google DeepMind68

    Gemini Robotics 2 发布,带来全身智能、精细操控与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。

    推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。

7月22日周三
7月21日周二
7月13日周一
7月3日周五
  1. Google DeepMind40

    Google DeepMind 与 A24 宣布开展首创研究合作

    Google DeepMind 与 A24 宣布建立一项首创性研究合作,双方将围绕多个项目开展长期研发,帮助艺术家开发新的工作流与技巧,使未来工具由创作者塑造。此外,Google 已对 A24 进行投资,具体目标与技术成果将随合作推进而演变。

7月1日周三
6月25日周四
  1. Google DeepMind73

    Gemini 3.5 Flash 新增内置 computer use 功能

    Google DeepMind 将 computer use 集成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建跨浏览器、移动端与桌面端的智能体。

    推荐理由:官方博客交代了此前独立模型的集成路径、开发入口与两套企业级防护机制,读者可据此评估它适合哪些自动化场景。

6月10日周三
6月9日周二
  1. Google DeepMind72

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。

    推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。

5月22日周五
  1. Google DeepMind29

    Google DeepMind 在亚太地区推出加速器项目以应对环境风险

    Google DeepMind 在亚太地区推出首届 Accelerator 项目,聚焦“AI for the Planet”,以应对该区域日益加剧的环境风险。项目为期三个月,面向初创团队、研究团队和非营利组织,支持其利用前沿 AI 解决自然、气候、农业、能源等问题。入选机构将获得 Google AI 专家的指导及整合前沿 AI 和科学 AI 模型的支持。

5月18日周一
5月17日周日
  1. Google DeepMind63

    谷歌扩展内容透明与验证工具,新增AI内容检测API

    谷歌宣布将SynthID和C2PA内容凭证验证能力扩展至Search、Gemini、Chrome和Pixel设备,并在Gemini应用中新增C2PA验证。SynthID已为超1000亿张图片视频和6万小时音频添加水印,验证功能已使用5000万次。谷歌还推出面向企业的AI内容检测API,并与OpenAI、ElevenLabs、Meta等公司合作,让更多平台识别和标注AI生成内容。

    推荐理由:原文说明了水印技术覆盖规模和验证能力从Pixel扩展到搜索与浏览器的落地进度,读者可据此判断内容溯源工具的实际可用范围。

5月16日周六
  1. Google DeepMind41

    Google DeepMind 与新加坡达成新国家 AI 合作伙伴关系,强化新加坡 AI 未来

    Google DeepMind 与新加坡政府达成新的国家 AI 合作伙伴关系,启动多项项目,将前沿 AI 应用于医疗、科研与教育。合作包括为所有中小学教师提供 Gemini for Education、探索 AI 辅助临床决策,并获 Google.org 700 万美元资助传染病研究。预计到 2040 年,这项合作可通过加速研发为新加坡创造 33 亿新元(约 25 亿美元)经济价值。

  2. Google DeepMind23

    Calico Life Sciences 借助 Co-Scientist 开启衰老研究新路径

    Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 梳理衰老生物学中分散的发现,提出值得检验的假设。团队在整合应激反应(ISR)研究中生成关于代谢如何调节 ISR 的新假说,并借助工具优化实验设计,实验结果对 ISR 在健康与疾病中的作用具有重要含义,计划发表。

  3. Google DeepMind22

    Co-Scientist 如何融合不同生物学工具探索 ALS 新路径

    Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 结合各自专长,加速 ALS 研究。该工具将通常需数月掌握的文献梳理压缩为快速证据评估,生成可检验假说并排序可行方向,促成两人合作聚焦细胞表面 RNA 介导的信号机制,以寻找新型 RNA 靶向疗法。

5月12日周二
  1. Google DeepMind63

    Google DeepMind 发布多智能体科研助手 Co-Scientist

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 的多智能体系统,通过生成想法、辩论、演化三阶段循环迭代,自动产生并排序新颖的科学假说。该系统已通过 Hypothesis Generation 工具向个人研究者开放,注册入口在 labs.google/science。

    推荐理由:介绍了多智能体系统如何通过生成、辩论、演化三阶段迭代产出科学假说,并用具体合作案例展示其实际成效。

4月27日周一
4月22日周三
  1. Google DeepMind71

    Google DeepMind 发布 Decoupled DiLoCo 架构,实现低带宽抗故障的跨数据中心训练

    Google DeepMind 发布新的分布式训练架构 Decoupled DiLoCo,通过解耦计算岛实现跨数据中心低带宽训练,并在硬件故障时隔离影响继续训练。该架构在 120 亿参数模型上跨美国四个区域以 2-5 Gbps 网络训练成功,速度比传统同步方法快 20 倍以上,并支持混合不同代际硬件(如 TPU v6e 和 v5p)。

    推荐理由:该架构以解耦计算岛实现低带宽跨数据中心训练,抗硬件故障并支持混合硬件代际,可帮助理解分布式训练的前沿方向。

4月21日周二
4月16日周四
  1. Google DeepMind66

    Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制

    Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。

    推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。