跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–24 条 · 共 24 条
4月16日周四
  1. Google DeepMind66

    Google 发布 Gemini 3.1 Flash TTS,支持音频标签和自然语言语音控制

    Google 今日推出 Gemini 3.1 Flash TTS 文本转语音模型,引入音频标签,可通过自然语言指令控制语音风格、节奏和语调。模型在 Artificial Analysis TTS 榜单获得 Elo 1211,支持 70 多种语言,输出均带 SynthID 水印,并向开发者和企业开放预览。

    推荐理由:原文给出音频标签的控场方案和 Elo 成绩,可帮助读者了解新一代语音模型在表达控制上的具体进步。

4月13日周一
4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布开源模型 Gemma 4,主打推理与智能体工作流

    Google DeepMind 发布开源模型 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可,31B 模型在 Arena 文本榜单位列开源模型第 3。新模型支持 140+ 语言、最高 256K 上下文、原生多模态与语音输入,可离线运行于手机等边缘设备,并兼容 Hugging Face、vLLM、Ollama 等主流工具。

    推荐理由:官方披露 Gemma 4 四个尺寸与 Apache 2.0 许可,有助于评估其智能-参数比优势和本地部署门槛。

3月29日周日
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 驱动的 AI 增强指针,落地 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的 AI 增强指针,让指针不仅能识别指向目标,还能理解它对用户为何重要。该设计基于保持流畅、展示与讲述、拥抱 This/That、像素实体化四项交互原则;即日起可在 Chrome 里用指针向 Gemini 询问网页内容,不久推出 Googlebook 的 Magic Pointer,并可在 Google AI Studio 试用。

    推荐理由:DeepMind 提出让指针理解指向目标与用户意图的四条设计原则,并已集成进 Chrome,是观察下一代 AI 交互入口形态的窗口。