小米 MiMo-V2.6 系列发布,Pro 版登顶开源权重模型基准
小米发布 MixMo-V2.6 系列开源原生全模态模型,其中 Pro 版在 Artificial Analysis 智能指数上以 46 分登顶开源权重模型,模型约 1.02T 总参数、42B 活跃参数,MIT 许可;Flash 版平衡智能、效率与成本,UltraSpeed 版提供高达 20 倍的输出速度。
小米发布 MixMo-V2.6 系列开源原生全模态模型,其中 Pro 版在 Artificial Analysis 智能指数上以 46 分登顶开源权重模型,模型约 1.02T 总参数、42B 活跃参数,MIT 许可;Flash 版平衡智能、效率与成本,UltraSpeed 版提供高达 20 倍的输出速度。
Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。
推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。
推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。
Google DeepMind今天在Google Flow Music中发布新一代音乐生成模型Lyria 3.5,提升音乐性、歌词、人声和创作控制。新模型支持更自然复杂的旋律结构、更好提示词遵循和结构意识的歌词、更具情感表现力的人声与更清晰发音,并让用户更易控制输出节奏和时长。
Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。
推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。
推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其具身推理模型的重要升级,今天起通过 Gemini API 和 Google AI Studio 开放给开发者。
推荐理由:原文给出 Gemini Robotics-ER 1.6 在空间推理、仪表读数与安全能力上的提升,并开放 API 供开发者接入,便于判断其实际可用性。
Google DeepMind 发布开源模型 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可,31B 模型在 Arena 文本榜单位列开源模型第 3。新模型支持 140+ 语言、最高 256K 上下文、原生多模态与语音输入,可离线运行于手机等边缘设备,并兼容 Hugging Face、vLLM、Ollama 等主流工具。
推荐理由:官方披露 Gemma 4 四个尺寸与 Apache 2.0 许可,有助于评估其智能-参数比优势和本地部署门槛。