Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型
Introducing Gemma 4 12B: a unified, encoder-free multimodal model
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。
原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。
2026年6月3日
|
Gemma 4 12B 旨在将高性能多模态智能直接带到你的笔记本电脑上,将移动优先的效率与先进的推理能力相结合。
Olivier Lacombe
Google DeepMind 产品管理总监
Gus Martins
Google DeepMind 产品经理
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 尚处于实验阶段
今天,我们推出 Gemma 4 12B,这是我们最新推出的模型,旨在将智能体多模态智能直接带到笔记本电脑上。它填补了我们面向边缘设备的 E4B 与更先进的 26B 专家混合(MoE)模型之间的空白,以更小的内存占用封装了强大的能力。这也是我们首款支持原生音频输入的中型模型。
感谢开发者社区,Gemma 4 模型的下载量现已突破 1.5 亿次。你们用这些模型构建了从可穿戴机械臂(用于物理辅助)到企业级 AI 安全的各种应用。我们期待看到你们用这个最新版本所创造的作品。
以下是 Gemma 4 12B 的独特之处概览:
- 新颖的统一架构: 无需多模态编码器。视觉和音频输入直接流入 LLM 主干网络。
- 先进推理能力: 基准测试性能接近我们的 26B 模型,支持强大的多步推理和智能体工作流。
- 为笔记本电脑而生: 体积小巧,仅需 16GB 显存或统一内存即可本地运行。
- 开放且易用: 基于 Apache 2.0 许可证发布,并得到开发者生态系统的全面支持。
- 可配合草稿模型使用: Gemma 4 12B 配备多头预测(MTP)草稿模型,可降低延迟。
这些特性共同将先进的多模态能力带到了日常硬件上,同时不牺牲速度或推理能力。现在,让我们更深入地了解 Gemma 4 12B 是如何实现这一点的。
在本地运行最先进的智能体
Gemma 4 12B 在标准基准测试上的性能接近我们更大的 26B MoE 模型,但总内存占用不到后者的一半。它体积小巧,可以在配备 16GB 内存的消费级笔记本电脑上本地运行,让你的设备直接解锁强大的多模态和智能体体验。
体验独特的、高效统一架构
Gemma 4 12B 的与众不同之处在于其处理视觉和音频输入的简化方法。传统的多模态模型通常依赖独立的编码器来转换图像和音频,然后再将这些表示传递给语言模型。由于这些分离的编码器会增加延迟和内存占用,我们训练 Gemma 4 12B 时采用了免编码器架构,直接整合音频和视觉输入。
以下是 Gemma 4 12B 原生处理多模态输入的方式:
- 视觉: 我们将 Gemma 4 的视觉编码器替换为一个轻量级嵌入模块,该模块由单次矩阵乘法、位置嵌入和归一化组成。这使得 LLM 主干网络能够接管视觉处理。
- 音频: 我们进一步简化了音频处理。我们完全移除了音频编码器,并将原始音频信号投影到与文本标记相同的维度空间。
想要了解详细信息的开发者,请参阅我们的配套 Gemma 4 12B 开发者指南。
立即开始
- 亲自尝试:在 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent 应用和 LiteRT-LM CLI 中进行几次点击实验。
- 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调的检查点。
- 集成与学习:查看 开发者文档 和 快速入门笔记本。
- 使用你喜欢的开发工具:使用 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管道,或使用 Unsloth 高效微调。
- 使用 Gemma Skills 解锁智能体开发:为了支持开发者利用最新的 Gemma 进展构建智能体,我们发布了官方 技能库。这是一个专为让智能体使用 Gemma 模型构建而设计的技能库。
- 按你的方式部署:使用 Google Cloud 在生产环境中启动端点。通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 按你的方式部署。
来源:Google DeepMind · deepmind.google