跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–14 条 · 共 14 条
9月29日周二
  1. AWS Machine Learning Blog67

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四档推理力度

    Grok 4.7 现已通过 Amazon Bedrock 上线,提供 500K token 上下文窗口和低、中、高、超高四档可配置推理力度。该模型面向编码、长时运行智能体和知识工作,支持 Responses、Chat Completions 和 Converse API。xAI 称其为最擅长编码和知识工作的模型,强调持久工作与自我校验。

    推荐理由:Grok 4.7 登陆 Bedrock,文章梳理了 500K 上下文、四档推理级别与成本权衡,适合评估长任务智能体工作负载。

9月16日周三
9月2日周三
  1. Google DeepMind73

    Google DeepMind发布Gemini智能体视频理解,token消耗最高降88%

    Google DeepMind推出智能体视频理解功能,适用于Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite,将视频分析的token消耗最高降低88%、成本最高降低66%,准确率提升最高7%。

    推荐理由:官方公布agentic视频理解相比静态处理在token消耗、成本和准确率上的具体改进数字,读者可据此判断该方案对长视频分析开发流程的实际影响。

8月28日周五
8月12日周三
  1. Google DeepMind79

    Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

    推荐理由:原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。

7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2,支持视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,支持视频理解、任务编排和多机器人协作,现通过 Gemini API 与 Google AI Studio 向开发者开放。相比前代 ER 1.6,它在进度分类任务上取得 57.4% 准确率,时刻查找准确率达 91.3%,并以 4 倍执行速度接近更大模型的精度。

    推荐理由:这篇官方介绍给出了新模型在视频理解、任务编排和多机器人协作上的能力数据与开放渠道,读者可据此评估它在具身智能领域的实际进展。

7月28日周二
  1. Google DeepMind68

    Gemini Robotics 2 发布,带来全身智能、精细操控与多机器人协作

    Google DeepMind 发布 Gemini Robotics 2 系列机器人模型,包含 VLA、ER 和端侧三类模型,实现全身控制、精细灵巧操作与多机器人协作,并新推 ASIMOV-Agentic 安全基准。其中推理模型 Gemini Robotics ER 2 已上线 Google AI Studio,VLA 与端侧模型向早期合作伙伴开放。

    推荐理由:文章详解Gemini Robotics 2三类模型与全身控制、精细灵巧操作及多机器人协作能力,并给出开放渠道,可快速了解具身智能最新进展。

7月1日周三
6月9日周二
  1. Google DeepMind72

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的无编码器多模态模型,视觉和音频输入直接流入 LLM 主干,是该系列首个支持原生音频输入的中型模型。它可在 16GB 内存的消费级笔记本本地运行,基准性能接近 26B MoE 模型,采用 Apache 2.0 许可,并同步发布官方 Skills Repository。

    推荐理由:原文给出 12B 与 26B 的取舍和 16GB 内存的本地运行门槛,可帮助读者判断它在端侧多模态工作流中的适配度。

5月18日周一
5月17日周日
  1. Google DeepMind63

    谷歌扩展内容透明与验证工具,新增AI内容检测API

    谷歌宣布将SynthID和C2PA内容凭证验证能力扩展至Search、Gemini、Chrome和Pixel设备,并在Gemini应用中新增C2PA验证。SynthID已为超1000亿张图片视频和6万小时音频添加水印,验证功能已使用5000万次。谷歌还推出面向企业的AI内容检测API,并与OpenAI、ElevenLabs、Meta等公司合作,让更多平台识别和标注AI生成内容。

    推荐理由:原文说明了水印技术覆盖规模和验证能力从Pixel扩展到搜索与浏览器的落地进度,读者可据此判断内容溯源工具的实际可用范围。

4月13日周一
4月3日周五
  1. Google DeepMind82

    Google DeepMind 发布开源模型 Gemma 4,主打推理与智能体工作流

    Google DeepMind 发布开源模型 Gemma 4,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,采用 Apache 2.0 许可,31B 模型在 Arena 文本榜单位列开源模型第 3。新模型支持 140+ 语言、最高 256K 上下文、原生多模态与语音输入,可离线运行于手机等边缘设备,并兼容 Hugging Face、vLLM、Ollama 等主流工具。

    推荐理由:官方披露 Gemma 4 四个尺寸与 Apache 2.0 许可,有助于评估其智能-参数比优势和本地部署门槛。

3月29日周日
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 驱动的 AI 增强指针,落地 Chrome 与 Googlebook

    Google DeepMind 发布由 Gemini 驱动的 AI 增强指针,让指针不仅能识别指向目标,还能理解它对用户为何重要。该设计基于保持流畅、展示与讲述、拥抱 This/That、像素实体化四项交互原则;即日起可在 Chrome 里用指针向 Gemini 询问网页内容,不久推出 Googlebook 的 Magic Pointer,并可在 Google AI Studio 试用。

    推荐理由:DeepMind 提出让指针理解指向目标与用户意图的四条设计原则,并已集成进 Chrome,是观察下一代 AI 交互入口形态的窗口。