跳到正文
原文
Google DeepMind·· 2026-04-13精选AI 评分67

Gemini Robotics-ER 1.6 发布:强化具身推理能力

Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning

AI 导读

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其具身推理模型的重要升级,今天起通过 Gemini API 和 Google AI Studio 开放给开发者。

推荐理由

原文给出 Gemini Robotics-ER 1.6 在空间推理、仪表读数与安全能力上的提升,并开放 API 供开发者接入,便于判断其实际可用性。

正文 · AI 翻译

2026年4月14日 模型

Laura Graesser 和 Peng Xu

要让机器人在我们的日常生活和工业中真正有用,它们必须不仅仅遵循指令,还必须对物理世界进行推理。从导航复杂的设施到解读压力表上的指针,机器人的“具身推理”正是使其能够在数字智能与物理行动之间架起桥梁的关键。

今天,我们推出 Gemini Robotics-ER 1.6,这是我们以推理为先的模型的重大升级,使机器人能够以前所未有的精度理解其环境。通过增强空间推理和多视角理解,我们为下一代物理智能体带来了新的自主水平。

该模型专注于机器人技术所需的关键推理能力,包括视觉和空间理解、任务规划以及成功检测。它充当机器人的高级推理模型,能够通过原生调用诸如谷歌搜索、视觉-语言-行动模型(VLA)或任何其他第三方用户定义函数等工具来执行任务。

Gemini Robotics-ER 1.6 相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 都显示出显著改进,特别是在空间和物理推理能力上,例如指向、计数和成功检测。我们还解锁了一项新能力:仪表读数,使机器人能够读取复杂的仪表和视镜——这是我们与合作伙伴波士顿动力公司紧密合作中发现的一个用例。

从今天起,开发者可以通过 Gemini API 和 Google AI Studio 使用 Gemini Robotics-ER 1.6。为了帮助您入门,我们分享了一个开发者 Colab,其中包含如何配置模型并提示其执行具身推理任务的示例。

图 1:将 Gemini Robotics-ER 1.6 与 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 模型进行比较的基准测试结果。仪表读数评估在启用智能视觉(agentic vision)的情况下进行(Gemini Robotics-ER 1.5 除外,因为它不支持该功能)。所有其他评估均在禁用智能视觉的情况下进行。单视图和多视图的成功检测评估包含不同的示例,因此不可比较。

指向:空间推理的基础

指向是具身推理模型的一项基本能力,并随着每一代模型的发展而演变。点可以用来表达许多概念,包括:

  • 空间推理:精确物体检测和计数
  • 关系逻辑:进行比较,例如识别一组中的最小项;定义“从-到”关系(例如将X移动到Y位置)
  • 运动推理:映射轨迹并识别最佳抓取点
  • 约束符合:通过复杂提示进行推理,例如“指向每个小到足以放入蓝色杯子的物体”

Gemini Robotics-ER 1.6 可以使用点作为中间步骤来推理更复杂的任务。例如,它可以使用点来计数图像中的物品,或识别图像上的显著点,以帮助模型执行数学运算,从而改进其度量估计。

下面的示例展示了 Gemini Robotics-ER 1.6 在指向多个元素以及判断何时应该指向和何时不应该指向方面的优势。

Gemini Robotics-ER 1.6 正确识别了锤子(2)、剪刀(1)、油漆刷(1)、钳子(6)以及一组园艺工具的数量,这些工具可以被视为一个整体或多个点。它不会指向图像中不存在的请求物品——手推车和Ryobi电钻。相比之下,Gemini Robotics-ER 1.5 无法识别正确的锤子或油漆刷数量,完全漏掉了剪刀,幻觉出推车,并且在指向钳子时缺乏精确性。Gemini 3.0 Flash 接近 Gemini Robotics-ER 1.6 的表现,但在处理钳子方面不如它。

成功检测:自主性的引擎

在机器人学中,知道任务何时完成与知道如何开始同样重要。成功检测是自主性的基石,作为一个关键的决策引擎,使智能体能够在重试失败的尝试或进入计划的下一阶段之间做出明智选择。

在机器人领域实现视觉理解具有挑战性,需要复杂的感知和推理能力,结合广泛的世界知识,以处理遮挡、光线不足和模糊指令等复杂因素。此外,大多数现代机器人设置都包含多个摄像头视角,例如俯视和腕部安装的视角。这意味着系统需要理解不同视角如何组合形成每个时刻及跨时间的一致图像。

Gemini Robotics-ER 1.6 推进了多视角推理,使系统能够更好地理解多个摄像头流及其之间的关系,即使在动态或遮挡环境中也是如此,如下面的典型多视角场景所示。

Gemini Robotics-ER 1.6 从多个摄像头视角获取线索,以确定任务“将蓝色笔放入黑色笔架”是否完成。

仪器读数:现实世界的视觉推理

要理解 Gemini Robotics-ER 1.6 的一个关键优势,我们必须看看它如何结合空间推理和世界知识等能力来解决复杂的现实问题。仪器读数就是一个完美的例子。

此任务源于设施检查需求,这是我们合作伙伴波士顿动力公司的一个关键关注领域。工业设施包含许多仪器——温度计、压力表、化学视镜等——需要持续监控。Spot,波士顿动力公司的机器人产品,能够访问设施中的仪器并拍摄它们的图像。

Gemini Robotics-ER 1.6 使机器人能够解读各种仪器,包括圆形压力表、垂直液位指示器和现代数字读数。

仪器读数需要复杂的视觉推理。必须精确感知各种输入——包括指针、液位、容器边界、刻度线等——并理解它们之间的相互关系。对于视镜,这涉及估计液体填充视镜的程度,同时考虑相机视角造成的失真。仪表通常有描述单位的文本,必须读取和解读,有些仪表有多个指针,分别指向不同的十进制位,需要组合起来。

像仪器读数和更可靠的任务推理这样的能力将使 Spot 能够完全自主地看到、理解并应对现实世界的挑战。

马可·达席尔瓦

波士顿动力公司Spot产品副总裁兼总经理

Gemini Robotics-ER 1.6 通过使用智能体视觉实现了高度精确的仪表读数,该技术将视觉推理与代码执行相结合。该模型采取中间步骤:首先放大图像以更好地读取仪表中的小细节,然后使用指向和代码执行来估计比例和间隔并获得准确的读数,最后运用其世界知识来解释含义。

图2:Gemini Robotics-ER 1.6 的不同元素如何共同实现在仪表读数任务上的高水平性能。

准确读取模拟仪表

此示例展示了模型如何使用指向和代码执行进行缩放,从而将仪表读数精确到子刻度精度。

我们迄今为止最安全的机器人模型

安全被整合到我们具身推理模型的每一个层面。Gemini Robotics-ER 1.6 是我们迄今为止最安全的机器人模型,在对抗性空间推理任务中,与所有先前版本相比,它表现出对Gemini安全政策的更高遵从性。

该模型还展示了显著提升的遵守物理安全约束的能力。例如,它通过空间输出(如指向)做出更安全的决策,判断在夹爪或材料约束下(例如“不要处理液体”、“不要拿起超过20公斤的物体”)哪些物体可以安全操作。

我们还测试了该模型基于真实伤害报告在文本和视频场景中识别安全隐患的能力。在这些任务上,我们的Gemini Robotics-ER模型在准确感知伤害风险方面,相比基线Gemini 3.0 Flash表现有所提升(文本+6%,视频+10%)。

图3:Gemini Robotics-ER 1.6 在安全指令遵循方面相比Gemini Robotics-ER 1.5有显著提升,该测试验证了遵守物理安全约束的能力。它在指向方面相比Gemini 3.0 Flash有所改进,而两个模型在文本上都有非常高的准确性。Gemini 3.0 Flash在边界框方面表现更好。

与我们合作,改进机器人领域的具身推理

我们致力于确保Gemini Robotics-ER为机器人社区提供最大价值。如果当前能力对您的专业应用有所限制,我们邀请您提交此表格,附上10–50张标注图像,以说明具体的失败模式,帮助我们构建更稳健的推理功能。我们期待与您合作,在即将发布的版本中增强这些能力。

立即在Google AI Studio上试用Gemini Robotics-ER 1.6

来源:Google DeepMind · deepmind.google