Gemini Robotics ER 2 发布:以视频理解、任务编排与多机器人协作打造机器人的“高层大脑”
Google DeepMind 发布 Gemini Robotics ER 2,称其为最强“具身推理”模型,定位是机器人的高层大脑:与人对话、理解物理世界、规划多步任务,并把电机执行交给底层 VLA 模型。新版通过持续视频流跟踪进度、出错自我纠正,并首次支持多机器人协作。开发者可经 Gemini API 与 Google AI Studio 使用,企业平台提供私有预览。
Google DeepMind 近日发布 Gemini Robotics ER 2,官方称其为目前最强的“具身推理”模型。官方博文由 Steven Hansen 与 Peng Xu 署名,页面标注日期为 2026 年 7 月 30 日。它的定位很清楚:不是直接控制电机的模型,而是机器人的“高层大脑”。 一、发布了什么 按官方描述,Gemini Robotics ER 2 让机器人能够与人对话、理解物理世界、规划多步任务,然后把具体的电机执行交给任意一个底层视觉-语言-动作(VLA)模型。它还可以原生调用 Google 搜索等工具来查找信息,也可以调用用户自定义的函数。相比上一代 Gemini Robotics ER 1.6,这是一次显著升级,三项重点能力是:持续视频理解、任务编排,以及首次引入的多机器人协作。
在可用性上,模型已经通过 Gemini API 与 Google AI Studio 向开发者公开提供,同时在 Gemini Enterprise Agent Platform 上提供私有预览。官方还分享了如何配置模型、如何撰写提示词来驱动更实用的物理 AI 任务的示例。 二、核心机制:高层推理加低层执行的分层架构 机器人要在日常环境中帮上忙,仅有准确的空间推理是不够的。官方强调,机器人还必须“想得快”,让决策节奏跟上物理世界的实时速度。因此 ER 2 的设计允许机器人在执行当前动作的同时,“思考”接下来要做什么。 在开发方式上,开发者可以把底层控制接口,例如 VLA 模型或导航 API,声明为工具,再把多模态的视频、音频或文本直接流式输入给模型。ER 2 负责决定何时调用哪个工具、传入什么参数,并根据反馈决定下一步。这与 Agent 框架中常见的函数调用思路一致,只是把“工具”从软件接口扩展到了会移动、会抓取的物理系统。官方还提到,ER 2 已集成到 Gemini Live API 中,面向实时交互场景,不过我们所见的原文节选在这一句处被截断,细节需要参阅官方完整文档。
这种分层带来一个实际好处:上层推理模型与下层控制策略可以独立演进。机器人厂商不必为了获得更强的规划能力而重训动作模型,也可以在不改动高层逻辑的情况下更换底层控制器。 此外,官方把“边想边做”视为实时性的关键:模型无需等当前动作结束才开始思考下一步,从而缩短整体任务耗时。对于需要与人交谈、随时接受口头纠正的家庭与服务场景,这种设计也更自然。 三、视频反馈闭环:知道自己做到哪一步 传统的“规划后执行”流程常常默认指令一旦发出就会成功。ER 2 则通过持续观看视频流,让机器人跟踪自己的任务进度,在出现问题时调整做法,并明确知道何时该进入下一步。这在物理世界里非常关键:物体可能滑落,门可能没有关好,目标可能被人挪动。具备视频反馈的高层模型,才有机会发现这些偏差并自我纠正。 四、任务编排的评估方式 官方说明,ER 2 的表现可以在三种环境下评估:仿真中的机器人、真实世界的机器人控制,以及由人类远程操作机器人的配置。官方给出的结论是,在真实 VLA、仿真 VLA 和人类遥操作这三种控制模式下,ER 2 在工具编排上都稳定优于 ER 1.6。需要如实指出的是,我们所见的原文节选没有给出具体的基准分数、延迟或价格,因此无法对提升幅度做量化判断。
五、多机器人协作 ER 2 首次引入多机器人协作,让机器人在共享空间里协同工作,完成单个机器人无法独立完成的复杂工作流程。这意味着同一个高层模型可以拆分任务、协调分工,使多台机器人接力或并行作业。对仓储、制造、实验室自动化等场景,这是从“单机演示”走向“产线协同”的重要一步。官方节选未披露协调机制与规模上限,实际效果仍有待开发者验证。 六、对开发者与企业的意义 对开发者而言,最直接的变化是门槛下降:通过 Gemini API 就可以获得一个能理解视频、会调用工具的机器人规划器,而不必自建整套具身推理系统。对企业而言,私有预览意味着可以在受控条件下评估安全、合规与集成成本。对整个生态而言,高层推理与低层控制解耦,会推动更清晰的分工:模型厂商提供通用大脑,机器人本体厂商与 VLA 研究者专注于运动与操作能力。
七、挑战与展望 仍有几个问题值得关注。第一,延迟:高层模型通过云端 API 调用,能否满足需要毫秒级反应的场景,需要实测。第二,可靠性与安全:视频判断一旦出错,机器人可能在错误的状态上继续执行,因此仍需要硬件层面的安全约束与人工监督。第三,成本与规模:多机器人协作会放大推理调用量,价格与配额将直接影响商业可行性。第四,评测透明度:业界需要公开、可复现的基准来比较不同的具身推理模型。 总体来看,Gemini Robotics ER 2 把机器人的规划、监督与协作能力打包成可调用的服务,使具身智能更接近真实可部署的工作流程。它能否在复杂现场中兑现承诺,将取决于后续的独立评测与真实客户的落地反馈。