DeepMind 推出 Gemini Robotics ER 2:基于实时视频空间推理的多机器人协同系统
Google DeepMind 正式发布新一代具身基础智能体架构 Gemini Robotics ER 2。该系统开创性地将连续流式 3D 空间视频理解与分层多智能体编排技术深度融合,使多台形态迥异的人形双足机器人、轮式移动机械臂与微型抓取器能够在无需预先硬编码协同协议的前提下,仅凭多视角视觉感知即可自主分工、默契配合,完成复杂工业硬件的高精装配与动态货盘码垛。
具身智能的协同鸿沟:从单机操作到群体作业的范式跨越
在工业制造与现代化智慧仓储领域,单个机器人的智能化虽然已取得长足进步,但在真实生产场景中,绝大多数高价值工序——诸如大型航空部件的拼接、重型电机的同轴固定、以及动态流水线上的联合分拣与码垛——都需要多台物理形态完全不同的自动化设备进行精密的物理交互与动作同步。然而,传统的工业多机器人系统极度依赖刚性的硬编码规则与高昂的 PLC 定时总线:工程师必须为每一台机械臂、AGV 小车或人形机器人预先编写毫米级的运动轨迹与锁步信号。一旦工件位置发生微米级偏移,或者某台设备发生微小延迟,整个流水线便会发生灾难性的死锁或物理碰撞。
为了彻底打破这种机械硬编码的桎梏,Google DeepMind 正式推出了代表具身智能(Embodied AI)最高前沿的架构——Gemini Robotics ER 2(Embodied Reasoning 2)。该系统的诞生,宣告了机器人控制从“单机独立自回归动作预测”时代,正式迈向了基于统一多模态大模型的“群体时空推理与自组织协同”时代。
技术核心架构:流式 3D 空间视频理解与分层编排拓扑
Gemini Robotics ER 2 的核心工程壮举在于其独特的两层解耦控制拓扑:由运行在边缘微集群上的「宏观空间认知大脑」与部署在各机器人机载计算单元上的「微观动态伺服小脑」有机互联。
在上层认知层,系统依托 DeepMind 最新的流式视频空间表征模型。该模型能够以 60Hz 的高频吞吐,同时摄入车间顶置全景相机、多台移动机器人头部立体双目相机、以及机械臂末端手眼相机所采集的异构视频流。不同于以往将视频切片为离散 2D 图像的朴素做法,Gemini Robotics ER 2 原生构建了一个连续演进的「4D 动态场景几何图谱」(4D Spatial Scene Graph)。在该图谱中,每一台机器人的当前关节自由度、执行器末端空间速度、以及周围工件的物理刚体包围盒,都被统一映射在具有重力与摩擦力先验的全局欧几里得坐标系内。
在下层协同编排层,DeepMind 摒弃了点对点的广播通信协议,转而采用基于注意力机制的「视觉意图隐式同步」。当人类操作员下达一条高阶自然语言指令(例如:“将底盘主框架固定在装配台上,并由辅臂锁紧四角螺栓”)时,宏观空间模型会在数毫秒内完成任务分解,将全局目标投影为各个机器人的局部动作原语(Action Primitives)。各机器人无需相互发送复杂的数字握手包,只需通过观察彼此在空间中的物理姿态与工件受力形变,即可利用机载策略自适应调节输出力矩:当人形机器人托举起 30 公斤重的金属框架发生轻微下沉时,旁边的机械臂能通过手眼相机瞬间捕捉到这一高度位移,并在 10 毫秒内主动抬升承托爪,实现如人类工匠搭档般的默契配合。
极端工业场景验证:零样本装配与异构自适应
在 DeepMind 公布的实验基准与工厂实景测试中,Gemini Robotics ER 2 展现出了令人震撼的泛化能力。在完全没有预先建立 CAD 几何模型的测试环境中,系统调度了一台双足人形机器人、两台搭载七自由度机械臂的自主移动底盘(AMR)以及一台微型桌面装配爪,共同完成了重型变速箱外壳的闭环组装。在整个过程中,研究人员故意随机移动零件托盘的位置、用障碍物遮挡某台机器人的部分视野,甚至人工推搡正在作业的机械臂。
面对连续出现的意外扰动,系统展现出了极其坚韧的动态容错与任务自愈能力。视野受阻的机器人能够根据队友的运动轨迹反向推断被遮挡物体的空间坐标;受到推搡的机械臂在恢复平稳后,自动重新评估接触点的摩擦系数并完成二次抓取,整套装配流程零中断平稳完成。在仓储货盘码垛任务中,多机器人协作将空间利用率提升了 38%,货品破损率下降至接近于零。
具身通用智能的产业演进与深远影响
Gemini Robotics ER 2 的发布标志着具身智能正式跨越了从实验室玩具到规模化工业基础设施的关键鸿沟。过去,自动化工业流水线的部署动辄耗费数月的时间进行产线改造与调试标定,而基于大模型空间视频推理的自组织机器人系统,将这一部署周期缩短至数小时——工程师只需向系统展示一段人类示范视频或提出语音需求,异构机器人队伍即可自主协商出最高效的作业工序。
随着通用多模态物理大模型的持续演进,工业机器人不再是冷冰冰的执行机构,而是演化为具备空间意识、物理直觉与社交协同能力的“硅基工友”。这一突破性进展,将为全球制造业的高端化转型、极端危险环境下的无人作业、以及未来完全自主化的黑灯工厂提供最强大的核心引擎。
Sources
FAQ
Gemini Robotics ER 2 的核心突破是什么?
它将流式 3D 空间视频理解与分层多智能体编排融合,使异构人形机器人与移动机械臂无需硬编码通信协议,即可自主协同完成工业硬件组装与码垛。
系统如何在没有预设协议下协调异构机器人?
中央空间推理模型将环境视频流转化为动态 3D 场景图谱,分解高层意图为局部动作原语,各机载低层策略按几何拓扑和物理约束自组织执行并避障。
多机器人自主协同在工业应用中有何瓶颈?
关键瓶颈在于复杂工业光照与遮挡下的实时 3D 空间重建精度、毫秒级闭环视觉伺服延迟,以及对未知工件形变与打滑的高频容错恢复能力。