DeepMind 發布 Gemini Robotics 2:全身體感智能打破具身控制壁壘
Google DeepMind 正式推出新一代具身智能基座模型 Gemini Robotics 2(GR-2)。該模型開創性地將高層多模態視覺-語言-動作(VLA)語義推理與底層全身體感動態力矩控制深度貫通。人形機器人和雙臂移動操作平台無需針對特定任務重新採集軌跡或微調,即可在充滿動態擾動的非結構化現實環境中,連續流暢地執行數十步複合物理作業,為通用物理智能的工業化鋪平了道路。
背景与核心突破
具身智能(Embodied AI)长期以来受制于一个根本性的架构断层:负责高级语义理解的大语言/多模态模型通常只能在低频(如 1Hz 至 5Hz)输出离散的高阶规划路径,而机器人硬件底层为了维持平衡、顺应物理接触与消除机械抖动,必须依赖运行在 100Hz 乃至 1000Hz 的专用动力学与阻抗控制器。这种分层解耦的传统流水线导致机器人在面对现实世界的微小物理扰动时极其脆弱,动作僵硬脱节,且每更换一个操作场景都需要成百上千次的远程示教(Teleoperation)微调。针对这一困扰学界与产业界数十年的关键瓶颈,Google DeepMind 正式推出了新一代旗舰具身智能基座模型 Gemini Robotics 2(GR-2)。
GR-2 的核心飞跃在于打破了传统的“高层规划器与底层控制器”两段式割裂架构。通过将十亿级参数的多模态视觉-语言-动作(VLA)表征与全身连续动力学微观动作空间联合训练,GR-2 实现了真正意义上的“全身体感智能(Whole-Body Physical Intelligence)”。搭载 GR-2 的人形双足机器人以及双臂轮式移动平台,在未曾见过的杂乱厨房、物流分拣线或精密装配车间中,能够凭借单一直觉网络同时完成移动、下蹲、抓取、避障与双臂协调平衡,执行连贯流畅的多阶段物理长程作业。
架构演进与技术剖析
在技术实现细节上,Gemini Robotics 2 引入了创新的分级潜变量流式架构(Hierarchical Latent Streaming Architecture)。顶层网络依托 Gemini 2.5 强大的世界常识与几何空间视觉推理骨干,以 10Hz 的频率连续生成高维潜空间物理意图表征(Latent Physical Intent Tokens)。这些令牌不仅编码了目标物体的 6-DoF 位姿轨迹,还隐式包含了预期的接触反作用力流、摩擦椭球估计以及接触顺序拓扑。
随后,这些高维意图令牌被无缝输入至一个专门针对高频动力学蒸馏的微秒级动作解码器(Action Diffusion Head)。该解码器直接与机载传感器的高速本体感觉(Proprioception)流(包括关节角编码器、足底六维力/力矩传感器以及惯性测量单元 IMU)融合,以超过 200Hz 的极高刷新率直接预测每个驱动关节的力矩设定值(Torque Setpoints)与柔顺阻抗参数。这种端到端的连续力矩控制机制,使得机器人在接触脆弱物体或遭遇突发碰撞时,能够像生物肌肉一样自然屈服顺应,彻底消除了传统位置控制下常见的机械卡死与剧烈震颤。
为了训练如此庞大的全身体感基座,DeepMind 结合了真实世界多形态机器人收集的数百万小时示范数据,以及在高保真物理仿真器中运行的超大规模分布式强化学习流水线。在仿真环境中,智能体承受着质量突变、重心漂移、地面打滑以及外力推搡等数十万种非结构化随机扰动,使得 GR-2 学会了类似人类的小脑前馈动态反射与重心自适应微调机制。
行业变革与实际落地
Gemini Robotics 2 的发布标志着通用机器人从“特定场景特种机械”向“全能物理智能载体”的范式跃迁。在传统工业自动化中,引入一套双臂机器人往往需要耗资数百万美元定制精密工装治具与固定抓手;而在 DeepMind 的真实评测中,搭载 GR-2 的现成人形硬件能够直接听懂自然语言指令,自主在货架上识别不同规格的包装盒,单手轻托底部、另一手调整倾角,以极具柔韧感的姿态平稳码垛。
在家庭看护与柔性物流等对人机协作安全性要求极高的非结构化场景中,GR-2 的全身柔顺性展现出了压倒性优势。当有人或宠物突然闯入机器人的操作包络线时,全身力矩传感器能在数毫秒内感知微弱阻力,算法网络自发调整重心并柔和收力,完全避免了硬性冲击伤害。这一特性大幅降低了协作机器人进入医院、养老机构及千家万户的物理安全门槛。
挑战与未来演进
尽管 GR-2 展现出了令人震撼的物理交互流畅度,但在规模化落地进程中仍需克服一系列严峻考验。首先是极端动力学工况下的计算延迟与能耗比。在高达 200Hz 的力矩控制循环中运行大规模神经网络,对车载计算芯片的散热与整机续航构成了巨大压力。如何在保持全身体感精度的同时实现模型权重的极限轻量化与边缘 NPU 专用指令加速,是工程团队当下攻坚的核心。
此外,长时程操作中的误差累积与因果推理能力仍有提升空间。在面对需要精密公差配合的微型装配或极端变形物料(如柔软织物、流动液体)操作时,现有的多模态视觉反馈仍难以完全替代人类指尖的高清触觉阵列感知。DeepMind 表示,下一步研究将聚焦于将密集阵列式触觉感知原生融入 GR-2 的感知骨干中,向着完全通用的物理具身智能持续迈进。
Sources
FAQ
Gemini Robotics 2 实现了什么核心突破?
它彻底打破了高层认知与底层执行的传统割裂,将视觉语言动作多模态大模型与 200Hz 以上的全身连续动态力矩控制原生深度融合。
全身体感力矩控制在物理交互中有何优势?
相较于传统僵硬的位置跟踪控制,连续力矩调节赋予机器人类似生物肌肉的柔顺性,能自然吸收外部冲击并毫秒级自适应维持动态平衡。
具身智能通用化落地目前面临哪些瓶颈?
关键瓶颈包括高频神经网络连续推理下的机载算力能耗与整机散热限制,以及在处理柔性形变物体时对高密度微阵列触觉感知的融合需求。