Gemini Robotics ER 2 發布:以影片理解、任務編排與多機器人協作打造機器人的「高層大腦」
Google DeepMind 發布 Gemini Robotics ER 2,稱其為最強「具身推理」模型,定位是機器人的高層大腦:與人對話、理解物理世界、規劃多步任務,並把馬達執行交給底層 VLA 模型。新版透過持續影片串流追蹤進度、出錯自我修正,並首次支援多機器人協作。開發者可經 Gemini API 與 Google AI Studio 使用,企業平台提供私有預覽。
Google DeepMind 近日發布 Gemini Robotics ER 2,官方稱其為目前最強的「具身推理」模型。官方部落格文章由 Steven Hansen 與 Peng Xu 署名,頁面標註日期為 2026 年 7 月 30 日。它的定位很清楚:不是直接控制馬達的模型,而是機器人的「高層大腦」。 一、發布了什麼 依官方描述,Gemini Robotics ER 2 讓機器人能夠與人對話、理解物理世界、規劃多步任務,然後把具體的馬達執行交給任意一個底層視覺-語言-動作(VLA)模型。它還可以原生呼叫 Google 搜尋等工具來查找資訊,也可以呼叫使用者自訂的函式。相較上一代 Gemini Robotics ER 1.6,這是一次顯著升級,三項重點能力是:持續影片理解、任務編排,以及首次引入的多機器人協作。
在可用性上,模型已經透過 Gemini API 與 Google AI Studio 向開發者公開提供,同時在 Gemini Enterprise Agent Platform 上提供私有預覽。官方還分享了如何設定模型、如何撰寫提示詞來驅動更實用的實體 AI 任務的範例。 二、核心機制:高層推理加低層執行的分層架構 機器人要在日常環境中幫上忙,僅有準確的空間推理是不夠的。官方強調,機器人還必須「想得快」,讓決策節奏跟上物理世界的即時速度。因此 ER 2 的設計允許機器人在執行當前動作的同時,「思考」接下來要做什麼。 在開發方式上,開發者可以把底層控制介面,例如 VLA 模型或導航 API,宣告為工具,再把多模態的影片、音訊或文字直接串流輸入給模型。ER 2 負責決定何時呼叫哪個工具、傳入什麼參數,並根據回饋決定下一步。這與 Agent 框架中常見的函式呼叫思路一致,只是把「工具」從軟體介面擴展到了會移動、會抓取的實體系統。官方還提到,ER 2 已整合到 Gemini Live API 中,面向即時互動場景,不過我們所見的原文節錄在這一句處被截斷,細節需要參閱官方完整文件。
這種分層帶來一個實際好處:上層推理模型與下層控制策略可以獨立演進。機器人廠商不必為了獲得更強的規劃能力而重新訓練動作模型,也可以在不改動高層邏輯的情況下更換底層控制器。 此外,官方把「邊想邊做」視為即時性的關鍵:模型無需等當前動作結束才開始思考下一步,從而縮短整體任務耗時。對於需要與人交談、隨時接受口頭修正的家庭與服務場景,這種設計也更自然。 三、影片回饋閉環:知道自己做到哪一步 傳統的「規劃後執行」流程常常預設指令一旦發出就會成功。ER 2 則透過持續觀看影片串流,讓機器人追蹤自己的任務進度,在出現問題時調整做法,並明確知道何時該進入下一步。這在物理世界裡非常關鍵:物體可能滑落,門可能沒有關好,目標可能被人挪動。具備影片回饋的高層模型,才有機會發現這些偏差並自我修正。 四、任務編排的評估方式 官方說明,ER 2 的表現可以在三種環境下評估:模擬中的機器人、真實世界的機器人控制,以及由人類遠端操作機器人的配置。官方給出的結論是,在真實 VLA、模擬 VLA 和人類遙操作這三種控制模式下,ER 2 在工具編排上都穩定優於 ER 1.6。需要如實指出的是,我們所見的原文節錄沒有給出具體的基準分數、延遲或價格,因此無法對提升幅度做量化判斷。
五、多機器人協作 ER 2 首次引入多機器人協作,讓機器人在共享空間裡協同工作,完成單個機器人無法獨立完成的複雜工作流程。這意味著同一個高層模型可以拆分任務、協調分工,使多台機器人接力或並行作業。對倉儲、製造、實驗室自動化等場景,這是從「單機展示」走向「產線協同」的重要一步。官方節錄未揭露協調機制與規模上限,實際效果仍有待開發者驗證。 六、對開發者與企業的意義 對開發者而言,最直接的變化是門檻下降:透過 Gemini API 就可以取得一個能理解影片、會呼叫工具的機器人規劃器,而不必自建整套具身推理系統。對企業而言,私有預覽意味著可以在受控條件下評估安全、合規與整合成本。對整個生態而言,高層推理與低層控制解耦,會推動更清晰的分工:模型廠商提供通用大腦,機器人本體廠商與 VLA 研究者專注於運動與操作能力。
七、挑戰與展望 仍有幾個問題值得關注。第一,延遲:高層模型透過雲端 API 呼叫,能否滿足需要毫秒級反應的場景,需要實測。第二,可靠性與安全:影片判斷一旦出錯,機器人可能在錯誤的狀態上繼續執行,因此仍需要硬體層面的安全約束與人工監督。第三,成本與規模:多機器人協作會放大推論呼叫量,價格與配額將直接影響商業可行性。第四,評測透明度:業界需要公開、可重現的基準來比較不同的具身推理模型。 整體來看,Gemini Robotics ER 2 把機器人的規劃、監督與協作能力打包成可呼叫的服務,使具身智能更接近真實可部署的工作流程。它能否在複雜現場中兌現承諾,將取決於後續的獨立評測與真實客戶的落地回饋。