Gemini Robotics 2 是 Google DeepMind 最新推出的 AI 模型系列,目標是賦予機器人「全身智慧」——從腳底到指尖的完整控制能力。它能將視覺與語言輸入轉換為馬達控制指令,讓機器人執行需要協調、靈巧操作與適應能力的複雜物理任務。此系統提供三種模型版本:旗艦級視覺-語言-動作(VLA)模型,用於完整人形機器人控制;具身推理(ER)模型,負責規劃與人類溝通;以及針對本機端執行最佳化的裝置端模型。開發者與機器人團隊可藉此打造能在真實環境中思考、行動並協作的機器人。
雜亂房間清理
人形機器人能自主行走、蹲下、伸展肢體並操作物品,將空間整理乾淨。
多機器人協作
多台機器人可協調分工,在共享工作空間中加速完成任務。
靈巧操作
配備雙手或夾爪的機器人可處理精細、精準的物體操作任務。
具身推理
機器人能規劃長達數分鐘的多步驟任務、與人類溝通,並理解物理世界。
裝置端部署
輕量模型直接在機器人硬體上本機執行,僅需數小時資料即可快速適應新型機器人本體。
全身控制
Gemini Robotics 2 可控制完整人形機器人與雙臂機器人,協調從腳底到指尖的動作。
進階靈巧度
模型支援雙手與夾爪的精密操作,能處理複雜的物體互動。
視覺-語言-動作架構
直接將視覺與語言輸入轉換為馬達指令,讓機器人能對所見所聞即時反應。
具身推理代理
Gemini Robotics ER 2 作為 VLM 代理,能規劃多步驟任務、與人類溝通,並理解物理環境。
多機器人協作
機器人能組成團隊共同作業,更快速、更有效率地完成任務。
裝置端效率
Gemini Robotics On-Device 2 在機器人裝置上本機執行,降低對雲端連線的依賴。
快速本體適應
裝置端模型僅需數小時的訓練資料,即可適應全新的機器人本體。
跨本體相容性
同一個模型權重可控制不同機器人平台,包括配備 SharpaWave 手的 Apptronik Apollo 2、配備 Inspire 手的 Apollo 2,以及配備 Robotiq 夾爪的 Franka Duo。
此產品專為機器人工程師、AI 研究人員,以及開發實體 AI 系統的產品團隊所設計。對於在物流、製造、居家協助等場域部署機器人的企業,以及任何需要適應性全身操作的環境,此產品同樣具有高度相關性。正在開發人形機器人或多機器人系統的團隊,將特別受惠於其協作與靈巧操作功能。
官方網站並未提供逐步操作說明。若要開始使用,請前往 Google DeepMind 官方部落格文章,查閱 Gemini Robotics 2 的相關文件與模型存取資訊。這些模型設計為與機器人硬體系統整合,因此實際導入需要機器人專業知識,並需具備相容的機器人平台。
Gemini Robotics 2 在讓機器人真正具備適應性——而非僅針對狹隘任務預先編程——這條路上跨出了重要一步。全身控制、靈巧操作與多機器人協作的組合,直擊當前機器人領域三大最艱難的挑戰。能在裝置端執行模型,並在數小時(而非數週)內適應新型機器人本體,對持續迭代硬體的團隊而言是極其實務的優勢。從多種機器人平台展示的跨本體支援來看,此模型具備一定程度的通用性,有望降低不同機器人設計之間的開發成本。雖然部落格文章未包含使用者見證或基準測試數據,但從技術廣度與三模型架構來看,這是一次嚴肅、以量產為導向的發布,目標是將機器人從實驗室展示推向真實世界的實用價值。
Gemini Robotics 2 是 Google DeepMind 推出的先進 AI 模型,為機器人注入全身智能,讓機械能流暢協調地完成複雜的實體操作與導航,應對真實世界中的各種挑戰。
Category:代理人
Visit Link:https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
Tags:Google DeepMind、機器人AI、全身控制、機器人操作、具身智慧