Gemini Robotics 2 是 Google DeepMind 最新推出的 AI 模型系列,主打“全身智能”——从脚趾到指尖,让机器人真正动起来。它能把视觉和语言输入直接转化为电机控制指令,让机器人完成那些需要协调性、灵活性和适应能力的复杂物理任务。这个系统一共包含三个模型变体:一个旗舰级的视觉-语言-动作(VLA)模型,专为全身人形机器人控制设计;一个具身推理(ER)模型,负责任务规划和与人类沟通;还有一个针对本地执行优化的端侧模型。开发者或机器人团队可以用它来打造能在真实环境中思考、行动、协作的机器人。
杂乱房间自动整理
人形机器人可以自主行走、下蹲、伸展、抓取物体,把空间收拾干净。
多机器人协同作业
多个机器人可以分工协作,在共享工作区里更快完成任务。
精细操作
配备灵巧手或夹爪的机器人,可以完成高精度的物体操控任务。
具身推理
机器人能规划长达数分钟的多步任务,与人类自然交流,并理解物理世界。
端侧部署
轻量级模型直接在机器人硬件上本地运行,只需几小时数据就能快速适配新的机器人本体。
这个产品主要面向机器人工程师、AI 研究员,以及正在开发物理 AI 系统的产品团队。同时,它也很适合在物流、制造、家庭辅助等场景部署机器人的公司——凡是需要自适应、全身操控能力的环境都适用。正在做人形机器人或多机器人系统的团队,会特别受益于它的协作和灵巧性功能。
官网没有提供逐步操作指南。想上手的话,建议直接去 Google DeepMind 官方博客看 Gemini Robotics 2 的发布文章,里面有关联的文档和模型访问入口。这些模型需要和机器人硬件系统集成,所以实际落地需要具备机器人专业知识,并且要有兼容的机器人平台。
Gemini Robotics 2 在让机器人真正“自适应”这件事上迈出了一大步——而不是像以前那样只能执行预设的狭窄任务。它把全身控制、灵巧操作和多机器人协作三大难题整合在一起,直击当前机器人领域最难的几个方向。而且,模型能跑在端侧、几小时就能适配新本体(而不是几周),这对硬件迭代团队来说是非常实用的优势。从多个机器人平台的跨本体支持来看,这种通用性有望降低不同机器人设计的开发成本。虽然博客里没有用户评价或基准数据,但从技术覆盖面和三模型架构来看,这显然是一个认真面向生产环境的发布,目标是把机器人从实验室演示推向真实世界的实用场景。
谷歌DeepMind发布Gemini Robotics 2,给机器人装上“全身智能”,动作更连贯,能搞定复杂操作和导航,干活更像个“人”了。
Category:智能体
Visit Link:https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
Tags:谷歌DeepMind、机器人AI、全身控制、具身智能、机器人操作