
Gemini Robotics 2, de Google DeepMind, dota a los robots de inteligencia corporal completa. Permite acciones físicas coordinadas y fluidas para tareas complejas de manipulación y navegación en el mundo real, marcando un avance clave en robótica.
Gemini Robotics 2 es la nueva familia de modelos de IA de Google DeepMind, diseñada para dotar a los robots de inteligencia de cuerpo completo, desde los pies hasta las yemas de los dedos. Convierte la entrada visual y de lenguaje en control motor, lo que permite a los robots realizar tareas físicas complejas que requieren coordinación, destreza y adaptabilidad. El sistema se presenta en tres variantes de modelo: un modelo insignia de visión-lenguaje-acción (VLA) para el control completo de humanoides, un modelo de razonamiento encarnado (ER) para la planificación y la comunicación con humanos, y un modelo en el dispositivo optimizado para la ejecución local. Desarrolladores y equipos de robótica lo utilizan para construir robots que puedan pensar, actuar y colaborar en entornos del mundo real.
Limpieza de espacios desordenados
Un humanoide puede caminar, agacharse, estirarse y manipular objetos para ordenar un espacio de forma autónoma.
Trabajo en equipo multi-robot
Varios robots pueden coordinarse para completar un trabajo más rápido, por ejemplo, dividiendo tareas en un espacio de trabajo compartido.
Manipulación diestra
Robots con manos o pinzas pueden manejar tareas de manipulación de objetos finas y precisas.
Razonamiento encarnado
Los robots pueden planificar tareas de varios pasos que duran varios minutos, comunicarse con humanos y comprender el mundo físico.
Implementación en el dispositivo
El modelo ligero se ejecuta localmente en el hardware robótico, lo que permite una adaptación rápida a nuevos cuerpos robóticos con solo unas pocas horas de datos.
Control de cuerpo completo
Gemini Robotics 2 controla humanoides completos y robots de dos brazos, coordinando movimientos desde los pies hasta las yemas de los dedos.
Destreza avanzada
El modelo admite manipulación fina tanto con manos como con pinzas, manejando interacciones complejas con objetos.
Arquitectura de visión-lenguaje-acción
Convierte la entrada visual y de lenguaje directamente en comandos motores, lo que permite a los robots actuar sobre lo que ven y oyen.
Agente de razonamiento encarnado
Gemini Robotics ER 2 actúa como un agente VLM que planifica tareas de varios pasos, se comunica con humanos y comprende el entorno físico.
Colaboración multi-robot
Los robots pueden trabajar juntos como un equipo para completar tareas de manera más rápida y eficiente.
Eficiencia en el dispositivo
Gemini Robotics On-Device 2 se ejecuta localmente en dispositivos robóticos, reduciendo la dependencia de la conectividad en la nube.
Adaptación rápida a la encarnación
El modelo en el dispositivo puede adaptarse a cuerpos robóticos completamente nuevos con solo unas pocas horas de datos de entrenamiento.
Compatibilidad entre encarnaciones
El mismo punto de control del modelo controla diferentes plataformas robóticas, incluyendo Apptronik Apollo 2 con manos SharpaWave, Apollo 2 con manos Inspire y Franka Duo con pinza Robotiq.
Este producto está diseñado para ingenieros de robótica, investigadores de IA y equipos de producto que desarrollan sistemas de IA física. También es relevante para empresas que implementan robots en logística, fabricación, asistencia en el hogar y cualquier entorno donde se necesite manipulación adaptable de cuerpo completo. Los equipos que trabajan en robots humanoides o sistemas multi-robot encontrarán especialmente valiosas las funciones de colaboración y destreza.
El sitio web no proporciona instrucciones de uso paso a paso. Para comenzar, visite la publicación oficial del blog de Google DeepMind sobre Gemini Robotics 2 y siga la documentación vinculada y los detalles de acceso al modelo que se indican allí. Los modelos están diseñados para integrarse con sistemas de hardware robótico, por lo que la implementación requerirá experiencia en robótica y acceso a plataformas robóticas compatibles.
Gemini Robotics 2 representa un avance significativo para hacer que los robots sean genuinamente adaptables, en lugar de estar preprogramados para tareas específicas. La combinación de control de cuerpo completo, manipulación diestra y colaboración multi-robot aborda tres de los problemas más difíciles en robótica actual. La capacidad de ejecutar el modelo en el dispositivo y adaptarse a nuevas encarnaciones en horas, en lugar de semanas, es una ventaja práctica para los equipos que iteran en hardware. El soporte entre encarnaciones mostrado con múltiples plataformas robóticas sugiere un nivel de generalidad que podría reducir los costos de desarrollo en diferentes diseños de robots. Si bien la publicación del blog no incluye testimonios de usuarios ni datos de referencia, el alcance técnico y la arquitectura de tres modelos indican un lanzamiento serio y orientado a la producción, destinado a llevar los robots de las demostraciones de laboratorio a la utilidad en el mundo real.
Gemini Robotics 2, de Google DeepMind, dota a los robots de inteligencia corporal completa. Permite acciones físicas coordinadas y fluidas para tareas complejas de manipulación y navegación en el mundo real, marcando un avance clave en robótica.
Category:Agente
Visit Link:https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
Tags:Google DeepMind、robótica IA、control de cuerpo completo、manipulación robótica、inteligencia encarnada