DeepMind dice que Gemini Robotics 2 puede controlar la mano de SharpaWave, de 22 grados de libertad, en el Apolo 2 humanoide de Apptronik. Fuente: Google DeepMind
Google DeepMind la semana pasada desveló Gemini Robotics 2, la última versión de su visión-idioma-acción, o VLA, modelo.
Con la primera versión, la compañía mostró cómo el entendimiento multimodal de Gemini podría impulsar la acción del mundo real. La versión actualizada incluye el control inteligente de todo el cuerpo, la destreza avanzada y la colaboración multi-robot, dijo DeepMind.
Gemini Robotics 2 permite a los robots razonar a través de cada movimiento, desbloqueando una amplia gama de tareas. Por ejemplo, podría permitir a un humanoide caminar, cortar, estirar y manipular objetos para limpiar una habitación desordenada. El robot también podría unirse con otros robots para terminar el trabajo más rápido.
Gemini Robotics 2 también puede funcionar localmente en el dispositivo mientras se adapta a cuerpos robóticos completamente nuevos en pocas horas, afirmó DeepMind. Además del VLA, la empresa también dio a conocer:
- Gemini Robotics ER 2: Este modelo de razonamiento encarnado (ER) es un modelo de lenguaje de visión (VLM) que actúa como agente de DeepMind, permitiendo que los robots se comuniquen con la gente, comprendan el mundo físico y planifiquen tareas multi-paso durante varios minutos. DeepMind también está introduciendo la capacidad de los robots para trabajar juntos como equipo.
- Gemini Robotics On-Device 2: La empresa optimizó este VLA para funcionar localmente en dispositivos robóticos. El modelo ahora puede lograr una rápida adaptación a encarnaciones robot completamente nuevas con unas pocas horas de datos, dijo DeepMind.
Gemini Robotics ER 2 está disponible ahora en Google AI Studio y en vista privada en Gemini Enterprise Agent Platform. Los modelos VLA y On-Device están disponibles para los socios de acceso temprano.
Gemini Robotics 2 administra todo el cuerpo robot
Los modelos anteriores de DeepMind controlaban el cuerpo superior del humanoides para lograr tareas de mesa. Ahora, Gemini Robotics 2 está expandiendo la IA física en movimientos de todo el cuerpo.
El modelo ahora puede controlar robots humanoides enteros, traduciendo la intención en el control inteligente de todo el cuerpo. Por ejemplo, al controlar el robot humanoide Apolo 2 de Apptronik, los usuarios pueden pedirle que “poner el riego en el contenedor verde en la plataforma inferior”.
Apolo procesa la instrucción, camina a la mesa, y recoge la lata de riego, da unos pasos a los estantes, y lo sitúa precisamente en su destino. Mientras que DeepMind dijo que los robots tienen más que avanzar en la velocidad de movimiento, este es un paso importante hacia las habilidades necesarias para completar tareas más complejas del mundo real que requieren coordinación de todo el cuerpo.
Para ser realmente útil en nuestros hogares y lugares de trabajo, DeepMind dijo que los robots necesitan finura. Gemini Robotics 2 desbloquea un nuevo nivel de destreza física en diferentes terminales, ya sea que un robot esté usando manos o apretones.
El modelo ahora puede controlar la mano SharpaWave de cinco puntas, 22 grados de libertad en el robot Apollo 2 para completar acciones delicadas como atar nudos o sellar una bolsa de cierre. También puede operar acopladores paralelos de dos niveles estándar en una plataforma Franka Duo para realizar tareas complejas dexterous, como el empaquetado ajustado.
DeepMind gestiona tareas complejas que requieren múltiples robots
La mayoría de las tareas del mundo real requieren múltiples pasos durante un largo período de tiempo, dijo Google DeepMind. Para manejar
esta complejidad, Gemini Robotics ER 2 sirve como cerebro de alto nivel del robot, procesamiento de instrucciones de usuario y comunicación con humanos.
Observa la sala, las razones de los pasos necesarios para completar la tarea, coordina con el VLA para llevar a cabo las acciones, y rastrea el progreso hasta que se haga la tarea. Esta configuración permite a los robots ejecutar tareas complejas de varios pasos, autocorrecto si un paso falla, y generalizar a situaciones y metas novedosas.
Con la actualización, DeepMind dijo que está permitiendo a los robots ejecutar secuencias de tareas más largas, durando varios minutos e implicando cientos de decisiones. Gemini Robotics ER 2 ahora entiende cuando las tareas comienzan y terminan, y puede señalar el momento en que ocurren eventos clave, marcando un cambio paso en la comprensión del progreso.
La empresa también está introduciendo la colaboración multi-robot. Esto permite que diferentes tipos de robots se comuniquen y trabajen juntos para resolver complejos flujos de trabajo que un solo robot no podría hacer solo.
Gemini Robotics On-Device 2 se dirige a aplicaciones con baja conectividad
Muchas aplicaciones robóticas necesitan operar sin latencia de la red o conectividad a Internet. DeepMind construyó Gemini Robotics On-Device 2 para manejar estas limitaciones.
Este modelo es nativamente multi-embodiment y hereda las técnicas de “transferencia de movimiento” de DeepMind de Gemini Robotics 1.5. El modelo ahora puede adaptarse a nuevas encarnaciones de robot biarm con sólo unas pocas horas de tiempo de adaptación, típicamente con menos de 200 ejemplos.
Esto funciona incluso con nuevas encarnaciones con formas drásticamente diferentes, sensores y grados de libertad, dijo DeepMind.
DeepMind reafirma su compromiso con la seguridad
Google DeepMind dijo que la seguridad es fundamental para su investigación robótica. Gemini Robotics 2 promueve específicamente la seguridad robótica para navegar por la incertidumbre del mundo real y colaborar con los humanos, dijo la empresa.
DeepMind presentó ASIMOV-Agentic, un nuevo referente para orquestación de seguridad y resolución de incertidumbres. Por ejemplo, mide la capacidad del agente de razonamiento encarnado de rechazar llamadas de herramientas inseguras de un VLA. También mide la capacidad del agente para predecir si una tarea es posible y solicitar proactivamente la intervención humana cuando sea incierta.
Además, con un mejor razonamiento encarnado, DeepMind dijo que Gemini Robotics ER 2 es su modelo de robótica más seguro hasta la fecha en restricciones de seguridad y puntos de referencia de proximidad humanos. Es mejor detectar cuando los humanos están cerca, activar llamadas de herramientas de seguridad y llevar al robot a una parada segura si alguien se acerca demasiado de cerca. Este es un requisito clave en las normas de seguridad colaborativas, dijo DeepMind.
Guardar la fecha para RoboBusiness 2026
El post Google DeepMind dice Gemini Robotics 2 permite el control completo del cuerpo apareció primero en The Robot Report.
Fuente: The Robot Report
Líderes en información sobre robótica latinoamérica.
Somos tu guía de robótica referente en la región.


