Google lanza Gemini Robotics 2: Un salto cuántico en la inteligencia artificial robótica
Google ha presentado Gemini Robotics 2, un nuevo modelo de visión, lenguaje y acción que promete revolucionar la robótica con una capacidad de adaptación sin precedentes. La compañía también ha retirado Nano Banana 2 de Google Earth tras la proliferación de imágenes falsas generadas por la IA.
Una IA física que aprende y se adapta
La nueva capa de inteligencia artificial, impulsada por Gemini Robotics 2, busca crear robots “verdaderamente adaptables”, capaces de razonar sobre cada movimiento y ejecutar una amplia gama de tareas. El avance más significativo reside en la ampliación de la inteligencia artificial física a todo el cuerpo humanoide, superando las limitaciones de los modelos anteriores que se centraban en el control de la parte superior. Esto significa que los robots ahora pueden caminar, agacharse, estirarse y manipular objetos con una destreza notable, como ordenar una habitación de forma autónoma.
“Por primera vez, el modelo puede controlar robots humanoides completos, traduciendo la intención en un control inteligente de todo el cuerpo”, afirma Google. La compañía también destaca la capacidad de colaboración entre robots, optimizando la ejecución de tareas a través de una inteligencia distribuida y local. Esta característica permite que los dispositivos se adapten a diferentes cuerpos robóticos “completamente nuevos” en cuestión de horas, lo que abre un abanico de posibilidades para la personalización y la flexibilidad en el diseño de robots.

Tres modelos, una arquitectura integrada
Gemini Robotics 2 se basa en tres modelos distintos, optimizados para diferentes funciones: el modelo de visión, lenguaje y acción (VLA), el modelo de razonamiento integrado (ER 2) y el modelo de visión, lenguaje y acción más eficiente (On-Device 2). El VLA, por ejemplo, convierte la información visual y lingüística en control motor, permitiendo que el robot realice acciones específicas, desde la manipulación de objetos delicados hasta la coordinación de movimientos complejos.
El modelo ER 2 actúa como el “cerebro de alto nivel” del robot, procesando las instrucciones y comunicándose con los humanos. Observa el entorno, razona sobre los pasos necesarios para completar la tarea y se coordina con el VLA. Este modelo es capaz de controlar manos SharpaWave de cinco dedos y 22 grados de libertad, permitiendo la ejecución de tareas delicadas como atar nudos. Además, opera pinzas paralelas estándar de dos dedos para tareas que requieren destreza.
El modelo On-Device 2, por su parte, optimiza la eficiencia al ejecutar las capacidades avanzadas localmente en el dispositivo robótico. Gracias a esta arquitectura, los usuarios podrán pedir a robots humanoides que realicen acciones concretas, como colocar una regadera en el contenedor verde del estante inferior, y el robot procesará la instrucción y se desplazará por el espacio para completar la tarea de forma inteligente. Esta nueva generación de robots representa un avance significativo en la autonomía y la capacidad de respuesta de las máquinas.
Google ha presentado tres modelos de gran capacidad para diferentes funciones: el modelo de visión, lenguaje y acción (VLA), que convierte la información visual y lingüística en control motor; el modelo Gemini Robotics ER 2, el de razonamiento integrado; y el modelo Gemini Robotics On-Device 2, el de visión, lenguaje y acción más eficiente. La compañía espera que esta tecnología impulse la creación de robots más versátiles y adaptables, capaces de transformar nuestra interacción con el mundo físico.
