
El modelo amplía el control de robots humanoides a todo el cuerpo y permite la colaboración inteligente entre múltiples máquinas.
Google ha presentado Gemini Robotics 2, su nuevo modelo de visión, lenguaje y acción más avanzado, que agrega mejoras para extender el control inteligente de movimientos a todo el cuerpo, destreza avanzada a la hora de realizar tareas y colaboración entre múltiples robots. El gigante tecnológico ha dado a conocer esta nueva capa de inteligencia que impulsará la próxima generación de robots "verdaderamente adaptables", dado que podrán razonar sobre cada movimiento, "desbloqueando una amplia gama de tareas".
Los avances del modelo destacan por permitir a los robots humanoides llevar a cabo acciones como caminar, agacharse, estirarse y manipular objetos con destreza para, por ejemplo, ordenar una habitación. Mientras que los modelos anteriores solo controlaban la parte superior del cuerpo del humanoide para realizar tareas sobre una mesa, Gemini Robotics 2 amplía la IA física a los movimientos de todo el cuerpo. "Por primera vez, el modelo puede controlar robots humanoides completos, traduciendo la intención en un control inteligente de todo el cuerpo", ha matizado Google.
Para poder ejecutar todas estas capacidades, Gemini Robotics 2 se sirve de tres modelos de gran capacidad. El mencionado modelo de visión, lenguaje y acción (VLA) convierte la información visual y lingüística en control motor, permitiendo que el robot realice acciones. Este modelo influye en el control de los humanoides al completo, desde los dedos de los pies hasta los de las manos, ofreciendo un nuevo nivel de manipulación preciso.
El modelo Gemini Robotics ER 2 es el de razonamiento integrado más avanzado. Este modelo de lenguaje visual actúa como un agente, permitiendo a los robots comunicarse con los humanos, comprender el mundo físico y planificar tareas de varios pasos. Finalmente, el modelo Gemini Robotics On-Device 2 es el modelo VLA más eficiente, optimizado para ejecutarse localmente en los dispositivos robóticos.
Como resultado, los usuarios podrán pedir a robots humanoides que lleven a cabo acciones concretas como colocar una regadera en el contenedor verde del estante inferior. Tras ello, el robot procesará la instrucción y se desplazará por el espacio realizando la tarea de forma inteligente, razonando sobre sus movimientos y acciones con todo el cuerpo.
El modelo ahora puede controlar manos de cinco dedos y 22 grados de libertad para realizar acciones delicadas como atar nudos. También puede operar pinzas paralelas estándar de dos dedos para realizar tareas complejas que requieren destreza. El modelo Gemini Robotics ER 2 actúa como "el cerebro de alto nivel del robot", procesando las instrucciones y comunicándose con los humanos. Observa el entorno, razona sobre los pasos necesarios para completar la tarea, se coordina con el VLA para llevar a cabo las acciones y realiza un seguimiento del progreso hasta que la tarea finaliza.
El modelo se ha generado con un enfoque de seguridad multicapa, combinando marcos sólidos de seguridad en IA e introduciendo una nueva comparativa llamada ASIMOV-Agentic para la IA física agéntica y la navegación en entornos de incertidumbre.
Gemini Robotics ER 2 ya está disponible en Google AI Studio y en versión preliminar privada en Gemini Enterprise Agent Platform. Los modelos VLA y On-Device solo están disponibles para socios con acceso anticipado. La inteligencia avanzada ha sido diseñada para poder ejecutarse localmente en el dispositivo, pudiendo adaptarse a distintos cuerpos robóticos "completamente nuevos" en "solo unas horas".
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)