Un “cerebro” capaz de pensar mientras el robot actúa
Una de las principales novedades de Gemini Robotics ER 2 es su arquitectura de funcionamiento, en lugar de controlar directamente cada movimiento del robot, el modelo se encarga de planificar las acciones y delega la ejecución física en modelos especializados de visión, lenguaje y acción (VLA). Esta separación permite que el sistema continúe razonando sobre los siguientes pasos mientras el robot ya está realizando una acción física, eliminando muchas de las pausas que hasta ahora eran habituales en este tipo de sistemas.

Según Google, este enfoque mejora significativamente la fluidez de las operaciones y permite ejecutar secuencias de trabajo mucho más largas y complejas sin necesidad de detener constantemente el proceso para recalcular cada movimiento, además, Gemini Robotics ER 2 puede recurrir a herramientas externas cuando necesita información adicional para completar una tarea, incluyendo la Búsqueda de Google o funciones desarrolladas específicamente por los programadores mediante la API.
Otra de las mejoras más importantes respecto a Gemini Robotics ER 1.6 es la capacidad para analizar vídeo de forma continua mientras el robot trabaja, gracias a este procesamiento permanente del entorno, el sistema puede comprobar en tiempo real cómo progresa una tarea, detectar posibles errores durante su ejecución y determinar con precisión cuándo una fase ha finalizado para iniciar automáticamente la siguiente. Esta capacidad supone un cambio importante frente a versiones anteriores, ya que el robot ya no necesita reiniciar completamente un flujo de trabajo cuando surge un problema inesperado, en su lugar, puede identificar el punto exacto donde se produjo el fallo y continuar desde ahí tras corregirlo.
Robots que colaboran entre sí
Google también ha incorporado una de las funciones más ambiciosas del proyecto como es la colaboración coordinada entre distintos robots, Gemini Robotics ER 2 permite que máquinas diferentes compartan una misma comprensión del entorno y coordinen tareas dentro de un mismo espacio de trabajo. Durante la presentación, DeepMind mostró un ejemplo en el que un robot Franka F3 Duo introducía objetos en cajas mientras el robot humanoide Apollo 2, desarrollado por Apptronik, colocaba posteriormente esas cajas en una estantería.
Según Google, ninguno de los dos robots habría podido completar toda la tarea de forma individual, pero gracias al modelo compartido de razonamiento fueron capaces de colaborar de manera coordinada, la compañía considera que esta capacidad abre la puerta a futuras aplicaciones en fábricas, almacenes, logística o entornos industriales donde diferentes tipos de robots deberán trabajar conjuntamente.

Otra de las novedades destacadas es la integración directa con la API de Gemini Live, DeepMind ha implementado un sistema de transmisión bidireccional diseñado para reducir la latencia durante la interacción entre el modelo y el robot, en la práctica, esto elimina buena parte de las pausas que anteriormente se producían mientras el sistema procesaba información antes de ejecutar la siguiente acción, haciendo que el comportamiento resulte mucho más natural y continuo.
Seguimiento del progreso en tiempo real
Gemini Robotics ER 2 también incorpora un sistema capaz de medir el avance de una tarea mediante el análisis constante del vídeo capturado por el robot, el modelo clasifica cada fotograma dentro de una escala de progreso dividida en cinco niveles, desde el inicio hasta la finalización completa de la actividad. Google afirma que esta función alcanza una precisión del 57,4% en la estimación del progreso y es capaz de identificar momentos clave dentro de una secuencia con una precisión del 91,3%, localizando eventos críticos con un margen medio inferior a un segundo.
La compañía asegura que este rendimiento supera ampliamente al obtenido por modelos de lenguaje convencionales, ofreciendo además un coste computacional considerablemente menor, Google ha puesto un especial énfasis en la seguridad de esta nueva generación de modelos. Gemini Robotics ER 2 mejora de forma significativa los resultados obtenidos por su predecesor en las pruebas relacionadas con el seguimiento de instrucciones de seguridad y la detección de personas cercanas.
Durante las demostraciones prácticas, el sistema fue capaz de detener automáticamente el movimiento de un robot humanoide cuando detectaba la presencia de una persona dentro de su área de trabajo y reanudar la actividad de manera autónoma una vez que la zona volvía a estar despejada. Este tipo de capacidades resulta especialmente relevante para futuros escenarios donde humanos y robots compartan el mismo espacio de trabajo de forma habitual.
La combinación de razonamiento continuo, comprensión del entorno, planificación de múltiples pasos, colaboración entre robots e integración con herramientas externas sitúa a este modelo como uno de los desarrollos más avanzados de DeepMind hasta la fecha. Gemini Robotics ER 2 ya está disponible para desarrolladores a través de Google AI Studio y la API de Gemini, donde podrá integrarse en nuevos proyectos de robótica e investigación.