Google DeepMind presentó Gemini Robotics 2, su modelo de visión-lenguaje-acción más avanzado, que promete controlar robots desde brazos de mesa hasta humanoides. Además, lanzó Gemini Robotics ER 2 para razonamiento incorporado.
***
- Gemini Robotics 2 es el VLA más avanzado de Google DeepMind para controlar robots de diversas formas.
- El modelo permite movimiento de cuerpo completo, tareas de motor fino y coordinación multi-robot.
- Gemini Robotics ER 2, disponible en Google AI Studio, reemplaza a la versión anterior para razonamiento incorporado.
Google DeepMind ha oficializado el lanzamiento de Gemini Robotics 2, el modelo de visión-lenguaje-acción (VLA) más avanzado que la empresa ha desarrollado hasta la fecha. El anuncio, reportado por The Decoder, detalla cómo esta tecnología busca convertirse en la base para una nueva generación de robots adaptativos.
Los modelos VLA integran reconocimiento de imágenes, procesamiento de lenguaje y control de acciones para que los robots operen en entornos físicos. Gemini Robotics 2 está diseñado para manejar desde brazos robóticos de mesa hasta humanoides de cuerpo completo.
¿Qué es un modelo VLA?
Para entender el alcance de este avance, conviene explicar el concepto de visión-lenguaje-acción. Estos sistemas permiten que un robot perciba su entorno mediante cámaras, interprete instrucciones en lenguaje natural y ejecute movimientos concretos.
La arquitectura combina capacidades de procesamiento visual, comprensión semántica y planificación motora en un solo modelo unificado. Esto reduce la necesidad de sistemas separados para cada función y agiliza la toma de decisiones.
En el caso de Gemini Robotics 2, DeepMind lo describe como una “capa de inteligencia” que se puede superponer a cualquier tipo de hardware robótico. El modelo no está atado a un robot específico, sino que actúa como un cerebro universal.
La versión anterior, Gemini Robotics ER 1.6, lanzada en abril, ya había sentado las bases. Ahora, la versión 2 introduce mejoras sustanciales en control corporal, destreza fina y coordinación entre múltiples agentes.
Capacidades destacadas de Gemini Robotics 2
Según la información oficial, el modelo puede gestionar el movimiento de todo el cuerpo, lo que incluye caminar, girar y mantener el equilibrio en humanoides. También sobresale en tareas de motor fino, como ensamblar piezas pequeñas o manipular objetos delicados.
Una de las innovaciones más relevantes es la capacidad de coordinar múltiples robots en paralelo. Esto significa que un solo modelo podría dirigir una flota completa de máquinas trabajando en conjunto, algo esencial para entornos industriales o logísticos.
DeepMind afirma que Gemini Robotics 2 puede operar en tiempo real, respondiendo a estímulos cambiantes del entorno. Esto lo hace apto para aplicaciones dinámicas, como la colaboración humano-robot en fábricas.
Los desarrolladores interesados pueden solicitar acceso anticipado a través de una lista de espera habilitada por la compañía. Esta fase permitirá recopilar retroalimentación del sector y ajustar el modelo antes de un despliegue masivo.
El enfoque de DeepMind no se limita a robots industriales. La empresa también apunta a asistentes domésticos y robots de servicio, donde la versatilidad y la seguridad son críticas.
Gemini Robotics ER 2: el razonamiento incorporado
Junto a la versión VLA, Google DeepMind presentó Gemini Robotics ER 2, un modelo específicamente diseñado para el “razonamiento incorporado”. Este término se refiere a la comprensión del mundo físico y a la capacidad de decidir qué acciones tomar en función de esa información.
ER 2 actúa como un sistema de control de nivel superior, procesando datos sensoriales y planificando secuencias de movimientos complejas. A diferencia del VLA, que se enfoca en la ejecución directa, ER 2 se dedica a la deliberación y la planificación.
Este nuevo modelo reemplaza a Gemini Robotics ER 1.6, lanzado en abril, e incorpora mejoras en la comprensión de escenarios tridimensionales y en la anticipación de consecuencias físicas. Por ejemplo, puede prever si un objeto se caerá al ser empujado.
ER 2 ya está disponible en Google AI Studio, lo que permite a los desarrolladores experimentar con sus capacidades de manera inmediata. Esto reduce la barrera de entrada para startups y laboratorios de investigación.
La combinación de Gemini Robotics 2 y ER 2 ofrece una solución integral: el primero ejecuta, el segundo razona. Juntos, permiten que los robots no solo actúen de forma reactiva, sino que también reflexionen sobre el entorno y tomen decisiones autónomas.
Acceso y disponibilidad
Los desarrolladores pueden inscribirse en la lista de espera para Gemini Robotics 2 a través del sitio oficial de Google DeepMind. La compañía no ha especificado una fecha exacta de lanzamiento público, pero se espera que las pruebas se extiendan por varios meses.
En contraste, Gemini Robotics ER 2 está disponible de inmediato en Google AI Studio, la plataforma de desarrollo de IA de Google. Esto permite a los interesados probar el modelo de razonamiento en simulaciones y escenarios controlados.
Esta estrategia de acceso escalonado refleja una tendencia común en el sector: liberar primero versiones de investigación antes de comercializar productos finales. DeepMind busca validar la robustez técnica y recopilar casos de uso en el mundo real.
La documentación técnica y ejemplos de uso acompañan la liberación de ER 2, facilitando la integración en proyectos existentes. La compañía también ha publicado benchmarks preliminares que muestran mejoras significativas frente a la versión anterior.
Contexto: la carrera por la robótica con IA
El avance de DeepMind se enmarca en una competencia global por liderar la robótica inteligente. Empresas como Tesla, con su Optimus, y varias startups de humanoides también están desarrollando sistemas basados en modelos de lenguaje y visión.
La diferencia clave de Gemini Robotics 2 radica en su generalidad: no está adaptado a un solo tipo de robot, sino que puede controlar hardware heterogéneo. Esto contrasta con enfoques más especializados que requieren entrenamiento específico por máquina.
Otra ventaja es la capacidad de coordinación multi-robot, algo que los competidores aún no han demostrado a la misma escala. Esta característica es esencial para la industria 4.0, donde las fábricas inteligentes dependen de la colaboración entre máquinas.
Sin embargo, los desafíos persisten. El costo computacional de ejecutar estos modelos en tiempo real es alto, y la fiabilidad en entornos no controlados aún está por demostrarse. La lista de espera permitirá evaluar estas variables en campo.
Implicaciones para el futuro
La llegada de Gemini Robotics 2 y ER 2 podría acelerar la adopción de robots en sectores como logística, manufactura y atención al cliente. La capacidad de razonar y adaptarse en contextos variables reduce la necesidad de reprogramación constante.
Para los desarrolladores, la disponibilidad de ER 2 en Google AI Studio representa una oportunidad para crear aplicaciones innovadoras sin invertir en infraestructura propia. La democratización de esta tecnología podría generar un ecosistema de soluciones más diverso.
En el ámbito de la seguridad, DeepMind ha enfatizado la importancia de los límites éticos. El modelo incluye mecanismos para evitar acciones peligrosas, aunque aún se requiere trabajo en normativas y estándares.
La evolución de estos sistemas también plantea interrogantes sobre el impacto laboral. Si bien la automatización puede aumentar la productividad, es crucial considerar la reubicación de los trabajadores en roles más creativos.
Por ahora, Google DeepMind sigue consolidando su posición en la vanguardia de la IA aplicada a la robótica. La virtualidad de estos modelos abre un abanico de posibilidades que van desde asistentes domésticos hasta exploración espacial.
En resumen, Gemini Robotics 2 representa un hito en la búsqueda de robots verdaderamente adaptativos. Su capacidad para controlar formas variadas y coordinar equipos lo convierte en un candidato a convertirse en el estándar de la próxima década.
Los interesados en seguir de cerca estos avances pueden consultar la documentación oficial y unirse a la lista de espera para desarrollar en esta nueva frontera tecnológica.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Hardware
Firmware libre llega a las placas AMD Ryzen AM5: 3mdeb presenta Dasharo para MSI PRO B850
Hardware
AMD publica parches Linux para DCN6, la IP de visualización de RDNA5
Criptomonedas
UKey presenta Core 26 y serie Seed para autocustodia segura
China