Un equipo de investigadores desarrolló un simulador mundial interactivo que predice video condicionado por acciones robóticas. El sistema busca reducir el costo de recopilar demostraciones y permitir evaluaciones reproducibles, con pruebas que muestran una fuerte correlación entre sus resultados y el desempeño de robots reales.
***
- El simulador funciona a 15 FPS durante más de 10 minutos en una sola RTX 4090.
- Fue probado en empuje de objetos, enrutamiento de cuerdas, agarre de tazas y barrido de pilas.
- Las políticas entrenadas con 100% de datos simulados lograron operar en un robot real.
Un simulador mundial promete abaratar el entrenamiento de robots con IA
Entrenar un robot suele exigir cientos de demostraciones realizadas por expertos en hardware físico. Después, los investigadores deben ejecutar la política muchas veces para medir su desempeño, un proceso lento, costoso y difícil de reproducir.
El escenario puede cambiar entre una prueba y otra. El hardware puede fallar, la iluminación puede variar y los objetos pueden quedar en posiciones distintas, mientras cada tarea nueva demanda más horas de laboratorio.
Un modelo de mundo para interactuar con robots
El trabajo presentado por Robohub, en una publicación firmada por Yixuan Wang el 20 de julio de 2026, propone una alternativa basada en inteligencia artificial. El equipo construyó un Simulador Mundial Interactivo que predice los siguientes fotogramas de una escena a partir de imágenes y acciones robóticas.
El sistema genera sus predicciones directamente en el espacio de píxeles. A diferencia de un simulador físico tradicional, no utiliza internamente un motor que describa de forma explícita la geometría, la fricción, los contactos o la deformación de los objetos.
El usuario puede conectar un dispositivo de teleoperación y controlar el robot dentro del modelo aprendido. Según la información presentada, el sistema mantiene una interacción estable durante más de 10 minutos, con una frecuencia de 15 FPS, utilizando una sola GPU RTX 4090.
La estabilidad durante horizontes prolongados representa uno de los principales retos de los modelos de video. Las predicciones autoregresivas suelen acumular errores, pero este simulador busca conservar una apariencia estable y físicamente plausible mientras recibe nuevas acciones.
La propuesta apunta a dos cuellos de botella del aprendizaje robótico. El primero es la generación de datos, que podría trasladarse parcialmente al entorno virtual; el segundo es la evaluación, que podría realizarse bajo condiciones idénticas y con mayor escala.
Cuatro tareas con dinámicas diferentes
Los investigadores entrenaron el simulador con cuatro tareas de manipulación. El conjunto incluye empuje de un bloque con forma de T, enrutamiento de cuerdas, agarre de tazas y barrido de pilas de objetos.
Las tareas cubren situaciones físicas distintas. El empuje involucra contacto entre cuerpos rígidos, mientras el enrutamiento de cuerdas combina interacción deformable y rígida mediante un clip.
El agarre de tazas exige capturar dinámicas de contacto más delicadas. El modelo puede representar una taza que se desliza fuera del agarre, además de un asa que recibe un empujón y cambia de orientación.
En el caso de las cuerdas, el simulador distingue entre una cuerda que entra efectivamente en el clip y otra que se balancea sin establecer contacto. El comportamiento observado sigue las acciones recibidas, sin favorecer previamente uno de los resultados.
El barrido de pilas plantea otro desafío porque requiere manipular varios objetos acumulados. El modelo también puede generar video desde distintos puntos de vista de manera consistente, una capacidad relevante para analizar una misma escena desde diferentes cámaras.
Los cuatro comportamientos fueron aprendidos a partir de datos de interacción. El trabajo señala que el sistema no incorpora conocimientos físicos codificados de antemano para producir estas dinámicas.
Cómo funciona el simulador
El entrenamiento ocurre en dos etapas. Primero, el equipo desarrolla un autoencoder capaz de comprimir imágenes RGB en representaciones latentes bidimensionales y luego reconstruirlas como imágenes.
Esta compresión permite que el modelo razone en un espacio de menor dimensión. Al mismo tiempo, el decodificador busca conservar resultados visuales de alta fidelidad cuando transforma las representaciones latentes en fotogramas.
En la segunda etapa, los investigadores congelan el autoencoder y entrenan un modelo de dinámica condicionado por acciones. Este componente recibe estados visuales latentes anteriores junto con las acciones del robot.
El modelo predice el siguiente estado latente. Luego, el decodificador convierte esa representación en una imagen, lo que permite visualizar el resultado de la acción dentro del entorno simulado.
Durante la inferencia, el proceso se repite de forma autoregresiva. Cada fotograma generado pasa a formar parte del contexto utilizado para predecir los siguientes, mientras los modelos de consistencia ayudan a mantener la eficiencia y la estabilidad.
El enfoque se diferencia de los simuladores de física porque evita construir manualmente cada detalle de una nueva tarea. También se distancia de algunos modelos generativos de video que no reciben acciones robóticas explícitas o que no funcionan con suficiente rapidez para la interacción.
Datos simulados para entrenar políticas
Una aplicación central consiste en recopilar demostraciones dentro del simulador y utilizarlas para entrenar políticas de aprendizaje por imitación. Este método podría disminuir la dependencia de largas sesiones con robots físicos.
Para examinar esa posibilidad, el equipo recopiló demostraciones completamente dentro del modelo de mundo. Después entrenó políticas utilizando 0% de datos del mundo real y 100% de datos generados por el simulador.
Las políticas entrenadas de esa manera fueron desplegadas directamente en un robot real. De acuerdo con los resultados descritos, no solo completaron las tareas, sino que también mantuvieron su robustez ante perturbaciones humanas continuas.
El hallazgo sugiere que los datos generados pueden acercarse en calidad a las demostraciones reales para los escenarios examinados. Sin embargo, el resultado se limita a las cuatro tareas incluidas en el trabajo y no demuestra que el método resuelva toda la variedad de problemas robóticos.
La generación virtual también puede reducir el desgaste del equipo. En lugar de repetir cada ensayo sobre una mesa física, los investigadores podrían explorar variaciones y recopilar trayectorias dentro del simulador antes de trasladar una política al laboratorio.
Ese flujo de trabajo no elimina la necesidad de validar en el mundo real. La transferencia sigue dependiendo de que el modelo haya aprendido suficientes interacciones y de que las condiciones físicas del robot sean compatibles con las escenas utilizadas durante el entrenamiento.
Evaluación reproducible y brecha sim-real
La segunda aplicación se relaciona con la evaluación de políticas. En un laboratorio, comparar varias versiones exige reiniciar escenas, repetir ejecuciones y mantener configuraciones iniciales equivalentes durante múltiples pruebas.
El simulador permite ejecutar esas políticas bajo condiciones iniciales idénticas. Así, los investigadores pueden comparar puntos de control de distintas políticas sin reorganizar físicamente los objetos en cada evaluación.
El equipo comparó cuatro políticas, identificadas como DP, ACT, π0 y π0.5. Cada una fue evaluada tanto dentro del simulador como en un robot real, utilizando las mismas configuraciones iniciales.
Los resultados mostraron una fuerte correlación entre las puntuaciones obtenidas en ambos entornos. Las políticas que tenían buen desempeño en el simulador también tendían a funcionar en el robot físico.
La relación también apareció en sentido contrario. Las políticas que fallaban dentro del modelo de mundo tendían a fallar en el robot real, lo que apunta a una posible utilidad del sistema como filtro previo a las pruebas físicas.
Los simuladores clásicos continúan ofreciendo ventajas cuando los investigadores necesitan controlar explícitamente las leyes físicas y las propiedades de los objetos. No obstante, requieren modelar geometrías, contactos, fricción y deformaciones, y pueden conservar una brecha entre la simulación y la realidad.
Los modelos aprendidos ofrecen otra ruta, aunque también enfrentan riesgos. Una predicción visualmente convincente puede ocultar errores en la dinámica, especialmente cuando el sistema se enfrenta a objetos, acciones o perspectivas que no aparecieron en sus datos de interacción.
Próximos pasos para los modelos de mundo
El trabajo presenta la predicción de video condicionada por acciones como una herramienta con potencial para la robótica. Su objetivo práctico no es únicamente producir imágenes, sino servir como un motor interactivo para entrenar y evaluar políticas.
La ejecución durante más de 10 minutos a 15 FPS en una RTX 4090 aborda dos limitaciones frecuentes. Muchos modelos resultan demasiado lentos para interactuar en tiempo real, mientras otros pierden estabilidad durante inferencias prolongadas.
El equipo planea extender el marco a entornos más diversos y tareas de manipulación más complejas. Esa expansión será importante para determinar si el desempeño observado se mantiene fuera de las cuatro actividades iniciales.
Otra línea futura consiste en estudiar cómo escala el rendimiento cuando aumentan los datos de interacción y los recursos computacionales. Comprender esa relación podría orientar el diseño de modelos de mundo más grandes y capaces.
Yixuan Wang, autor de la publicación, es candidato a doctorado en su último año de Ciencias de la Computación en la Universidad de Columbia. También se desempeña como científico investigador en el Laboratorio de Robótica de NVIDIA en Seattle.
El simulador no sustituye por completo al robot físico, pero puede cambiar el momento en que se utiliza. Si sus predicciones conservan la correlación observada, la robótica podría trasladar más entrenamiento y evaluación a entornos virtuales antes de asumir los costos del laboratorio.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Biohacking
Un agonista de GPR40 restaura la actividad del timo envejecido en ratones
Biohacking
La timulina del timo podría frenar la inflamación vinculada al envejecimiento
IA
Sam Altman afirma que la IA ya entró en la singularidad tras el caso Hugging Face
Capital de Riesgo