Por Canuto  

Un equipo del MIT ha desarrollado SceneSmith, un sistema que usa tres agentes de IA para crear entornos virtuales realistas donde los robots pueden entrenar diversas tareas. Esta innovación podría acelerar el despliegue de robots en entornos reales.
***

  • SceneSmith genera escenas 3D con más objetos y realismo que otros sistemas.
  • Utiliza tres agentes de IA que colaboran para diseñar, criticar y orquestar la construcción de escenarios.
  • Los robots entrenados en estas simulaciones mostraron un desempeño superior en tareas del mundo real.

 


El desafío del entrenamiento robótico

El entrenamiento de robots para que realicen tareas en entornos del mundo real es un proceso costoso y lento. A diferencia de los humanos, los robots no pueden aprender fácilmente de la experiencia sin grandes volúmenes de datos. Este desafío ha motivado el uso de simulaciones, pero crear entornos virtuales realistas es difícil.

Un investigador principal del MIT, Russ Tedrake, explica que una idea natural es usar la simulación como campo de entrenamiento. A pesar del progreso en motores de física, el problema principal es generar contenido de simulación suficientemente rico y diverso.

El nuevo sistema SceneSmith, desarrollado en el MIT, busca resolver este problema. Utiliza agentes de IA para construir escenas 3D realistas que los robots pueden usar para practicar, indica Robohub.

La creación de estos entornos es crucial para que los robots aprendan a interactuar con objetos y superficies. Sin una simulación fiel, los robots no pueden generalizar sus habilidades al mundo real.

SceneSmith ofrece una forma automatizada de generar estos escenarios, reduciendo la necesidad de intervención humana. Su objetivo es acelerar el desarrollo de robots autónomos para tareas domésticas e industriales.

Los tres agentes que dan vida a SceneSmith

El sistema SceneSmith se basa en tres agentes que colaboran para diseñar escenas virtuales. Cada agente tiene una función específica y se comunican entre sí para lograr un resultado realista.

El primer agente, llamado “diseñador”, genera los elementos de la escena, como muebles, paredes y objetos. Utiliza un modelo de visión-lenguaje avanzado, GPT-5.2, que tiene un conocimiento amplio de cómo se ven los espacios interiores.

El segundo agente, el “crítico”, evalúa si la escena se ve realista y sugiere ajustes. Por ejemplo, puede decir que una bañera no debería estar en una sala de estar.

El tercer agente, el “orquestador”, supervisa la interacción entre los otros dos. Decide cuándo el diseño está completo y coordina el proceso de generación.

Estos agentes trabajan en etapas: primero generan un plano de planta, luego agregan muebles, después colocan objetos en paredes y techos, y finalmente añaden elementos manipulables. Cada paso es revisado por el crítico y orquestado por el tercer agente.

El resultado es una escena que puede cargarse directamente en un software de simulación física. Los robots pueden entonces interactuar con todos los objetos y practicar sus movimientos.

Evaluación y resultados de SceneSmith

Los investigadores probaron el sistema generando más de 1300 escenas. Crearon 100 espacios únicos y evaluaron diferentes políticas de control del robot.

Utilizaron un agente VLM para evaluar los planes de acción del robot. El agente identificó defectos en los planes, y los humanos estuvieron de acuerdo con sus veredictos en más del 99% de las veces.

También operaron robots de forma remota dentro de las escenas virtuales. Los robots abrieron gabinetes, guardaron botellas y navegaron entre habitaciones sin problemas.

Una prueba clave fue usar una política de robot preentrenada con datos del mundo real. Al soltarla en los entornos de SceneSmith, el robot simulado completó la tarea de tomar una manzana de un tazón y ponerla en una tabla de cortar.

Esto demostró que las escenas se asemejan mucho a los entornos reales de los que la política había aprendido. Si no fuera así, el robot no habría podido completar la tarea.

Además, más de 200 usuarios evaluaron los visuales del sistema. Los encontraron más realistas que otros enfoques en más del 90% de las veces.

También notaron que SceneSmith seguía las indicaciones de manera más precisa. Los usuarios podían pedir escenas específicas, como una oficina privada o una tienda de cerámica.

Comparación con otros sistemas de generación de escenas

En comparación con los métodos anteriores como HSM y Holodeck, SceneSmith produce entornos con más objetos. Incluye elementos articulados, como gabinetes que los robots pueden abrir y cerrar.

Los investigadores compararon la densidad de objetos y la diversidad de las escenas. SceneSmith superó a las líneas de base en la mayoría de las métricas.

También se comparó la adherencia a las instrucciones dadas. SceneSmith siguió las indicaciones de manera más precisa, generando exactamente lo que los usuarios pedían.

El realismo visual también fue superior, según la evaluación de más de 200 usuarios. Prefirieron los visuales de SceneSmith más del 90% de las veces.

Además, el sistema puede crear escenas creativas y variadas, como una sala de juegos con temática de Minecraft. Esto demuestra su flexibilidad y potencial.

Sin embargo, el proceso es más lento que otros métodos, ya que cada objeto es examinado de cerca por los agentes. Con más recursos computacionales, se podrían lograr aumentos en eficiencia.

Limitaciones y trabajos futuros

Una limitación principal de SceneSmith es el tiempo de generación. Puede tomar varias horas producir una sola escena, lo que podría ser un obstáculo para aplicaciones a gran escala.

El sistema depende de bibliotecas de objetos 3D disponibles. Si se requieren objetos deformables, como esponjas, se necesitan bibliotecas más extensas.

Los investigadores esperan expandir el sistema a objetos no rígidos y mejorar la escalabilidad. También planean optimizar el proceso con más poder de cómputo.

El trabajo es respaldado por varias instituciones, incluyendo Amazon, la Oficina de Investigación Naval, el Instituto de Investigación Toyota y la Fundación Nacional de Ciencias.

Jeremy Binagia, científico de Amazon Robotics, señaló que SceneSmith avanza el estado del arte en densidad de objetos, precisión física y generación de recursos sin bibliotecas fijas.

Estas mejoras podrían llevar a robots más capaces y listos para el mundo real. La simulación se convertirá en una herramienta clave en la robótica.

Conclusión

SceneSmith representa un avance significativo en la generación de escenas virtuales para el entrenamiento de robots. Su uso de agentes de IA permite crear entornos realistas y detallados de manera automatizada.

Este sistema podría reducir el tiempo y los costos asociados con las pruebas físicas de robots. Los robots podrán ser entrenados en una variedad de escenarios sin riesgos.

La capacidad de generar escenas bajo demanda abre nuevas oportunidades para la robótica y la inteligencia artificial. A medida que el sistema mejore, veremos robots más versátiles y preparados.

En resumen, el trabajo del MIT muestra cómo la IA puede ayudar a los robots a aprender mejor. La combinación de modelos de visión-lenguaje y simulación física es prometedora.

El futuro del entrenamiento robótico está en entornos virtuales como los creados por SceneSmith. Esta tecnología tiene el potencial de transformar la industria.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín