Un sistema desarrollado por investigadores del MIT y el Instituto de Investigación Toyota utiliza tres agentes de IA para crear escenas 3D realistas donde los robots pueden practicar tareas y evaluar políticas antes de realizar pruebas en el mundo físico.
***
- SceneSmith coordina agentes llamados diseñador, crítico y orquestador para construir escenarios interiores listos para simulación.
- Las escenas pueden incluir entre tres y seis veces más objetos que métodos anteriores y abarcan espacios como restaurantes, dormitorios, hoteles y garajes.
- En una evaluación con 205 participantes, las escenas alcanzaron un promedio de 92% de realismo; además, el sistema generó más de 1.300 escenas con un VLM líder.
La robótica enfrenta un problema menos visible que el espectáculo de sus máquinas caminando por calles: conseguir suficientes datos para que esos sistemas actúen con seguridad y flexibilidad en cocinas, fábricas y hogares. Enseñar cada movimiento directamente en el mundo físico exige tiempo, personal y equipos disponibles para repetir errores, por lo que la simulación aparece como una alternativa clave. Investigadores del MIT y del Instituto de Investigación Toyota desarrollaron SceneSmith, un sistema que emplea tres agentes de inteligencia artificial para construir patios de juego virtuales destinados al entrenamiento y la evaluación de robots.
El proyecto busca cerrar la brecha entre los motores físicos cada vez más avanzados y la escasez de entornos virtuales ricos, variados y parecidos a los espacios cotidianos. Russ Tedrake, profesor Toyota de Ingeniería Eléctrica e Informática, Aeronáutica y Astronáutica, e Ingeniería Mecánica del MIT, además de investigador principal del Laboratorio de Ciencias de la Computación e Inteligencia Artificial, explicó que la simulación necesita contenido capaz de capturar la complejidad del mundo real. Sin escenas convincentes, un robot puede aprender una política que funciona en un laboratorio digital, pero falla cuando encuentra una habitación distinta.
Tres agentes para construir un mundo
SceneSmith organiza el proceso mediante tres agentes basados en un modelo multimodal de lenguaje y visión, conocido como VLM. La información disponible identifica a GPT-5.2 como el modelo utilizado por los agentes. El diseñador propone los elementos, el crítico revisa si la escena resulta realista y el orquestador coordina el intercambio y decide cuándo el resultado está listo.
La generación ocurre por etapas, como si los agentes elaboraran primero un plano y después lo convirtieran en un espacio habitable. El diseñador puede comenzar con la estructura general de una vivienda, mientras el crítico identifica problemas prácticos, como una bañera colocada en una sala, y el orquestador puede ordenar retrocesos si la calidad visual cae. Luego se incorporan muebles, objetos de paredes y techos, además de elementos manipulables que permiten probar acciones concretas.
Entre esos componentes aparecen gabinetes que pueden abrirse y cerrarse, una capacidad que las líneas base anteriores no solían incluir. SceneSmith también puede generar un objeto individual, como un carrito de servir, a partir de una imagen bidimensional y convertirlo en un modelo 3D con masa, fricción e inercia. Esa combinación intenta que el entorno no solo parezca realista, sino que también responda de manera coherente cuando el robot interactúe físicamente con él.
Nicholas Pfaff, estudiante de doctorado del MIT EECS e investigador de CSAIL, afirmó que el sistema puede construir escenas como lo haría un diseñador humano. Según el investigador, el equipo produjo más de 1.300 escenas utilizando un VLM líder y observó arreglos creativos y diversos que no fueron definidos explícitamente en las indicaciones. La capacidad de improvisar permite pedir, por ejemplo, un garaje con un automóvil, un banco de trabajo, neumáticos apilados y una escalera contra la pared, para obtener un escenario listo para experimentar.
Más objetos y tareas para los robots
La densidad de objetos es uno de los rasgos que distinguen a SceneSmith frente a enfoques anteriores. El estudio señala que el sistema genera entre tres y seis veces más objetos que métodos previos, una característica útil para practicar instrucciones como llevar una taza al fregadero, poner fruta en platos o mover una lata de refresco desde un estante hasta una mesa. Mientras más elementos relevantes contenga el entorno, más oportunidades tiene el robot de enfrentar variaciones parecidas a las que encontrará durante su despliegue.
Los investigadores compararon el sistema con líneas base de generación de escenas como HSM y Holodeck, y reportaron ambientes con mayor cantidad de objetos y variedad temática. Entre los ejemplos aparecen una oficina privada, una tienda de cerámica y una sala de juegos inspirada en Minecraft, además de espacios como restaurantes, dormitorios y hoteles. En un estudio con 205 participantes, SceneSmith alcanzó un promedio de 92% de realismo.
La evaluación también indicó que el sistema seguía las instrucciones con mayor fidelidad que los demás enfoques analizados. Esa precisión importa porque una simulación visualmente atractiva no necesariamente representa el patio de juego que un ingeniero necesita para probar una política robótica. En este caso, la diversidad no depende únicamente de una biblioteca fija de modelos, ya que los agentes pueden generar recursos a partir de indicaciones de texto y convertirlos en objetos tridimensionales.
La riqueza de las escenas permite evaluar un robot antes de encenderlo o enviarlo a un espacio real. Los ingenieros pueden probar diferentes planes de acción, observar dónde se atasca una máquina y descartar políticas defectuosas sin pagar el costo de repetir cada experimento con hardware. Para sistemas que deben abrir puertas, ordenar objetos o desplazarse entre habitaciones, esa etapa virtual puede reducir el ensayo y error, aunque no elimina la necesidad de validar posteriormente el comportamiento físico.
Pruebas de realismo y desempeño
El equipo probó distintas políticas en los mundos digitales de SceneSmith y generó 100 espacios únicos para revisar los resultados. Un agente VLM analizó cada intento y detectó que los planes del robot eran defectuosos, porque la máquina fallaba con frecuencia al completar las tareas propuestas. La información disponible no aporta una cifra verificable sobre el porcentaje de coincidencia entre el agente y los evaluadores humanos, por lo que no se presenta ese dato.
Los investigadores examinaron el realismo desde otro ángulo mediante una política robótica preentrenada, es decir, un controlador que había aprendido principalmente con datos del mundo real y nunca había visto una escena de SceneSmith. Cuando los usuarios le indicaron que tomara una manzana de un tazón y la colocara sobre una tabla de cortar, el robot simulado completó la acción. El resultado no demuestra por sí solo que toda simulación sea transferible, pero sí ofrece una señal de que los espacios generados conservan patrones reconocibles para una política entrenada fuera de ellos.
El equipo también operó robots de manera remota a través de los escenarios virtuales. Las máquinas abrieron gabinetes, guardaron botellas y navegaron entre habitaciones, mientras los investigadores comprobaban si los entornos soportaban interacciones físicas sostenidas y no únicamente inspecciones desde una cámara. Esa prueba resulta relevante porque los errores de colisión, articulación o fricción pueden arruinar una política aunque la imagen del escenario parezca convincente.
Jeremy Binagia, científico aplicado de Amazon Robotics y ajeno a la investigación, describió SceneSmith como un avance importante por ofrecer un marco agéntico que genera interiores listos para simulación a partir de una indicación de texto. Según su valoración, el sistema aumenta la densidad de objetos, busca precisión física además de realismo visual y evita limitarse a una biblioteca fija de recursos. El comentario identifica el atractivo central del proyecto, aunque la adopción práctica todavía dependerá del costo computacional y de la validación en máquinas reales.
El costo de crear escenarios detallados
El nivel de detalle tiene una desventaja directa: producir una sola escena puede tardar varias horas. Cada agente examina los objetos y el conjunto del entorno, de modo que la calidad y la variedad llegan acompañadas de una carga computacional considerable. Para equipos que necesitan miles de ambientes durante ciclos rápidos de desarrollo, la velocidad de generación será tan importante como el realismo obtenido.
Los ingenieros del CSAIL esperan mejorar la eficiencia con mayor potencia informática y ampliar el sistema hacia objetos deformables, como esponjas, si existen bibliotecas 3D suficientemente extensas. Ese salto introduciría desafíos adicionales, porque los objetos flexibles cambian de forma durante la interacción y exigen modelos físicos más complejos. La fuente no presenta todavía una fecha para esa expansión ni afirma que SceneSmith haya resuelto ese problema.
Pfaff y Tedrake desarrollaron el trabajo junto con Thomas Cohn, estudiante de doctorado del MIT e investigador de CSAIL, y los especialistas en robótica del Instituto de Investigación Toyota Sergey Zakharov y Rick Cory. El proyecto recibió apoyo parcial de Amazon, la Oficina de Investigación Naval de Estados Unidos, el Instituto de Investigación Toyota y la Fundación Nacional de Ciencias de Estados Unidos. El equipo presentó sus hallazgos como una presentación destacada en la Conferencia Internacional de 2026 sobre Aprendizaje Automático.
La propuesta no convierte automáticamente a un robot en un asistente multifacético, pero modifica una parte crítica del proceso: cómo se construyen los lugares donde una máquina aprende. Si los escenarios virtuales pueden combinar diversidad, interacción física y evaluación confiable, los desarrolladores tendrán una forma más escalable de detectar fallos antes de asumir riesgos en el mundo real. El reto pendiente será demostrar que esa transferencia se mantiene en una gama amplia de robots, objetos y condiciones no previstas.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Hardware
Waymo desarrolla un chip propio de más de 1.000 TOPS para sus robotaxis
Asia
NTU crea robot quirúrgico del tamaño de una semilla con cinco funciones
Privacidad
Windows 11 prueba controles para bloquear el acceso de apps a cámara y micrófono
Empresas