En un encuentro de Y Combinator, investigadores y emprendedores analizan por qué la robótica sigue sin resolver después de una década de promesas. Se discuten los cuatro obstáculos fundamentales y soluciones emergentes como la memoria multi-escala y el razonamiento encarnado.
***
- La robótica lleva una década afirmando que ‘el próximo año’ estará resuelta, pero sigue atascada en demostraciones.
- Los cuatro desafíos principales son el modelado físico, la brecha sim-to-real, la falta de sensores táctiles y la deriva de encarnación.
- Investigadores de Physical Intelligence presentan un sistema de memoria multi-escala que permite a los robots realizar tareas largas con adaptación en contexto.
🤖🚨 La revolución robótica sigue estancada tras 10 años de promesas.
Cuatro obstáculos críticos impiden avances significativos:
1. Modelado físico inadecuado que genera discrepancias entre simulación y realidad.
2. Sensores limitados que afectan la interacción con el… pic.twitter.com/NpwgVPRwOE
— Diario฿itcoin (@DiarioBitcoin) August 10, 2026
La promesa incumplida de la robótica
En el video “Why Robotics Still Isn’t Solved – But Could Be Soon” del canal Y Combinator, se plantea un diagnóstico realista. El presentador destaca que ya van diez años de que la comunidad afirma que “el próximo año” la robótica estará resuelta.
Se mencionan hitos como AlphaGo, MuJoCo y los sistemas de recolección de datos Aloha. Cada avance generó expectativas de que el siguiente logro sería el definitivo, pero hasta la fecha no ha llegado un robot doméstico útil como Rosie.
En pleno 2026, los robots como Neo 1X se pueden apartar por encargo, pero no se pueden comprar un robot Pi o Figure. Lo que sí se ha multiplicado son las demostraciones controladas que no trascienden el laboratorio.
Cuatro muros que frenan la robótica
El presentador identifica cuatro grandes desafíos que impiden que la robótica de el salto final. El primero es el modelado físico del mundo real: los modelos de video no respetan la física, lo que se conoce como brecha sim-to-real.
En simulaciones, los autos pueden atravesar supermercados y convertirlos en autopistas sin estrellarse. Esto ocurre porque las funciones de transición condicionadas por acción aún no son robustas para la realidad.
El segundo problema es la representación del espacio de acción. Aprender rápido requiere una matriz Q eficiente, pero la representación lineal actual no es suficiente para capturar la complejidad de movimientos y habilidades.
El tercer desafío es el más ignorado: el problema sensoriomotor. Los humanos tenemos terminaciones nerviosas que detectan fuerza normal, tangencial, humedad, temperatura y vibración. Los robots apenas cuentan con una moneda FT en cada yema del dedo y una cámara en la muñeca.
Sin una epidermis artificial, es imposible que un robot palpe objetos en una mochila o se ate los patines con las manos frías. Esta carencia limita cualquier interacción fina con el entorno.
El cuarto muro es la deriva de encarnación. Los actuadores acumulan polvo, se corroen y cambian su respuesta con el tiempo. Esto obliga a reentrenar los modelos porque los datos de teleoperación quedan obsoletos rápidamente.
La memoria como solución a tareas largas
Marcel, estudiante de doctorado en Stanford, presentó su trabajo en Physical Intelligence llamado MEM (Memoria Encarnada Multi-Escala). Su equipo entrenó políticas capaces de desbloquear bloques, doblar ropa y hacer sándwiches de mantequilla de maní.
El reto era lograr tareas que duraran más de dos minutos, como cocinar una comida completa o limpiar un dormitorio. Las políticas convencionales sin memoria se quedan atrapadas en ciclos: lavan platos sin parar o queman un sándwich.
Para resolverlo, proponen descomponer la política en dos partes: una de alto nivel que decide el siguiente paso y una de bajo nivel que ejecuta los movimientos finos. La memoria se divide en contexto corto (imágenes densas) y contexto largo (representación textual comprimida).
El codificador de contexto corto usa atención temporal para procesar secuencias de imágenes, reduciendo tokens y acelerando la inferencia. La memoria de largo plazo se predice como una cadena de texto que se retroalimenta en la política de alto nivel.
Esta arquitectura permite que el robot espere el tiempo exacto para que no se queme el sándwich, recuerde dónde dejó los comestibles o sepa cuántos artículos quedan por descargar. Incluso puede limpiar una ventana sin pasarse el día.
Adaptación en contexto: el valor agregado de la memoria
El enfoque de memoria demuestra ser crucial para la adaptación en contexto. Sin memoria, los robots cometen el mismo error en bucle indefinidamente; con ella, pueden reaccionar ante un fallo y corregir su estrategia.
En uno de los ejemplos, un robot intentaba recoger palillos y fallaba, pero luego se reposicionaba para lograr el objetivo. En otro, abría un refrigerador y tras un primer intento fallido cambiaba de lado para abrirlo correctamente.
Este comportamiento es posible porque el modelo recuerda lo que sucedió y modifica la próxima acción. Para implementarlo, se entrenó la política de alto nivel con SFT y descripciones textuales detalladas de la tarea.
El enfoque tiene limitaciones: la representación textual puede ser insuficiente para capturar todos los matices de la memoria humana. Marcel menciona que en el futuro podrían explorarse codificaciones latentes más ricas.
Razonamiento encarnado para mejores acciones
Milan, estudiante de doctorado en Stanford e investigador en Waymo, presentó un método llamado RNB Encore. El objetivo es que los modelos de visión-acción (VLAs) generen pasos lógicos antes de decidir, similar al chain of thought en los LLM.
La robótica sufre de escasez de datos, por lo que cualquier señal adicional que permita entrenar mejor es valiosa. El razonamiento encarnado añade anotaciones que explican el porqué de cada acción.
El método propone un proponente que genera varios tipos posibles de razonamiento (planes, posición de la pinza, objetos visibles) y un validador que puntúa cuál de esos razonamientos mejora la predicción de acciones.
Al tratar el razonamiento como una variable latente, se puede usar inferencia variacional para mejorar el modelo sin necesidad de etiquetas humanas para el razonamiento. Esto busca responder qué tipo de razonamiento es el más adecuado para cada tipo de robot.
El trabajo se presentó en la Conferencia de Robotics Science and Systems de este año y apunta a dar a los robots la capacidad de explicar sus decisiones, algo esencial para la confianza y la depuración.
Hacia una robótica más realista
El encuentro concluye que la robótica aún no está resuelta, pero tampoco está estancada. Las promesas de 2026 probablemente sean exageradas, pero los avances en memoria y razonamiento son pasos concretos.
Los cuatro muros mencionados siguen en pie, pero se están explorando soluciones desde la física, los sensores y la arquitectura de modelos. La combinación de mejor hardware y software inteligente podría acercar la visión de Rosie la robot.
Los oradores coinciden en que el camino es más complejo de lo que sugieren las demos, pero los progresos en aprendizaje por refuerzo y modelos generativos podrían cambiar el panorama en la próxima década.
Mientras tanto, los inversores y consumidores deberán ser pacientes y escépticos ante los videos virales. La verdadera prueba será cuando un robot pueda operar en entornos no controlados durante días y semanas.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Brain Corp supera los 50.000 robots autónomos: la IA a escala global
Curiosidades
Robot con alas aleteantes sale del agua y vuela como un ave zambullidora
China
China y EE. UU. libran una guerra silenciosa por la energía que alimentará la IA y el bitcoin
IA