Por Canuto  

Generalist AI presentó GEN-1.5, un modelo robótico que, según la empresa, aprende nuevas tareas físicas a partir de una demostración de entre 3 y 12 segundos. El sistema alcanzó 59% de éxito sin ajustes y 83% tras una adaptación mínima, aunque todavía no ofrece pesos, API ni producto comercial.
***

  • GEN-1.5 utiliza video, sensores, lenguaje y propiocepción, con una ventana de contexto de 30 segundos.
  • Una demostración de 3 a 12 segundos produjo un promedio de 59% de éxito en 10 tareas de manipulación.
  • Diez pasos de gradiente sobre cinco minutos de datos elevaron el resultado a 83%, pero el sistema sigue en fase de investigación.


Generalist AI presentó GEN-1.5, un modelo fundacional para robots que, según la empresa, puede aprender una nueva tarea física a partir de una sola demostración. El sistema recibe entre 3 y 12 segundos de datos sensoriomotores dentro de una ventana de contexto de 30 segundos y luego intenta ejecutar la acción sin actualizaciones de gradiente, ajuste fino ni programación específica para cada tarea. La compañía denomina a este mecanismo «prompting físico» y lo describe como una capacidad surgida durante el preentrenamiento.

En una evaluación con 10 tareas diversas de manipulación, GEN-1.5 obtuvo un promedio de éxito de 59%, con una desviación estándar de 10%, al utilizar únicamente el modelo previamente entrenado. Cuando los investigadores aplicaron 10 pasos de gradiente sobre cinco minutos de datos por tarea, el promedio subió a 83%, con una desviación estándar de 9%. Aunque las tareas son simples y de horizonte corto, Generalist AI sostiene que se trata del primer modelo de su equipo en el que el aprendizaje físico de un solo ejemplo apareció a escala.

Un modelo multimodal para interacción física

GEN-1.5 combina entradas de video, sensores, lenguaje y datos propioceptivos, es decir, información sobre la posición y el movimiento del propio robot. El modelo conserva 30 segundos de memoria contextual y emite trayectorias de acción a una frecuencia de 100 Hz, una característica orientada a coordinar movimientos continuos en entornos físicos. Generalist AI afirma que el sistema acumuló más de ocho meses de preentrenamiento continuo con datos de interacción recopilados en hogares, almacenes y fábricas.

La demostración se incorpora a la ventana de contexto mediante una interfaz de arrastrar y soltar, mientras el resto del espacio contiene observaciones que se actualizan de forma constante. Esa muestra incluye los flujos de sensores y la trayectoria de acciones asociada, de modo que el robot puede intentar reproducir el comportamiento sin modificar sus parámetros. En términos prácticos, el ejemplo funciona como una instrucción física temporal, en lugar de convertirse inmediatamente en un nuevo conjunto de pesos.

La empresa asegura que la capacidad no fue diseñada mediante cambios arquitectónicos destinados a favorecer el aprendizaje dentro del contexto. Tampoco habría utilizado un ciclo de metaaprendizaje ni objetivos auxiliares para estimular la improvisación, por lo que Generalist AI atribuye el resultado a la escala del preentrenamiento con interacciones físicas. La compañía compara esta aparición con el desarrollo del prompting de un solo ejemplo en modelos de lenguaje, aunque el alcance de la analogía todavía debe comprobarse en tareas más complejas.

El resultado no equivale a una inteligencia robótica general ni demuestra que una máquina pueda aprender cualquier habilidad tras observarla una vez. La propia empresa limita la afirmación a tareas de manipulación simples y de horizonte corto, una precisión importante para interpretar los porcentajes sin convertirlos en una promesa de autonomía universal. En robótica, además, pequeños errores de percepción, agarre o posicionamiento pueden cambiar por completo el resultado de una ejecución.

Resultados y reducción del entrenamiento

El promedio de 59% corresponde a la modalidad de prompting físico sin entrenamiento adicional, aplicada sobre 10 tareas distintas. La adaptación de 10 pasos de gradiente sobre cinco minutos de datos por tarea, cerca de 50 demostraciones en total, elevó el desempeño a 83%. Generalist AI también reportó que un solo paso de gradiente con un minuto de datos alcanzó 66,5% en una tarea reservada para evaluación, sin realizar una búsqueda específica de hiperparámetros para la adaptación.

La diferencia entre ambos escenarios apunta a una reducción considerable del costo computacional asociado con adaptar políticas robóticas. La empresa señala que, tradicionalmente, ese proceso ha requerido decenas de miles de pasos de gradiente, mientras que GEN-1.5 consigue mejoras medibles con una cantidad mucho menor de actualizaciones. Sin embargo, los resultados comunicados no detallan en el material disponible el número exacto de intentos por tarea ni un desglose completo de los intervalos de confianza.

Otro dato destacado es que 10 pasos de entrenamiento modificaron menos de 0,15% de los pesos del modelo en tareas reservadas para evaluación. Generalist AI interpreta esa variación como una señal de que el ajuste fino estaría reorganizando conocimientos ya presentes, en lugar de construir representaciones completamente nuevas. La compañía presenta este enfoque como entrenamiento durante la prueba en un régimen de datos extremadamente limitado.

Esta lectura debe tratarse como una interpretación de la empresa y no como una conclusión definitiva sobre el funcionamiento interno del modelo. Para establecer cuánto depende el resultado de la distribución de datos, la selección de tareas y las condiciones del entorno, harían falta evaluaciones independientes y comparaciones reproducibles. La ausencia de pesos públicos también impide que investigadores externos inspeccionen directamente el sistema o repitan el experimento con el mismo modelo.

Transferencia entre tareas, simulación y personas

Generalist AI describió tres resultados de transferencia que amplían el interés de GEN-1.5 más allá de la repetición literal de una demostración. En el primero, dos instrucciones registradas por separado pueden colocarse dentro del contexto para formar un comportamiento continuo. El modelo genera movimientos intermedios, como reposicionamientos, cambios de agarre y recuperación de errores, aunque esas acciones de enlace no aparecen explícitamente en ninguna de las dos muestras.

La empresa también informó un caso de transferencia de simulación a realidad sin entrenamiento específico con datos simulados. Una demostración grabada completamente en un entorno virtual habría servido como indicación para un robot real, pese a que el preentrenamiento no incluyó video renderizado ni dinámicas simuladas. Si el resultado se mantiene en más tareas y hardware, podría reducir la necesidad de recopilar físicamente cada demostración, aunque la fuente no proporciona un porcentaje general para esta capacidad.

El tercer resultado corresponde a la imitación de humano a robot, en la que una persona realiza una acción con sus propias manos frente a las cámaras del robot. En algunos casos, GEN-1.5 reproduce esa conducta utilizando las manos robóticas, una posibilidad que conecta la demostración natural con sistemas de manipulación automatizada. El material disponible no especifica cuáles fueron esas tareas ni informa si la correspondencia entre las manos humanas y robóticas requirió calibración adicional.

Estos experimentos sugieren que el modelo no se limita a copiar una secuencia de movimientos observada cuadro por cuadro. También debe interpretar el objetivo físico, coordinar sus actuadores y resolver parte de la transición entre situaciones, al menos dentro de los escenarios reportados por Generalist AI. Aun así, la transferencia no garantiza robustez ante objetos desconocidos, iluminación distinta, obstáculos inesperados o fallas mecánicas.

Una investigación sin producto disponible

GEN-1.5 no está disponible actualmente como un producto de uso autónomo. Generalist AI indicó que no publicará pesos, no ofrece una API, no tiene una página de precios ni dispone de un servicio de autosuscripción para probar el modelo. La empresa ejecuta el sistema en su propia flota y utiliza su propio motor de datos, mientras que los interesados deben explorar una colaboración directa.

Esta limitación cambia la forma en que debe evaluarse el anuncio dentro del sector de inteligencia artificial y robótica. Por ahora, el lanzamiento funciona como una señal de investigación sobre lo que podría emerger al escalar el preentrenamiento con datos físicos, no como una herramienta que fabricantes o desarrolladores puedan integrar de inmediato. La falta de acceso externo también restringe la posibilidad de medir costos, latencia, tasa de fallos y desempeño bajo protocolos independientes.

La propuesta llega en un momento en que los modelos fundacionales para robots buscan combinar percepción, lenguaje y control en una sola arquitectura. Frente a políticas entrenadas para tareas concretas, un sistema capaz de utilizar demostraciones breves podría simplificar la programación de nuevas conductas y disminuir la cantidad de datos necesarios para cada entorno. El beneficio potencial, no obstante, dependerá de que el rendimiento se mantenga cuando las tareas dejen de ser cortas, simples y cuidadosamente seleccionadas.

El siguiente paso lógico será observar si Generalist AI publica más detalles técnicos, amplía la evaluación y permite que terceros examinen el modelo. Hasta que eso ocurra, los resultados de 59% sin adaptación y 83% con un ajuste mínimo deben leerse como indicadores prometedores, pero todavía preliminares. GEN-1.5 plantea una pregunta relevante para la robótica: cuánto aprendizaje puede obtener un modelo de una demostración breve cuando el conocimiento general ya fue construido durante meses de interacción física.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín