Por Canuto  

Google DeepMind presentó Dream-RSI, un método que permite a los agentes de inteligencia artificial ensayar estrategias sobre historiales de búsqueda ya completados antes de gastar recursos en nuevas ejecuciones. Las pruebas reportadas muestran menos intentos, mejores tiempos de ejecución y ganancias relevantes en tareas de optimización matemática y programación de kernels de GPU.

***

  • Dream-RSI reutiliza árboles de búsqueda registrados para probar estrategias alternativas sin volver a generar ni evaluar cada solución.
  • En una tarea de programación, Gemini 3.1 Pro redujo los intentos de 550 a 317 y bajó el tiempo medio de ejecución de 3.587 a 2.931 milisegundos.
  • El método superó a SimpleTES en esa comparación y logró igualar o mejorar el rendimiento de kernels de GPU con menos ejecuciones.

 


Los agentes de inteligencia artificial que intentan mejorar por sí mismos suelen repetir un ciclo de propuesta, evaluación, aprendizaje y nuevo intento.

Ese mecanismo puede producir avances graduales, pero se vuelve costoso cuando la cantidad de caminos posibles crece rápidamente y el sistema debe decidir qué ideas continuar, probar en paralelo o abandonar. En ese punto, la exploración deja de ser un detalle operativo y se convierte en uno de los factores que determinan si el agente encuentra una solución útil o desperdicia grandes cantidades de cómputo.

Investigadores de Google y DeepMind presentaron Dream-RSI como una técnica orientada a resolver precisamente ese problema. El método no modifica el modelo de inteligencia artificial que genera las soluciones, sino la estrategia que utiliza para recorrer el espacio de búsqueda. Según The Decoder, el sistema aprovecha ejecuciones anteriores para evaluar cómo habrían funcionado otras decisiones sin repetir desde cero todos los cálculos asociados con una búsqueda en vivo.

La diferencia resulta importante porque las estrategias fijas pueden llevar a un agente hacia los mismos callejones sin salida una y otra vez. Por otro lado, adaptar la estrategia mientras la búsqueda avanza permite reaccionar a la experiencia, aunque normalmente exige ejecutar muchas alternativas para descubrir cuál funciona mejor. Dream-RSI intenta conservar la capacidad de adaptación sin pagar cada vez el precio completo de una nueva evaluación.

El principio puede entenderse mediante la imagen de una persona que explora una zona desconocida. En la primera visita, debe retroceder cada vez que encuentra una ruta bloqueada, pero después puede utilizar el mapa que construyó para planificar recorridos alternativos sin volver a caminar por cada calle. Dream-RSI aplica esa lógica a los historiales que el agente registra mientras busca soluciones.

El agente sueña con sus decisiones anteriores

Durante una búsqueda, el sistema almacena los intentos realizados y los resultados obtenidos dentro de un árbol de búsqueda. Ese registro conserva información sobre las rutas que se ampliaron, las que fueron descartadas y los resultados asociados con cada decisión, creando una representación reutilizable de la exploración. Dream-RSI utiliza posteriormente ese historial para ensayar estrategias distintas dentro de una región que ya fue recorrida.

En lugar de llamar otra vez al modelo para generar soluciones o al evaluador para medirlas, el agente reproduce las decisiones sobre los datos almacenados. Así puede estimar qué habría ocurrido si hubiera perseguido primero otra rama, si hubiera abandonado antes un camino poco prometedor o si hubiera distribuido de manera distinta sus recursos. El sistema no inventa soluciones completamente nuevas durante esta fase, porque trabaja con las alternativas presentes en el árbol registrado.

Los investigadores denominan dreaming a este proceso de recrear búsquedas pasadas. En la práctica, el agente puede comparar miles de variaciones de una estrategia a un costo mucho menor que el de ejecutar miles de búsquedas completas, y después elegir la alternativa que parece más prometedora para la siguiente ronda. El ciclo alterna entre una búsqueda en vivo y una revisión del historial, de modo que cada ejecución alimenta la estrategia que se aplicará posteriormente.

Esta arquitectura separa dos funciones que a menudo se confunden en los sistemas de auto-mejora. El modelo continúa produciendo propuestas de solución, mientras que Dream-RSI aprende cómo organizar mejor las oportunidades de exploración, sin reentrenar necesariamente ese modelo generador. La distinción permite concentrar la optimización en el mecanismo de decisión y no en cambiar cada vez las capacidades fundamentales del sistema.

Menos intentos y mejores resultados en las pruebas

Los investigadores evaluaron Dream-RSI con Gemini 3.1 Pro y Gemini 3.7 Flash en ocho tareas distribuidas en tres áreas. Para comparar los resultados, utilizaron líneas base con las mismas condiciones iniciales, pero mantuvieron fija la estrategia de búsqueda. El diseño buscaba medir si las mejoras provenían de la organización de la exploración y no de una ventaja en el modelo utilizado para generar las propuestas.

Una de las pruebas pidió escribir el programa más rápido posible para un cálculo estadístico utilizado habitualmente en genómica y finanzas. El programa desarrollado con Dream-RSI se ejecutó más rápido que las bibliotecas establecidas sklearn y glmnet en los seis conjuntos de datos examinados. Con Gemini 3.1 Pro, el tiempo medio de ejecución cayó de 3.587 a 2.931 milisegundos, mientras el número de intentos se redujo de 550 a 317.

La comparación también incluyó a SimpleTES, un sistema competidor que necesitó 51.200 ejecuciones para esa tarea, frente a los 317 intentos reportados para Dream-RSI. Esa diferencia no significa que el nuevo método elimine todos los costos de búsqueda, pero sí muestra el potencial de reutilizar resultados cuando cada generación y evaluación requiere recursos significativos. El beneficio central aparece en la relación entre el cómputo utilizado y la calidad final del programa obtenido.

El patrón se repitió en tareas de optimización matemática y en la creación de kernels de GPU eficientes. En dos tareas de GPU, Dream-RSI igualó el rendimiento de referencia reduciendo las ejecuciones hasta un factor de 2,43, mientras que en otras dos alcanzó hasta 2,09 veces más rendimiento dentro del mismo presupuesto computacional. Las cifras sugieren que una estrategia de búsqueda mejor ajustada puede ser tan importante como incrementar la cantidad bruta de intentos.

El riesgo de orientar demasiado la exploración

El equipo también probó una variante que condensaba los historiales de búsqueda en instrucciones explícitas para indicar al agente dónde debía explorar. En una tarea de GPU, esa versión tuvo un desempeño inferior al de Dream-RSI sin instrucciones condensadas, lo que apunta a una limitación relevante para los sistemas que aprenden de sus experiencias. Una guía demasiado específica puede convertir una experiencia útil en una restricción que cierre prematuramente caminos todavía valiosos.

La observación plantea una tensión entre aprovechar el conocimiento acumulado y mantener la apertura necesaria para descubrir soluciones inesperadas. Un resumen de los intentos previos puede ayudar a evitar errores conocidos, pero también puede sesgar al agente hacia las rutas que ya parecían razonables durante la búsqueda original. Dream-RSI conserva más flexibilidad porque prueba decisiones alternativas dentro del historial, en lugar de convertir toda la experiencia en una lista rígida de órdenes.

El análisis mostró además que la estrategia aprendida no mantiene siempre el mismo nivel de esfuerzo. Al principio, redujo el número de intentos mientras el rendimiento mejoraba, pero volvió a aumentarlo cuando el progreso se estancó. Los investigadores asociaron ese incremento de exploración con nuevas ganancias, una señal de que el sistema puede ajustar el presupuesto de búsqueda según la evolución de los resultados.

La investigación se integra en una tendencia más amplia hacia la auto-mejora recursiva de los agentes. AlphaEvolve, presentado por Google DeepMind en 2025, utiliza Gemini Flash para generar propuestas de código, Gemini Pro para analizarlas y un algoritmo evolutivo para seleccionar las versiones más prometedoras. Dream-RSI opera un nivel por encima de ese proceso al optimizar la forma en que el agente decide explorar.

Un campo que busca agentes cada vez más autónomos

Otros proyectos exploran mecanismos relacionados desde ángulos diferentes. AutoTTS utiliza un agente de programación para buscar algoritmos en un entorno simulado, mientras esos algoritmos determinan cuándo un modelo de lenguaje debe iniciar, ampliar o abandonar rutas de razonamiento. De acuerdo con la información presentada, los métodos resultantes superan a diseños manuales y utilizan menos cómputo en determinadas tareas.

WikiSkill propone reutilizar ejecuciones anteriores registrando éxitos y fallos en una wiki que después se transforma en instrucciones para el agente. Sin embargo, el análisis de Dream-RSI sugiere que las instrucciones explícitas pueden limitar la exploración cuando el problema permanece abierto y existen muchas rutas posibles. La diferencia entre ambas aproximaciones ilustra que recordar una experiencia no equivale necesariamente a saber utilizarla sin reducir la diversidad de búsqueda.

Meta ha llevado la idea un paso más allá con Hyperagents, un enfoque que permite a los agentes reescribir el mecanismo utilizado para controlar su propia mejora. Estas líneas de investigación comparten una ambición: que los sistemas no solo resuelvan tareas, sino que también aprendan a organizar mejor el proceso con el que intentan resolverlas. En ese escenario, la eficiencia del razonamiento podría depender tanto de la estrategia de búsqueda como de las capacidades del modelo base.

El código y los detalles adicionales de Dream-RSI fueron compartidos por los investigadores en GitHub, según la información disponible. Por ahora, los resultados corresponden a las tareas y modelos evaluados por el equipo, por lo que no permiten concluir que el método funcione igual en cualquier problema o reduzca siempre los costos. Su aporte más concreto consiste en demostrar que los historiales de búsqueda pueden convertirse en un espacio de experimentación barato, capaz de mejorar decisiones futuras sin repetir todo el trabajo original.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.

 


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín