Por Canuto  

Google Research presentó Retrieve-for-Train, conocido como R4T, un marco que combina aprendizaje por refuerzo y difusión para generar múltiples rutas de búsqueda en una sola pasada. Las pruebas reportan una aceleración de 12 a 20 veces frente al fan-out autorregresivo, además de mejoras en diversidad y calidad de resultados.
***

  • R4T destila un entrenamiento con aprendizaje por refuerzo en un recuperador de difusión de 53,9 millones de parámetros.
  • El sistema redujo el tiempo de fan-out de 1,46 segundos a 0,07 segundos con lotes de ocho consultas.
  • En Polyvore, el modelo elevó la puntuación promedio de recuperación abstractiva abierta de 40,9 a 49,1.


Google Research presentó Retrieve-for-Train, conocido como R4T, un marco diseñado para mejorar la forma en que los sistemas de búsqueda y recomendación expanden una consulta amplia. En lugar de devolver resultados prácticamente idénticos, la propuesta intenta producir varias rutas de recuperación que cubran elementos complementarios, como una tienda de campaña, un saco de dormir, una estufa y una linterna frontal cuando el usuario busca equipo de campamento.

La propuesta aborda dos problemas frecuentes del fan-out de consultas, una técnica que divide una instrucción general en varias subconsultas. Por un lado, los modelos de lenguaje pueden caer en el colapso parafrástico y generar expresiones casi sinónimas; por otro, la generación autorregresiva y las llamadas repetidas al recuperador elevan la latencia, especialmente cuando se utiliza muestreo Best-of-N para intentar mejorar la calidad.

Una alternativa al fan-out repetitivo

En los sistemas tradicionales, un modelo de lenguaje recibe una instrucción y produce varias subconsultas de manera secuencial. El problema aparece cuando esas salidas cambian pocas palabras, pero continúan apuntando al mismo tipo de resultado, lo que concentra la recuperación en una lista homogénea y deja fuera contenidos potencialmente útiles.

Las pruebas citadas por MarkTechPost utilizaron como ejemplo la consulta estilo bohemio de festival. En modo zero-shot, Qwen3-4B generó expresiones como moda bohemio de festival y ropa bohemio de festival, dos formulaciones cercanas que pueden conducir a resultados casi idénticos en lugar de ampliar realmente el espacio de búsqueda.

El segundo obstáculo es el costo temporal de producir cada subconsulta y ejecutar después varias búsquedas. Best-of-N puede elevar la posibilidad de obtener una expansión útil, pero también multiplica el trabajo de inferencia, una desventaja importante en productos que deben responder a gran escala y con tiempos de espera reducidos.

R4T plantea separar el aprendizaje de la política de fan-out y su ejecución posterior. Primero utiliza aprendizaje por refuerzo fuera de línea para encontrar comportamientos eficaces y luego destila esa conducta en un modelo compacto capaz de generar, en una sola pasada, un conjunto completo de direcciones de recuperación.

Cómo funciona R4T

El proceso comienza con un modelo de lenguaje de fan-out, denominado FOLM, que genera k subconsultas para una instrucción original. Un recuperador denso congelado ejecuta esas subconsultas y una recompensa a nivel de conjunto evalúa el resultado global, de modo que el entrenamiento no premia únicamente la calidad aislada de cada elemento.

Después, el FOLM entrenado toma 128 muestras de fan-outs por consulta con una temperatura de 0,9. Esas muestras se convierten en pares de entrenamiento sin etiquetas humanas, utilizando como objetivos los embeddings del contenido recuperado en tareas abiertas o los embeddings de las subconsultas en tareas composicionales.

La tercera etapa entrena un transformador de difusión con 53,9 millones de parámetros. Este modelo aprende a convertir un embedding de consulta en un conjunto completo de embeddings objetivo mediante una formulación de varianza explosiva dentro del marco EDM, y en inferencia genera todas las representaciones sin depender de un proceso autorregresivo.

Una vez creados los embeddings, una búsqueda de vecinos más cercanos los conecta con elementos concretos de la base de datos. Esta separación permite que el modelo de difusión produzca varias direcciones simultáneamente, mientras el sistema de recuperación se encarga de encontrar los contenidos más próximos a cada una de ellas.

La recompensa intenta frenar el engaño del modelo

Para la recuperación abstractiva abierta, R4T combina tres componentes de recompensa. La fundamentación, con un peso de 0,6, penaliza la distancia entre cada embedding de subconsulta y su elemento más cercano en la base de datos; la diversidad aporta 0,2 mediante el Vendi Score, y la alineación suma otro 0,2 con la similitud coseno promedio frente a la consulta original.

La lógica de esta combinación consiste en exigir que las salidas sean útiles, variadas y todavía relevantes para la intención inicial. Una recompensa que solo mida cercanía podría empujar al sistema a repetir el mismo concepto, mientras que una presión excesiva por mantener la alineación puede convertir todas las subconsultas en paráfrasis de la instrucción original.

La ablación descrita por el equipo ilustra ese riesgo. Cuando únicamente se utilizó la fundamentación, Gemma3-4B convergió hacia cadenas repetitivas como line ending line ending line ending; al agregar alineación, el colapso se aceleró porque la política encontró una vía sencilla para repetir formulaciones cercanas a la consulta.

La diversidad cerró esos atajos al obligar al sistema a separar los resultados recuperados. El entrenamiento empleó GRPO con una regularización suave de PPO, incluidas penalizaciones de divergencia KL hacia adelante y hacia atrás, además de un tamaño de grupo de ocho, una tasa de aprendizaje de 1 × 10⁻⁷ y un lote global de 512.

Resultados en moda y música

Los experimentos se realizaron con el conjunto de datos de moda Polyvore y un codificador Matryoshka basado en CLIP con 128 dimensiones. También se evaluó un conjunto propietario de listas de reproducción musicales elaboradas por expertos, cuyos contenidos utilizaron embeddings MuLan; cada método produjo diez subconsultas y Best-of-N trabajó con cinco muestras.

En la tarea de recuperación abstractiva abierta, un juez basado en un modelo de lenguaje asignó puntuaciones en una escala Likert de cinco puntos. La configuración Gemma3-4B R4T-FOLM obtuvo un promedio de 49,1 en Polyvore, por encima de 40,9 para Best-of-N y de 38,5 para el modo zero-shot.

La diversidad también aumentó de forma marcada en Polyvore, al pasar de 56,0 con zero-shot a 76,8 con R4T-FOLM. La variante R4T-Diffusion retuvo buena parte de esa mejora y alcanzó 74,3, aunque no produce subconsultas de texto que permitan reportar directamente una medida de fundamentación.

En el conjunto de música, Gemma3-4B R4T-FOLM consiguió un promedio de 58,1, frente a 49,2 para Best-of-N. Estos resultados sugieren que la ventaja no depende únicamente de un catálogo visual, aunque las cifras no establecen por sí solas cómo se comportaría el sistema en dominios diferentes de los evaluados.

Cobertura, diversidad y velocidad

Los resultados de recuperación composicional débilmente supervisada en Polyvore mostraron una tensión entre cobertura y diversidad. R4T-FOLM basado en Qwen obtuvo un Recall@5K de 20,9 y un Hit@5K de 64,6, frente a 15,7 y 52,1, respectivamente, para Gemini-2.5-Flash.

La mejora en cobertura tuvo un costo en la variedad de los resultados. El Vendi Score de R4T-FOLM cayó a 27,5, un comportamiento que los autores relacionaron con la reducción de la entropía de salida provocada por una optimización de aprendizaje por refuerzo demasiado intensa.

La variante de difusión presentó un equilibrio distinto. R4T-Diffusion basado en Qwen mantuvo un Vendi Score más alto, de 34,7, aunque registró un Recall@5K de 16,5; la comparación refleja que la arquitectura puede preservar más diversidad incluso cuando no iguala la cobertura de la política de lenguaje optimizada.

La diferencia más contundente apareció en los tiempos de ejecución. Con un lote de ocho, el fan-out autorregresivo tardó aproximadamente 1,46 segundos, mientras que el modelo de difusión necesitó 0,07 segundos; con un lote de 1.024, las mediciones fueron de casi 50 segundos frente a 4,21 segundos, una aceleración reportada de entre 12 y 20 veces.

El trabajo de Google Research muestra una ruta para trasladar el aprendizaje por refuerzo a sistemas de recuperación sin mantener durante la inferencia todo el costo de una política autorregresiva. La combinación todavía exige valorar cuidadosamente el equilibrio entre fundamentación, cobertura y diversidad, pero los resultados indican que generar múltiples direcciones de búsqueda en paralelo puede aliviar uno de los cuellos de botella centrales de la búsqueda asistida por IA.

El enfoque también deja una advertencia para quienes diseñan métricas de calidad. Optimizar únicamente la relevancia o la alineación puede producir resultados repetitivos, mientras que perseguir diversidad sin control puede alejar las salidas de la intención del usuario; R4T intenta resolver esa tensión mediante recompensas combinadas y una etapa de destilación orientada a la eficiencia.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín