Por Canuto  

La arquitectura HySparse2, desarrollada por investigadores de Xiaomi, combina atención dispersa y reutilización de caché para reducir el procesamiento inicial y la memoria de modelos con contextos extensos. En pruebas sobre un modelo de 80.000 millones de parámetros, el sistema mejoró la recuperación de información en tareas de agentes y recortó hasta 5,02 veces los cálculos de prellenado frente a una alternativa de atención híbrida.
***

  • HySparse2 divide el modelo en un decodificador propio y otro cruzado para reutilizar representaciones y acelerar el prellenado.
  • La selección de tokens individuales mejoró las pruebas de recuperación y razonamiento gráfico frente a la selección por bloques.
  • A un millón de tokens, el sistema redujo los cálculos de prellenado hasta 5,02 veces y usó 2,69 GB de caché KV.


Una arquitectura pensada para agentes de IA

Los investigadores Yizhao Gao, Jianyu Wei, Qihao Zhang y sus colaboradores presentaron HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing, una arquitectura de atención para modelos de lenguaje que deben procesar historiales extensos y múltiples turnos de interacción. El trabajo pertenece al equipo LLM-Core de Xiaomi y propone una combinación de atención dispersa, ventanas de contexto reciente y reutilización de la caché de claves y valores, conocida como KV-cache.

El problema que aborda el diseño aparece con claridad en los agentes de IA que consultan herramientas, ejecutan código o recuperan documentos durante una conversación. Aunque la acción generada por el agente puede ser breve, la respuesta de una herramienta suele añadir grandes cantidades de texto que el modelo debe volver a procesar antes de continuar, lo que aumenta tanto el costo computacional como la memoria requerida.

En este escenario, la atención tradicional compara cada consulta con una porción muy amplia del contexto, una operación que se vuelve especialmente pesada cuando la secuencia alcanza cientos de miles de tokens. HySparse2 intenta mantener la capacidad de recuperar información distante, pero evita que cada capa tenga que construir y almacenar una representación completa de todo el historial.

El sistema fue evaluado sobre modelos de mezcla de expertos con 80.000 millones de parámetros totales y 3.000 millones activos. Según los autores, HySparse2 mantuvo capacidades generales comparables a sus referencias y obtuvo sus mayores ventajas en tareas de contexto largo, recuperación de información y trayectorias de agentes con múltiples turnos.

Dos niveles para compartir la caché

La arquitectura divide el modelo en un decodificador propio y un decodificador cruzado, una organización inspirada en el enfoque YOCO. El primero combina capas de atención completa con atención mediante ventana deslizante, mientras que el segundo utiliza capas de atención completa junto con capas de atención dispersa para recuperar información relevante en partes alejadas del contexto.

La primera capa de reutilización, denominada KV Bridging por los autores, conecta las capas de atención completa de ambos decodificadores. Las capas completas del decodificador cruzado construyen sus claves y valores a partir de estados ocultos generados por las capas completas correspondientes del decodificador propio, aunque cada una mantiene sus propias proyecciones para producir representaciones específicas.

Esta conexión permite construir las cachés necesarias para las capas del decodificador cruzado sin ejecutar toda esa parte del modelo durante la fase de prellenado. En otras palabras, el procesamiento inicial puede terminar después del decodificador propio, mientras las proyecciones necesarias para el decodificador cruzado se calculan a partir de los estados ya disponibles.

El segundo nivel conserva la idea central de HySparse, pero introduce dos cambios importantes. En lugar de seleccionar bloques completos de tokens, HySparse2 selecciona tokens individuales y, en vez de mantener una rama separada de atención mediante ventana deslizante dentro de las capas dispersas, obliga a incluir los tokens más recientes en el conjunto seleccionado.

Más precisión con menos memoria

La selección por tokens busca resolver una limitación de los bloques de tamaño fijo, ya que conservar un token relevante también obliga a conservar sus vecinos aunque no aporten información útil. Para agentes que alternan instrucciones, llamadas a herramientas, resultados y respuestas, los datos importantes pueden encontrarse en posiciones aisladas, por lo que una selección individual aprovecha mejor el presupuesto de atención.

En una prueba de ablación con el mismo presupuesto, la selección por tokens elevó la puntuación de RULER-v2 en 6,57 puntos frente a la selección por bloques. También mejoró MRCR-v2 para consultas con dos elementos clave en 8,14 puntos y GraphWalks en 5,55 puntos, mientras las ganancias aparecieron incluso dentro de la ventana de entrenamiento de 32.000 tokens.

El diseño de la ventana local también tuvo un papel relevante. HySparse2 fuerza la inclusión de los 128 tokens más recientes y añade hasta 1.024 tokens globales elegidos por sus puntuaciones, con lo que combina información inmediata y evidencia distante dentro de una misma caché compartida.

Los autores compararon esta estrategia con una rama separada de atención local y con una variante sin mecanismo local. La eliminación total de la información reciente deterioró en general el desempeño, mientras que la ventana forzada siguió siendo competitiva y obtuvo las mejores puntuaciones en RULER, RULER-v2 y GraphWalks dentro de esa comparación.

Resultados en recuperación y eficiencia

Después de una etapa adicional de entrenamiento de aproximadamente 100.000 millones de tokens, HySparse2 superó a HySparse y a Hybrid SWA en las cuatro métricas de contexto largo evaluadas. Frente a HySparse, elevó los promedios de MRCR-v2 y RULER-v2 en 11,30 y 19,81 puntos porcentuales, respectivamente, mientras que sus ventajas frente a Hybrid SWA fueron de 6,44 y 18,65 puntos.

La diferencia aumentó en los contextos más extensos. A 256.000 tokens, HySparse2 alcanzó 58,45 puntos en RULER-v2, frente a 32,61 de HySparse y 35,74 de Hybrid SWA, de acuerdo con los resultados reportados en el trabajo; además, registró menor perplejidad en AgentPPL y LongPPL a todas las longitudes examinadas.

En la evaluación previa al entrenamiento adicional, el modelo también obtuvo el mejor desempeño de los tres en RULER y NoLiMa, con 90,77 y 49,76 puntos. La arquitectura no dominó todas las pruebas generales, pero los resultados en BBH y MMLU-Pro fueron superiores a los de las referencias, mientras que HySparse conservó ventajas en tareas como DROP.

La reducción de costos fue otro de los objetivos centrales. A un millón de tokens, HySparse2 necesitó 2,92 veces menos operaciones de prellenado que HySparse y 5,02 veces menos que Hybrid SWA, mientras su caché KV ocupó 2,69 GB, frente a 6,72 GB y 12,09 GB, respectivamente.

Implicaciones para el despliegue de modelos

La arquitectura también puede modificar la distribución de recursos entre los servidores que reciben una solicitud y los que generan la respuesta. En un escenario de separación entre prellenado y decodificación, el nodo encargado del prellenado puede alojar únicamente el decodificador propio y las proyecciones de KV Bridging, lo que reduce de forma considerable la cantidad de parámetros que debe mantener.

Para el modelo de 49 capas utilizado como ejemplo, el nodo de prellenado necesita desplegar solo las primeras 25 capas, según la descripción de los autores. La reducción resulta especialmente significativa cuando la proporción entre capas de ventana deslizante y capas de atención completa es alta, porque durante el prellenado el decodificador propio ejecuta atención completa en apenas una capa.

El enfoque también podría combinarse con técnicas de decodificación especulativa. Durante el entrenamiento, HySparse2 utiliza una capa MTP condicionada por los estados ocultos ubicados en la frontera entre ambos decodificadores, mientras que los autores plantean reemplazarla durante el ajuste posterior por un generador más grande basado en DFlash, aunque esa coordinación todavía queda como trabajo futuro.

El estudio de escalabilidad incluyó modelos de 290.000 millones de parámetros totales y 8.000 millones activos. En esa comparación, las versiones con y sin KV Bridging mostraron una calidad generalmente similar, con cambios pequeños en MMLU, TriviaQA, RULER y Repo Code PPL, aunque algunas pruebas como DROP, BBH y GSM8K favorecieron a la variante sin conexión.

Qué significa para la evolución de la IA

El resultado sugiere que el desafío de los contextos largos no depende únicamente de ampliar la ventana máxima de un modelo. También exige decidir qué partes del historial merecen atención, cómo trasladar esa información entre capas y cuánto de ella debe conservarse en memoria durante una conversación que puede incluir documentos, resultados de búsqueda y trazas de ejecución.

La atención completa sigue cumpliendo una función importante en HySparse2, porque algunas capas actúan como indexadores capaces de calcular puntuaciones exactas y orientar la selección posterior. El modelo no elimina por completo ese mecanismo costoso, sino que lo concentra en pocas capas para utilizarlo como guía de las operaciones dispersas.

Los propios autores reconocen que la arquitectura todavía deja espacio para nuevas optimizaciones, como reducir el cómputo de las capas completas, utilizar indexadores más ligeros durante el ajuste posterior o adaptar el número de cabezas de consulta entre las capas completas y dispersas. También señalan que la generación especulativa y la ejecución asíncrona requieren entrenamiento y coordinación adicionales antes de convertirse en una solución práctica.

Por ahora, HySparse2 representa una propuesta experimental para hacer más manejables los agentes de IA que trabajan con historiales muy extensos. Sus resultados apuntan a una combinación prometedora entre precisión de recuperación, menor caché y prellenado más corto, aunque su adopción dependerá de la disponibilidad de implementaciones eficientes y de evaluaciones independientes en cargas de trabajo reales.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín