Por Canuto  

DeepSeek presentó V4.1-Flash, un modelo multimodal de código abierto que combina una ventana de contexto de 1 millón de tokens con caché KV en FP4 y reutilización de atención entre capas. La compañía afirma que su arquitectura reduce drásticamente la memoria necesaria para agentes de largo horizonte y mejora el desempeño en varias pruebas de programación y automatización.
***

  • DeepSeek-V4.1-Flash ofrece una ventana de contexto de 1 millón de tokens y una huella de caché KV de 890 bytes por token.
  • El modelo emplea un codificador-decodificador causal, atención dispersa CSA2, cuantización FP4 y reutilización de estados entre capas.
  • La compañía afirma que supera a DeepSeek-V4-Flash en pruebas de agentes y queda por encima de Opus-5 y GPT-5.6 Sol en algunos indicadores.


DeepSeek presentó DeepSeek-V4.1-Flash, un modelo multimodal de tipo Mixture-of-Experts diseñado para reducir el costo de atender agentes de inteligencia artificial con tareas prolongadas. La propuesta combina una ventana de contexto de 1 millón de tokens, caché de claves y valores cuantizada en FP4 y reutilización de atención entre capas para aliviar la presión sobre la memoria HBM y las unidades SSD.

Según la información publicada por MarkTechPost, el sistema cuenta con 552.000 millones de parámetros en su backbone y otros 196.000 millones asociados con Engram, un módulo de memoria condicional. DeepSeek-V4.1-Flash activa 8.000 millones de parámetros por token durante el prellenado y 16.000 millones durante la generación, mientras que su huella global de caché KV llega a 890 bytes por token.

Una arquitectura enfocada en el costo de la memoria

El problema que aborda el modelo aparece cuando los agentes repiten prellenados y trabajan con historiales muy extensos, una dinámica que incrementa el consumo de memoria y ancho de banda. En contextos de 1 millón de tokens, cada nueva interacción puede exigir que el sistema conserve grandes cantidades de estados intermedios, por lo que la capacidad de almacenamiento termina siendo tan importante como la potencia de cálculo.

La huella anunciada de 890 bytes por token equivale aproximadamente a una cuarta parte de la registrada por DeepSeek-V4-Flash y es unas 437 veces menor que la de DeepSeek-V1, de acuerdo con los datos divulgados. La comparación no significa que todos los costos de operación desaparezcan, pero sí muestra que el equipo priorizó una reducción profunda del estado que debe mantenerse disponible durante el servicio.

El modelo utiliza pesos abiertos bajo una licencia MIT y cuenta con rutas de despliegue para vLLM, SGLang y Transformers en Hugging Face. Además, el equipo de investigación describe una API pública con niveles de razonamiento denominados low, high y max, una estructura que permite ajustar el esfuerzo computacional según la tarea.

La arquitectura mantiene 40 capas, divididas entre un codificador causal de 20 capas y un decodificador de otras 20. Durante el prellenado, los tokens del prompt se procesan en el codificador, mientras que el decodificador deriva sus proyecciones globales desde el estado oculto final, una decisión inspirada en el enfoque YOCO y orientada a reducir casi a la mitad ese trabajo inicial.

Atención dispersa y reutilización entre capas

DeepSeek-V4.1-Flash emplea Compressed Sparse Attention 2, o CSA2, para atacar el tamaño de la caché a lo largo del eje de capas. Cada capa se asigna a uno de tres modos: Full calcula su propia caché principal y selecciona nuevos índices Top-512; Reindex reutiliza estados previos, pero vuelve a evaluarlos con su consulta; y Reuse comparte tanto la caché como los índices existentes.

La organización cambia entre el codificador y el decodificador para equilibrar precisión y eficiencia. Las 18 capas CSA2 del codificador siguen una relación de dos por cada tres grupos de seis, con una capa Full y cinco Reuse, mientras que las 20 capas del decodificador usan grupos de cuatro, en los que aparecen una capa Full o Reindex junto con tres capas Reuse.

El decodificador incorpora además un Hierarchical Sparse Indexer que permite a una capa Full construir un conjunto de candidatos de hasta 16.384 posiciones, organizado en 2.048 bloques de ocho. Las capas Reindex posteriores puntúan ese conjunto acotado en lugar de revisar el contexto completo, lo que reduce el trabajo requerido cuando la secuencia alcanza longitudes extremas.

La atención de ventana deslizante mantiene una ventana de 128 tokens en cada capa, pero el modelo evita reconstruir todo el historial cuando necesita recuperar esos estados. El mecanismo denominado Decoder SWA Bounded Replay reproduce solamente los últimos 128 tokens del prompt, de modo que un fallo de caché no obliga a repetir el procesamiento completo de cada ventana.

FP4, almacenamiento temporal y optimizaciones

La caché KV principal se cuantiza con el formato E2M1, acompañado por una escala E4M3 cada 16 canales, siguiendo el enfoque NVFP4 pero sin su escala global. DeepSeek introdujo esta capacidad mediante entrenamiento consciente de la cuantización durante el postentrenamiento, y sostiene que el resultado reduce casi a la mitad el almacenamiento frente a la caché FP8 de V4.

El diseño también modifica la forma de conservar los estados de atención de ventana deslizante durante el despliegue. En lugar de persistirlos en SSD, el sistema los mantiene en un grupo distribuido que utiliza el 10% de la DRAM del host y les asigna un tiempo de vida de minutos, mientras que la caché global conserva una vida útil garantizada de 72 horas.

Cuando se produce un fallo de caché, el mecanismo de reproducción acotada vuelve a calcular únicamente 128 tokens, no todas las capas de una ventana completa. La decisión busca limitar el impacto de los errores de recuperación y, al mismo tiempo, evitar que la reducción de almacenamiento termine trasladando el problema hacia un procesamiento excesivo.

Entre las optimizaciones adicionales figuran Single-Pass mHC, que desplaza un bloque los coeficientes de mezcla de entrada para que un kernel Mega-mHC fusione operaciones y reduzca a la mitad el tráfico de memoria de activaciones. El sistema también incorpora Engram en las capas 1 y 14, el decodificado especulativo DSpark entrenado después del preentrenamiento con el backbone congelado y el optimizador Muon por cabezas.

Entrenamiento, resultados y límites de la comparación

El preentrenamiento utilizó 45 billones de tokens multimodales, con una proporción de siete a uno entre texto y datos multimodales. La atención dispersa se entrenó desde el inicio con secuencias de 64.000 tokens, sin una fase inicial de atención densa, y el contexto se extendió hasta 1 millón de tokens después de alcanzar 34 billones de tokens procesados.

El equipo afirma que el modelo base iguala a DeepSeek-V4-Pro-Base en conocimiento general y programación, aunque utiliza un tercio de los parámetros totales y una cuarta parte de los parámetros activados. El postentrenamiento se apoyó en síntesis a gran escala de tareas verificables para agentes, aprendizaje por refuerzo con distintos entornos y destilación en línea a partir de más de 40 modelos profesores.

En Terminal-Bench 2.1, DeepSeek-V4.1-Flash obtuvo 90,6 puntos, frente a 82,7 de DeepSeek-V4-Flash, 89,1 de Opus-5 y 88,8 de GPT-5.6 Sol. En DeepSWE v1.1 alcanzó 74,2 puntos, por encima de los 54,4 de su antecesor, aunque quedó prácticamente empatado con Opus-5, que registró 74,0.

El modelo también consiguió 31,2 puntos en Terminal-Bench 4.0, frente a 7,0 de DeepSeek-V4-Flash, pero por debajo de Opus-5 y GPT-5.6 Sol, con 51,8 y 39,9, respectivamente. En Automation-Bench marcó 54,8 puntos, mientras que sus rivales anotaron 37,7, 50,3 y 45,8; las cifras muestran avances importantes, aunque no una ventaja uniforme en todas las pruebas.

En conocimiento científico, GPQA Diamond, la puntuación de DeepSeek-V4.1-Flash fue de 90,9, por debajo de Opus-5, con 93,4, y GPT-5.6 Sol, con 94,1, pero por encima de DeepSeek-V4-Flash, con 89,9. En Codeforces, el modelo alcanzó una calificación de 3.471, frente a 3.289 de la versión anterior, aunque la tabla no ofrece datos comparables para los otros sistemas.

Una apuesta por agentes más largos y despliegues abiertos

La principal lectura del lanzamiento es que DeepSeek intenta convertir la eficiencia de memoria en una ventaja de infraestructura, no únicamente en una mejora de los resultados académicos. Para los operadores de agentes, conservar contextos extensos durante horas o días puede elevar los costos de forma considerable, por lo que una caché más pequeña podría facilitar servicios con historiales persistentes.

El diseño causal de codificador y decodificador, la reutilización CSA2 y la cuantización FP4 atacan distintos puntos de la misma cadena operativa. El primero reduce el prellenado, la segunda limita el número de estados que deben calcularse y la tercera disminuye el espacio requerido para conservarlos, aunque el desempeño final dependerá del hardware, los kernels y la configuración elegida por cada despliegue.

La licencia MIT y las rutas anunciadas para herramientas populares pueden favorecer la evaluación independiente y la adaptación del modelo por parte de desarrolladores. Sin embargo, la existencia de pesos abiertos no elimina los requerimientos de cómputo asociados con un backbone de cientos de miles de millones de parámetros, especialmente cuando se pretende atender múltiples solicitudes de contexto extremo.

DeepSeek-V4.1-Flash representa, en ese sentido, una apuesta por hacer más manejable el servicio de modelos grandes sin renunciar a una ventana de contexto de 1 millón de tokens. Sus resultados sugieren avances en programación y automatización, pero las diferencias entre benchmarks también indican que la eficiencia de memoria y la superioridad general siguen siendo preguntas distintas.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín