Por Canuto  

Cursor ha liberado el código de Mixture-of-Kittens, un megakernel determinista que acelera hasta 2.37x el entrenamiento de modelos de mezcla de expertos en racks NVL72. Pero su adopción exige hardware Blackwell de alto costo, limitando su alcance.
***

  • Cursor publicó el código de MoK bajo Apache-2.0, un megakernel que fusiona comunicación y cómputo en un solo kernel determinista
  • Logra hasta 2.37x más rendimiento que la línea base más rápida y 1.41x en pruebas end-to-end con 512 GPUs
  • Requiere GPUs NVIDIA Blackwell SM100/SM103, CUDA 13.0+ y PyTorch 2.10+, limitando su adopción a organizaciones con infraestructura NVL72


Cursor Research ha liberado el código de Mixture-of-Kittens (MoK), el megac kernel de entrenamiento de mezcla de expertos que impulsa sus modelos Composer. Según informa MarkTechPost, el equipo de Cursor reporta hasta 2.37 veces más rendimiento que la línea base pública más fuerte.

MoK fusiona cada paso de comunicación y computación de MoE en un solo kernel determinista. Ya alimenta el entrenamiento de Composer a través de decenas de miles de GPUs.

¿Qué es Mixture-of-Kittens y por qué importa?

MoK es un megac kernel que unifica todas las operaciones de una capa de mezcla de expertos (MoE) en un solo kernel. A diferencia de los enfoques tradicionales que separan comunicación y cómputo, MoK los entrelaza para minimizar la latencia y maximizar el uso del ancho de banda NVLink.

El determinismo es una propiedad clave: la ejecución es reproducible sin importar el número de GPUs o el orden de las operaciones. Esto es crucial para técnicas de post-entrenamiento como el aprendizaje por refuerzo, donde la reproducibilidad de los experimentos es esencial.

El equipo de Cursor diseñó MoK específicamente para racks NVL72 de NVIDIA, que integran 72 GPUs en un solo dominio NVLink. Esto permite una superposición precisa entre comunicación y computación, algo imposible en configuraciones de menor escala.

La liberación del código bajo Apache-2.0 significa que cualquier organización con el hardware adecuado puede adoptarlo para entrenar y ajustar modelos MoE similares a DeepSeek-V3. También abre la puerta a mejoras colaborativas en el kernel, aunque el requisito de GPUs Blackwell limita su alcance a los grandes laboratorios.

Requisitos y contexto de despliegue

MoK está disponible en GitHub bajo licencia Apache-2.0, pero su umbral de hardware es alto. Requiere GPUs NVIDIA Blackwell SM100 o SM103, lo que significa estanterías GB200 NVL72 o GB300 NVL72.

Además, necesita Python 3.12+, PyTorch 2.10+ y el toolkit CUDA 13.0+. Los búferes entre GPUs dependen de la memoria simétrica de PyTorch, lo que limita a organizaciones que poseen o alquilan capacidad NVL72.

Laboratorios de frontera, startups de modelos financiados, neoclouds de GPU y centros nacionales de computación son los candidatos naturales. Equipos de nodo único y tiendas de 8 GPUs no podrán aprovecharlo.

Las aplicaciones son limitadas pero de alto valor: preentrenamiento y post-entrenamiento de modelos MoE estilo DeepSeek-V3. El determinismo también lo hace útil para el post-entrenamiento de refuerzo en política y ablaciones internas.

Las industrias relevantes incluyen el desarrollo de modelos de IA, la infraestructura de GPU en la nube, herramientas de generación de código y la investigación cuantitativa.

El cuello de botella de MoE

El trabajo anterior de Cursor cubrió el lado computacional con kernels de entrenamiento MXFP8 y NVFP4. Sin embargo, en producción, la comunicación entre GPUs se convirtió en el factor limitante.

La capa de MoE puede consumir más de la mitad del tiempo de entrenamiento de extremo a extremo. Al cambiar a GB300 NVL72, el problema cambió: un rack tiene 72 GPUs dentro de un solo dominio NVLink, lo que permite una superposición precisa.

Pero las CPUs Grace integradas son lentas en comparación con las GPUs, por lo que la sincronización CPU-GPU debe minimizarse agresivamente. Cualquier intervención de la CPU en el bucle de entrenamiento sería un cuello de botella crítico.

MoK aborda esto eliminando por completo la CPU del camino de datos. Los búferes se gestionan con un búfer en anillo fijo, y la programación se realiza a través del Control de Lanzamiento del Clúster de Blackwell.

Esto permite que el RDMA interrack no se serialice detrás de la CPU, evitando interrupciones en el flujo de datos.

Tres decisiones de diseño que marcan la diferencia

La primera decisión es la dirección de comunicación: elegida por operación. Los enfoques existentes como DeepEP se basan en transferencias impulsadas (push). Los microbenchmarks del equipo de Cursor muestran que el movimiento por empuje traslada menos bytes totales en una dirección, dejando el carril NVLink inverso mayormente inactivo.

La distribución basada en tirón (pull) entrega hasta un 29% más de utilización del ancho de banda NVLink bajo desequilibrio de expertos. Además, elimina las señales de finalización entre GPUs: la señalización del despacho por empuje se midió en 103 µs frente a 18 µs para el tirón, aproximadamente 5.8 veces más rápida.

Por eso, MoK utiliza un despacho por tirón hacia adelante y una combinación por empuje hacia adelante. El paso inverso imita esto con una combinación inversa por tirón y un despacho inverso por empuje. Una tabla de programación sirve para los cuatro, costando menos del 3% del tiempo de ejecución de MoE.

La segunda decisión es la granularidad de superposición. Comet es de grano fino; DeepEP es de grano grueso. El equipo de Cursor argumenta que el óptimo está en el medio y depende de la carga de trabajo. La heurística tiene como objetivo al menos dos ondas SM completas por GEMM agrupadas por expertos.

Para las formas Kimi 2.5, el modelo base para Composer 2.5, el umbral es de 2,368 tokens. La latencia medida coincide estrechamente con esa estimación, validando la heurística.

La tercera decisión es un búfer de tokens en anillo. Las alternativas son eliminar tokens o pedir a la CPU que ajuste los búferes. MoK cicla un búfer en anillo fijo de unos pocos cientos de megabytes, a granularidad de minibatch, entrelazando despacho y combinación en los límites de macrobatch.

El anillo se recorre en reversa para minimizar la repetición de activación hacia adelante durante la retroalimentación. Esto elimina la sincronización CPU-GPU y asegura que no se descarte ningún token.

MoK está construido como un megakernel y es completamente determinista. Soporta modos de precisión BF16 y MXFP8, con la programación ejecutándose a través del Control de Lanzamiento del Clúster de Blackwell, evitando la serialización del RDMA interrack.

Los gradientes de pesos de enrutador usan un cálculo al estilo SonicMoE fusionado en la retroalimentación de SwiGLU, lo que reduce aún más las operaciones.

Resultados y comparativas

Las pruebas de capa se ejecutaron en un solo rack NVL72 a un grado EP de 64. Cada GPU sostuvo 2,048 tokens antes de la ruta. Las líneas base fueron NCCL+PyTorch, DeepEP+PyTorch, DeepEP+TransformerEngine y HybridEP+Megatron.

Las formas cubrieron Kimi K2.7 Code, GLM-5.2, Qwen3.5-397B-A17B y DeepSeek-V4-Pro. Contra la línea base más rápida, MoK es hasta 2.37x más rápido para el avance MXFP8.

Las otras cifras son 1.78x para la retroalimentación MXFP8, 1.92x para el avance BF16 y 1.58x para la retroalimentación BF16. Estos números demuestran una ventaja consistente en todos los modos de precisión.

Las pruebas de extremo a extremo utilizaron 512 GPUs en varias estanterías GB300 NVL72. Los tokens por segundo por GPU aumentaron de 760.9 a 1,070.2, lo que supone una ganancia de 1.41x.

En el contexto del entrenamiento de modelos masivos, esa mejora del 41% puede traducirse en semanas de ahorro computacional, reduciendo costos y tiempos de desarrollo.

Conclusiones clave

MoK fusiona toda la comunicación y computación de MoE en un único megakernel determinista para estanterías NVL72. La distribución por tirón más la combinación por empuje reduce la señalización de 103 µs a 18 µs.

El búfer de tokens en anillo elimina los tokens descartados y elimina completamente la sincronización CPU-GPU. Esto es un avance significativo frente a técnicas anteriores que dependían de la CPU o eliminaban datos.

El rendimiento es impresionante: hasta 2.37x sobre la línea base pública más rápida y 1.41x de extremo a extremo en 512 GPUs. Sin embargo, la exigencia de hardware Blackwell SM100/SM103 y el software específico limitan su adopción a un nicho de alto rendimiento.

Para laboratorios con la infraestructura adecuada, MoK representa una ventaja competitiva tangible en el entrenamiento de modelos de próxima generación. Para el resto, es un vistazo a las técnicas que definirán la eficiencia de la IA en el futuro cercano.

La publicación bajo Apache-2.0 podría acelerar la innovación en kernels deterministas, incluso si solo unos pocos pueden ejecutarlos hoy. La comunidad de IA debería seguir de cerca los desarrollos en esta área.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín