Por Canuto  

Meta presentó MetaRoCE, un protocolo RDMA creado desde cero para cargas de inteligencia artificial sobre Ethernet comercial. La propuesta traslada a las tarjetas de red funciones como la distribución multipath, el ordenamiento y la recuperación ante pérdidas, mientras su implementación de hardware aún se encuentra en una etapa de validación.
***

  • MetaRoCE está diseñado para tolerar pérdidas y permite que los paquetes lleguen fuera de orden para ser reensamblados en el extremo.
  • El diseño incorpora multipath nativo, telemetría por ruta y control de congestión con mecanismos dirigidos por emisor y receptor.
  • Meta indicó que en octubre publicará la especificación, una implementación de referencia optimizada para DPDK y materiales de cumplimiento.


Meta presentó MetaRoCE, un protocolo de transporte RDMA diseñado desde cero para cargas de inteligencia artificial sobre Ethernet comercial. La compañía plantea que, a medida que los clústeres reúnen más aceleradores, las operaciones de red pueden convertirse en un factor determinante del rendimiento. Su propuesta traslada más funciones a la tarjeta de interfaz de red (NIC) y permite distribuir los paquetes por varias rutas, incluso cuando algunos llegan fuera de orden.

En los sistemas de IA, operaciones colectivas como all-reduce y all-to-all sincronizan grandes grupos de aceleradores. Una ruta lenta o congestionada puede retrasar el trabajo completo y dejar capacidad de cómputo sin utilizar. Según la publicación de Meta, la compañía prepara la especificación de MetaRoCE, una implementación de referencia de software optimizada para DPDK y materiales de cumplimiento para producción.

El problema que Meta intenta resolver

RoCE, acrónimo de RDMA sobre Ethernet convergente, permite transferir datos directamente entre memorias de servidores y reduce la intervención de los procesadores. Sin embargo, las implementaciones tradicionales suelen depender de redes sin pérdidas y de mecanismos como la Prioridad de Control de Flujo (PFC), además de esperar que los paquetes se entreguen en orden. Estas condiciones pueden dificultar la utilización de múltiples rutas en redes de gran escala.

MetaRoCE parte de una premisa distinta: la red puede tolerar pérdidas y el extremo final debe asumir responsabilidades adicionales. Los paquetes pueden viajar por caminos diferentes, llegar fuera de orden y escribirse directamente en la posición de memoria correspondiente. Esto busca reducir el bloqueo de línea superior y la necesidad de mantener grandes búferes de reordenamiento.

El protocolo utiliza un búfer de recepción configurado previamente para que cada transferencia aterrice en su ubicación correcta aunque otros datos estén retrasados. De esta forma, separa el orden lógico que necesita la aplicación de la secuencia física en que los paquetes atraviesan los switches.

Meta afirma que ha escalado clústeres de cientos de miles de GPU distribuidas entre varios centros de datos y regiones. En ese contexto, la red forma parte del camino crítico de las operaciones colectivas. MetaRoCE busca que la NIC interprete mejor el tráfico y gestione parte de las decisiones que normalmente recaen en el tejido Ethernet.

Seis cambios en la arquitectura

La primera decisión es admitir la entrega fuera de orden como comportamiento normal. Cada paquete incluye información para identificar su destino y puede escribirse en la ubicación correcta cuando llega, aunque otros paquetes del mismo flujo todavía estén en tránsito.

El multipath es otro componente central. MetaRoCE asigna un puerto UDP de origen distinto a cada ruta para aportar entropía a ECMP. Así, la NIC puede distribuir el tráfico entre varios caminos y apartarlo de una ruta problemática. Cada camino mantiene además información propia sobre su ventana de congestión y su tiempo de ida y vuelta.

El diseño también incorpora recuperación explícita ante pérdidas. MetaRoCE utiliza un bitvector de acuse de recibo selectivo de 256 bits por ruta; una brecha puede indicar que un paquete se perdió y requiere retransmisión. El objetivo es repetir únicamente el paquete afectado, en vez de reenviar una cantidad mayor de datos.

El control de congestión combina un mecanismo basado en ECN y dirigido por el emisor con indicaciones de velocidad justa enviadas por el receptor. Estas señales permiten ajustar la tasa de transmisión y responder tanto a la congestión sostenida como a las ráfagas.

MetaRoCE exige a los switches funciones habituales en equipos modernos, como ECN y ECMP, pero no requiere recorte de paquetes, telemetría de red, control de flujo basado en créditos ni que el switch distribuya directamente el tráfico. Esto podría facilitar su funcionamiento en tejidos donde Meta no controla toda la infraestructura.

Por último, el protocolo separa el estado de la conexión del número de rutas paralelas. Una conexión puede transportar numerosos flujos ordenados e independientes, mientras una capa inferior administra varias rutas bajo un punto común de control de congestión.

Resultados iniciales y disponibilidad

Meta trabajó con AMD para implementar MetaRoCE en tarjetas de red programables AMD Pensando y lo probó en un clúster de GPU AMD de 64 nodos. La evaluación utilizó colectivos RCCL y comparó directamente MetaRoCE con RoCEv2 en operaciones all-reduce y all-to-all.

La publicación de Meta afirma que el nuevo diseño ofreció mayor rendimiento y menores tiempos de finalización en las pruebas realizadas. También señala que MetaRoCE mantuvo aproximadamente 86% de la TFT bajo las condiciones evaluadas. La información disponible no detalla en el borrador las cifras completas de cada prueba, por lo que el resultado debe interpretarse como una evaluación inicial y no como una garantía general de rendimiento.

La compañía indicó que en octubre publicará la especificación de MetaRoCE, una implementación de referencia de software optimizada para DPDK y materiales de cumplimiento para producción. Hasta entonces, se trata de una propuesta técnica en proceso de apertura y validación, no de una sustitución inmediata de RoCEv2.

La demostración sobre NIC programables de AMD Pensando confirma una implementación experimental, pero no establece por sí sola la disponibilidad comercial del protocolo en múltiples fabricantes. La adopción dependerá de la interoperabilidad entre NIC, software, switches y herramientas de administración.

Causas de movimientos recientes

MetaRoCE no es un movimiento de mercado financiero, sino el anuncio de una arquitectura de red para cargas de IA. (a) Confirmado: Meta presentó el protocolo y describió una implementación con AMD Pensando en un clúster AMD de 64 nodos. (b) Contexto técnico plausible: la presión por conectar clústeres de cientos de miles de GPU y ejecutar operaciones colectivas a gran escala explica la necesidad de explorar transportes tolerantes a pérdidas, aunque la publicación no atribuye el desarrollo a un único incidente o catalizador puntual.

Qué puede cambiar para la infraestructura de IA

La propuesta refleja la tensión entre las redes diseñadas para tráfico empresarial general y las exigencias de los clústeres de IA. Miles de aceleradores pueden iniciar transferencias coordinadas, y una diferencia pequeña de latencia o rendimiento puede prolongar toda la sincronización. Al permitir recuperación selectiva y distribución multipath, MetaRoCE intenta aprovechar mejor una infraestructura Ethernet comercial.

Trasladar funciones a la NIC ofrece una ventaja potencial, pero concentra más complejidad en el extremo final. La tarjeta debe medir RTT, interpretar ECN, administrar ventanas de congestión, seleccionar rutas y procesar confirmaciones selectivas sin introducir nuevos cuellos de botella. El resultado dependerá de la eficiencia de las NIC programables y de la consistencia entre implementaciones.

La ausencia de PFC y de mecanismos basados en créditos podría simplificar la operación de tejidos heterogéneos, aunque no elimina los desafíos de configuración y supervisión. ECMP y ECN deben funcionar de forma predecible, mientras la telemetría por ruta debe ofrecer señales oportunas sin sobrecargar el protocolo.

La publicación de una especificación y de una implementación de referencia puede facilitar la revisión externa y la interoperabilidad. No obstante, la apertura no garantiza que los operadores abandonen RoCEv2, especialmente porque ya poseen inversiones en NIC, switches y herramientas de administración. Las pruebas independientes serán necesarias para determinar si el rendimiento observado en 64 nodos se mantiene en sistemas mayores y con hardware de distintos proveedores.

Por ahora, MetaRoCE debe entenderse como una propuesta técnica con resultados iniciales. La especificación, el software de referencia y los materiales de cumplimiento que Meta prevé publicar en octubre serán determinantes para evaluar su madurez. La iniciativa pone de relieve que, para escalar la IA, optimizar la red puede ser tan importante como añadir más aceleradores.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín