Meta presentó el MTIA 400, su acelerador de inteligencia artificial generativa orientado al entrenamiento de modelos de lenguaje, aunque también lo utilizará para sistemas de recomendación publicitaria. El chip alcanza 12 petaFLOPS en MXFP4 y supera a los aceleradores Blackwell mejor especificados en ciertas precisiones, pero todavía queda por detrás de las nuevas generaciones de Nvidia y AMD.
***
- El MTIA 400 combina dos chiplets de cómputo, dos de entrada y salida y un die SoC en un diseño multinúcleo heterogéneo.
- El acelerador ofrece 12 petaFLOPS de cómputo MXFP4, 288 GB de HBM3e y 9,2 TB/s de ancho de banda de memoria.
- Meta planea lanzar el MTIA 450 y el MTIA 500 en 2027, con más ancho de banda y capacidad de cómputo.
Meta presentó el MTIA 400, un acelerador diseñado para entrenar modelos de lenguaje de gran escala y, al mismo tiempo, ejecutar los sistemas de recomendación que sostienen su negocio publicitario. El lanzamiento marca un giro frente a los primeros chips personalizados de la compañía, que se concentraban principalmente en servir anuncios, aunque el nuevo componente todavía no apunta a desplazar de inmediato a las GPU de Nvidia o AMD.
La compañía detalló las características del procesador durante la conferencia Hot Chips, celebrada esta semana, después de haberlo anticipado a comienzos de año. De acuerdo con la información publicada por The Register, Meta enfrenta una presión creciente para controlar el gasto en cómputo, por lo que busca que su silicio interno cubra más de una carga de trabajo, incluso cuando las necesidades técnicas de ambas tareas son muy distintas.
Un chip con dos misiones
El entrenamiento de modelos de lenguaje exige cantidades enormes de cómputo y puede requerir decenas o cientos de miles de aceleradores para completarse en un plazo razonable. En ese entorno, el rendimiento matemático del hardware resulta decisivo, porque cada operación adicional por segundo puede reducir el tiempo y el costo de construir un modelo avanzado.
La inferencia de los modelos de recomendación profunda utilizados para mostrar anuncios funciona de otra manera, ya que depende principalmente del acceso a memoria y no de la capacidad máxima de cálculo. Como consecuencia, buena parte de los FLOPS que hacen atractivo al MTIA 400 para entrenamiento permanecerían inactivos durante esas consultas publicitarias, aunque ese segundo uso puede ser especialmente rentable para Meta.
El acelerador también realizará algunas tareas de inferencia, pero no se trata principalmente de responder a chatbots generativos. Meta lo asignará a sus sistemas de recomendación publicitaria, una aplicación que conecta directamente el diseño del chip con los ingresos de la empresa y permite aprovechar el hardware durante distintos momentos de su operación.
Esta combinación refleja una decisión pragmática: un componente especializado puede ser menos flexible que una GPU generalista, pero ofrece a Meta la posibilidad de adaptar el costo y la disponibilidad del cómputo a sus propias cargas. La estrategia recuerda a la de Amazon y Google, cuyos primeros aceleradores también nacieron para tareas internas, aunque el MTIA 400 incorpora de forma explícita el entrenamiento de modelos de lenguaje.
Arquitectura y rendimiento
El MTIA 400 utiliza una arquitectura multinúcleo heterogénea basada en varios dies, una fórmula semejante a la que emplean los aceleradores más recientes de Nvidia y AMD. El paquete incluye dos matrices de cómputo, dos matrices de entrada y salida y un die SoC encargado de administrar la conexión con el host y coordinar las cargas de trabajo.
Los chiplets de cómputo se fabrican con un proceso de 3 nanómetros, presumiblemente de TSMC, y cada uno integra una cuadrícula de 6 por 8 elementos de procesamiento. En conjunto, ambos chiplets alcanzan 12 petaFLOPS de cómputo MXFP4 cuando operan a 1,7 GHz, una cifra que sitúa a Meta como un participante más visible en el desarrollo de silicio para IA.
Según la comparación presentada, el MTIA 400 es cerca de 20% más rápido que los aceleradores Blackwell mejor especificados de Nvidia en las precisiones superiores más utilizadas para entrenar modelos, mientras consume aproximadamente la misma potencia. Sin embargo, el panorama cambia frente a las generaciones más recientes: el componente de Meta resulta entre tres y 3,3 veces más lento que Rubin de Nvidia y el Instinct MI455X de AMD, respectivamente.
La influencia de Broadcom también aparece en el diseño, ya que el acelerador parece apoyarse casi con certeza en la tecnología XPU de esa empresa de propiedad intelectual. Para una compañía que intenta llevar rápidamente un procesador complejo al mercado, delegar parte de la arquitectura en un proveedor especializado puede permitir concentrar recursos en las características que diferencian sus cargas de trabajo.
Memoria y escalamiento
El MTIA 400 incorpora ocho pilas de memoria HBM3e de 36 GB, para un total de 288 GB y un ancho de banda aproximado de 9,2 TB/s. Esa velocidad representa cerca de 15% más que la de componentes de la generación anterior de Nvidia y AMD, pero queda por debajo de la mitad del ancho de banda ofrecido por sus nuevas GPU, una limitación relevante para cargas de inferencia de modelos de lenguaje.
La configuración ayuda a explicar por qué Meta posiciona el chip principalmente como un acelerador de entrenamiento. Para la inferencia de LLM, donde el acceso rápido a los parámetros puede ser determinante, la compañía dispone de alternativas más adecuadas en las plataformas de Nvidia y AMD, especialmente mientras sus diseños internos continúan madurando.
Dos chiplets de entrada y salida proporcionan hasta 1,2 TB/s de ancho de banda entre chips mediante RDMA, una tecnología que permite mover datos directamente entre memorias sin depender de múltiples pasos del procesador anfitrión. Meta no ha especificado el transporte empleado, pero la participación de Broadcom hace que Ethernet aparezca como una posibilidad evidente, aunque esa interpretación no fue confirmada por la empresa.
En el nivel de sistema, cada hoja de cómputo reúne cuatro aceleradores MTIA 400 conectados mediante un switch PCIe a una CPU x86 y a una tarjeta de red para expansión. Un rack completo utiliza 18 hojas de cómputo y ocho hojas de switches, con lo que concentra 72 aceleradores dentro de un único dominio unificado.
Competencia con Nvidia y AMD
El diseño físico del sistema recuerda a los racks NVL72 de Nvidia y Helios de AMD, aunque Meta no utiliza los racks OCP de doble ancho asociados a esas plataformas. La semejanza muestra que los grandes operadores están convergiendo hacia configuraciones de rack densas, con múltiples aceleradores, redes de alta velocidad y memoria apilada como elementos centrales.
Meta todavía no ha divulgado hasta qué tamaño puede crecer un clúster basado en MTIA 400. Las presentaciones de la empresa solo mencionan un escalamiento de varios miles de aceleradores, por lo que aún faltan datos públicos sobre eficiencia, rendimiento sostenido y comportamiento de las comunicaciones cuando la instalación supera el nivel de un rack.
A escala de rack, los sistemas podrían competir de manera razonable con las configuraciones GB200 y GB300 de Nvidia en entrenamiento, al menos según el posicionamiento técnico presentado. Esa posibilidad no equivale a una sustitución inmediata de las GPU comerciales, porque el rendimiento de un clúster depende también del software, la interconexión, la disponibilidad y la capacidad de optimizar cada modelo.
Las GPU de Nvidia y AMD siguen estando mejor adaptadas a la inferencia de LLM y, con alta probabilidad, son las plataformas utilizadas por Meta Superintelligence Labs para entrenar modelos frontera como Muse Spark. El hardware específico de aplicación suele rendir mejor cuando la carga está bien comprendida, pero también pierde flexibilidad frente a arquitecturas capaces de atender una gama más amplia de modelos y proveedores.
La hoja de ruta de Meta
Meta ya trabaja en una versión optimizada para inferencia, la MTIA 450, presentada en marzo y prevista para entrar en producción el próximo año. El nuevo componente duplicaría el ancho de banda de memoria del MTIA 400, posiblemente mediante el reemplazo de HBM3e por HBM4, aunque la compañía no detalló en la información disponible todos los elementos de esa configuración.
Un mayor ancho de banda podría hacer que la MTIA 450 resulte más adecuada para los modelos de recomendación basados en LLM que Meta ha mencionado durante los últimos trimestres. En esas cargas, reducir la espera para acceder a los parámetros puede ser tan importante como aumentar la capacidad de cálculo, especialmente cuando el sistema debe responder a numerosas solicitudes publicitarias.
La siguiente etapa sería la MTIA 500, también prevista para 2027, probablemente durante el segundo semestre según la estimación recogida por la fuente. Ese acelerador aumentaría otro 50% el ancho de banda de memoria, posiblemente con cuatro pilas adicionales de HBM4, y duplicaría el número de chiplets de cómputo.
La evolución prevista sugiere que Meta no concibe el MTIA 400 como un producto aislado, sino como la base de una familia de aceleradores internos. El desafío será convertir esas especificaciones en una plataforma suficientemente competitiva en software y escala para reducir la dependencia de Nvidia y AMD sin sacrificar el rendimiento que necesitan sus servicios de inteligencia artificial y publicidad.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Energía
El Ejército de EE. UU. prepara USD $2.200 millones para reactores nucleares en sus bases
Empresas
NVIDIA revela una participación de USD $21.000 millones en SpaceX y reabre el debate sobre el financiamiento circular
Bitcoin
StarkWare ejecuta una transacción de Bitcoin resistente a la computación cuántica
Estados Unidos