Cerebras presentó el WSE-3T y los sistemas CS-4, una plataforma que duplica el cómputo por oblea y triplica su capacidad de chips por rack, aunque con un fuerte aumento del consumo energético y cifras que deben analizarse más allá del marketing.
***
- El WSE-3T conserva el proceso de 5 nm, los 900.000 núcleos y los 44 GB de SRAM, pero duplica su rendimiento y ancho de banda.
- El sistema CS-4 puede integrar hasta tres obleas y apunta a racks de 120 kW o más para cargas de inferencia de IA.
- Cerebras reduce la latencia entre chips mediante una malla directa y descarga el procesamiento prefill a aceleradores externos.
Cerebras presentó el WSE-3T y los sistemas CS-4, una nueva generación de hardware diseñada para acelerar la inferencia de inteligencia artificial mediante más frecuencia, ancho de banda y capacidad de integración en racks. La compañía sostiene que su plataforma puede multiplicar por diez el rendimiento por vatio frente a la generación anterior, aunque ese objetivo deberá comprobarse en cargas de trabajo reales y con un consumo energético considerablemente mayor.
El anuncio parte de una premisa central en la infraestructura de IA: durante la inferencia, el movimiento de datos suele convertirse en un límite tan importante como la capacidad de cálculo. Cerebras ya destacaba por utilizar aceleradores del tamaño de una oblea completa, con un ancho de banda de memoria de 21,6 PB/s en el WSE-3, una cifra que la empresa situaba muy por encima de la oferta convencional de Nvidia y AMD.
El nuevo WSE-3T duplica varios indicadores del WSE-3 sin recurrir a un proceso de fabricación más avanzado ni a una oblea de mayor tamaño. La empresa mantiene el nodo TSMC de 5 nm, los 4 billones de transistores, los 900.000 núcleos y los 44 GB de SRAM, pero eleva el cómputo FP16 disperso de 125 a 250 PFLOPS, el cómputo FP16 denso de 12,5 a 25 PFLOPS y el ancho de banda de memoria de 21,6 a 43,2 PB/s.
Más frecuencia sobre el mismo silicio
La diferencia principal no parece estar en un nuevo diseño de silicio, sino en la capacidad de alimentar el hardware con más potencia. Cerebras explica que rediseñó la plataforma de entrega de energía para reducir pérdidas y permitir que una mayor cantidad de vatios atraviese la oblea, con el efecto de elevar las frecuencias de operación y acelerar la generación de tokens.
Las estimaciones citadas por la fuente apuntan a una frecuencia cercana a 2,8 GHz para el WSE-3T, frente a aproximadamente 1,4 GHz en el WSE-3. Si esa comparación resulta correcta, la compañía habría duplicado la frecuencia del mismo silicio de 5 nm, un avance notable que también ayuda a explicar por qué el consumo estimado aumenta desde 15 kW a nivel de oblea hasta 33 kW.
En el papel, cada WSE-3T ofrece 250 PFLOPS de rendimiento de inteligencia artificial, 44 GB de SRAM, 43,2 PB/s de ancho de banda de memoria y 2,4 Tbps de ancho de banda de entrada y salida. La memoria integrada permite mantener grandes volúmenes de datos cerca de los núcleos, una característica especialmente relevante cuando la prioridad es producir tokens con la menor latencia posible.
Sin embargo, las cifras máximas requieren una lectura cuidadosa porque el rendimiento FP16 disperso depende de la denominada escasez, que no siempre ofrece ventajas equivalentes durante la inferencia de modelos de lenguaje grandes. La fuente estima que, al aplicar la misma relación de escasez de diez veces observada en el WSE-3, el rendimiento FP16 denso efectivo del WSE-3T rondaría los 25 PFLOPS, una cifra todavía elevada, pero menos espectacular que la presentación principal.
El contraste con Nvidia y AMD
La comparación con las GPU más recientes de Nvidia y AMD también cambia según el formato de precisión utilizado. Esos aceleradores ofrecen entre 4 y 5 PFLOPS de FP16 denso, o entre 35 y 50 PFLOPS cuando trabajan con FP4, mientras que Cerebras destaca sobre todo su cifra de FP16 disperso de 250 PFLOPS.
La diferencia no invalida la propuesta de Cerebras, pero sí obliga a comparar capacidades bajo condiciones equivalentes. Una métrica de pico puede ser útil para describir el techo del hardware, aunque no garantiza que un modelo concreto, un compilador específico o una carga de inferencia consiga utilizar todos los recursos disponibles.
El ancho de banda de memoria presenta una cautela similar. La fuente señala que el WSE-3 no tenía suficiente capacidad de cómputo para saturar por sí solo su SRAM durante la inferencia, y no encuentra razones para asumir que la versión Turbo haya eliminado completamente ese límite, pese a duplicar el ancho de banda teórico.
En consecuencia, el desempeño final dependerá de la arquitectura completa y no solo de la oblea. La alimentación eléctrica, la refrigeración, el software, la distribución del modelo y la capacidad de mover los datos entre etapas serán factores decisivos para determinar si el CS-4 logra convertir sus especificaciones máximas en una ventaja sostenida frente a los sistemas basados en GPU.
Un rack diseñado para separar tareas
Cerebras tampoco plantea que sus nuevos chips ejecuten necesariamente toda la pila de inferencia de manera aislada. La compañía adoptó un enfoque disgregado, en el que sus aceleradores se concentran en la generación de tokens mientras el procesamiento inicial de las indicaciones, conocido como prefill, se descarga a aceleradores externos.
La empresa se ha asociado para ese objetivo con aceleradores de AMD e Intel, y el material de la fuente también compara esta estrategia con el uso de Trainium y otros aceleradores en arquitecturas de descarga. La separación permite asignar cada fase a la plataforma que mejor responda a sus características, porque el prefill y la generación de tokens tienen perfiles distintos de cómputo, memoria y latencia.
El diseño del CS-4 coloca hasta tres obleas en un mismo chasis mediante tres backplanes, una configuración que triplica el número de chips por rack en relación con la generación anterior descrita por la compañía. A nivel de sistema, el consumo estimado del WSE-3T llega a 46 kW, frente a los 23 kW del sistema anterior, una diferencia que refleja el costo de mantener las frecuencias Turbo.
Cerebras afirma que el CS-4 está preparado para centros de datos modernos y puede escalar hasta racks de 120 kW o más. Esa densidad energética puede resultar atractiva para operadores que buscan concentrar capacidad de inferencia, pero también exige sistemas de alimentación, refrigeración y planificación física capaces de manejar cargas muy superiores a las de una instalación convencional.
Menos latencia entre las obleas
La interconexión constituye otro de los puntos centrales del CS-4. En lugar de depender de conmutadores externos para comunicar los chips, el sistema utiliza una topología de malla en la que cada oblea se conecta directamente con las demás a través de la parte posterior del rack.
Según Cerebras, ese diseño reduce la latencia de comunicación entre chips desde unos 10 microsegundos hasta menos de 3 microsegundos. La disminución resulta relevante en modelos grandes, donde múltiples etapas necesitan intercambiar información y cualquier espera adicional puede afectar el ritmo de generación de tokens.
La interconexión directa también busca reducir los saltos que deben recorrer los datos dentro del sistema. En una arquitectura de inferencia, esa simplificación puede ayudar a sostener el flujo de trabajo cuando la memoria local, los aceleradores externos y las obleas participan en una misma solicitud, aunque el beneficio real dependerá de cómo el software distribuya cada modelo.
Este enfoque acerca al CS-4 a una tendencia más amplia de la infraestructura de IA: construir sistemas especializados para cada parte del proceso, en lugar de obligar a un único tipo de acelerador a resolver todas las tareas. Cerebras intenta ocupar el segmento de generación de tokens de baja latencia, mientras otros componentes asumen el prefill y las operaciones que requieren un perfil diferente.
El desafío energético de Cerebras
La promesa de hasta diez veces más rendimiento por vatio frente a la generación anterior será uno de los argumentos comerciales más importantes de Cerebras. No obstante, el aumento estimado del TDP de la oblea, de 15 kW a 33 kW, y del sistema, de 23 kW a 46 kW, muestra que la mejora de eficiencia no significa necesariamente un menor consumo absoluto.
La compañía busca producir más tokens con cada unidad de energía, pero para alcanzar ese objetivo lleva el mismo silicio a una frecuencia y un nivel de potencia mucho mayores. Ese intercambio puede ser razonable para servicios de inferencia donde el tiempo de respuesta genera valor económico, aunque será menos sencillo de justificar en instalaciones donde el costo eléctrico o la capacidad de refrigeración ya representan un límite.
El CS-4 llega además a un mercado dominado por Nvidia, con AMD intentando ampliar su presencia y con proveedores de nube desarrollando aceleradores propios. Cerebras puede diferenciarse con memoria integrada, una interconexión de baja latencia y una arquitectura a escala de oblea, pero deberá demostrar que esas ventajas sobreviven a las condiciones de producción, al software disponible y a la variedad de modelos utilizados por los clientes.
La fecha exacta de disponibilidad todavía no fue anunciada, aunque se espera que los sistemas comiencen a llegar a clientes hacia finales de 2026. Hasta entonces, la principal incógnita no será si el WSE-3T puede exhibir cifras impresionantes en sus especificaciones, sino cuánto de ese rendimiento puede sostener durante cargas prolongadas de inferencia sin que la energía, el calor o la saturación de memoria reduzcan su ventaja.
Con el WSE-3T y el CS-4, Cerebras no presenta una ruptura basada en un nodo nuevo, sino una apuesta por extraer más rendimiento del hardware existente mediante alimentación, frecuencia e interconexión. El resultado podría reforzar su posición como alternativa a Nvidia en la generación de tokens, siempre que la promesa Turbo se traduzca en costos y latencias competitivos en centros de datos reales.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Estados Unidos
Más de la mitad de los estadounidenses ya ve la inteligencia artificial con preocupación
Hyperscalers
Stonebraker dice que Oracle ayudó a PostgreSQL a conquistar el mundo
Empresas
Quest alerta por filtración de datos personales tras una brecha en un proveedor
China