Cerebras presentó en Hot Chips 2026 la arquitectura Nexus para su plataforma CS-4 y mostró una hoja de ruta que contempla DRAM 3D para el futuro CS-6. La empresa también proyectó velocidades de hasta 10.000 tokens por segundo por usuario para una próxima generación, aunque esas cifras corresponden a estimaciones de la compañía y no a mediciones independientes.
***
- La arquitectura Nexus es la plataforma de rack del CS-4 y admite tres Wafer-Scale Engines en módulos modulares.
- El CS-6 está proyectado para integrar DRAM apilada en 3D sobre una oblea que combina lógica y SRAM.
- Cerebras prevé que su próxima generación alcance hasta 10.000 tokens por segundo por usuario en modelos más pequeños.
Cerebras presentó en Hot Chips 2026 la arquitectura de sistema Nexus para su plataforma CS-4, centrada en procesadores wafer-scale destinados a la inferencia de inteligencia artificial de baja latencia. Según la información difundida por la compañía, el CS-4 es el primer sistema construido sobre Nexus y utiliza tres Wafer-Scale Engines en una plataforma modular a escala de rack. Cerebras también adelantó una hoja de ruta que incluye un futuro CS-6 con DRAM apilada en 3D.
Los motores wafer-scale de Cerebras integran una gran superficie de silicio en un único procesador coherente, una propuesta distinta de los aceleradores tradicionales compuestos por múltiples chips. La empresa ha orientado este diseño a servicios de inferencia que requieren respuestas rápidas. En este contexto, OpenAI confirmó una asociación con Cerebras para ofrecer el modo Ultrafast de GPT-5.6 Sol, con hasta 750 tokens de salida por segundo y hasta 14 veces la velocidad del procesamiento estándar, según la información publicada por ambas compañías.
La memoria se convierte en el principal límite
El crecimiento de los modelos de IA está elevando la presión sobre la memoria disponible en los aceleradores, tanto por el tamaño de los parámetros como por los contextos cada vez más extensos. En inferencia, además, las cachés KV asociadas con cada sesión pueden consumir grandes cantidades de memoria, mientras que la ocupación de un modelo puede amortizarse entre varios usuarios.
Los fabricantes tradicionales de GPU han respondido mediante memorias HBM más densas y apiladas, además de aumentar la cantidad de HBM instalada en cada acelerador. Cerebras enfrenta una dificultad distinta, porque sus obleas combinan lógica y SRAM en una superficie de silicio muy amplia. Agregar más memoria sin sacrificar otra función exige buscar una solución vertical.
El CS-6, que forma parte de la hoja de ruta futura presentada por Cerebras, está proyectado como el primer sistema de la compañía en colocar DRAM 3D sobre una oblea que combina lógica y SRAM. La información disponible describe esta integración como una forma de ampliar la memoria del diseño wafer-scale, aunque su disponibilidad y rendimiento final dependerán de la ejecución de la hoja de ruta.
Nexus reorganiza el rack de Cerebras
Mientras el CS-6 representa una apuesta futura, la arquitectura Nexus busca elevar el rendimiento de la plataforma CS-4 mediante un sistema a escala de rack. Las fuentes sobre la presentación describen un diseño basado en tres Wafer-Scale Engines, cada uno alojado en un módulo modular. No hay evidencia suficiente para confirmar la denominación “mochilas” ni todos los detalles de integración descritos en el borrador original.
La arquitectura modular está planteada para facilitar la evolución del sistema y organizar en el rack elementos como la entrega de energía, las conexiones de expansión y la refrigeración. La compañía presenta Nexus como una plataforma reutilizable a escala de rack, concebida para admitir distintas configuraciones de sus motores wafer-scale.
El diseño busca reducir la complejidad de las conexiones y evitar parte de las pérdidas asociadas con recorridos eléctricos más largos. Sin embargo, las cifras precisas sobre cableado, latencia, interconexión y capacidad de actualización deben interpretarse como afirmaciones de Cerebras o de las fuentes que describieron su presentación, no como resultados de una comparación independiente.
Más energía para el WS-3T
La información publicada sobre Nexus señala que el diseño puede entregar hasta el doble de energía al motor wafer-scale frente a generaciones anteriores. Cerebras vincula esa mejora con un aumento de hasta el doble en el rendimiento del WS-3, aunque se trata de cifras declaradas por la compañía y no de un benchmark independiente aportado en la evidencia disponible.
El CS-4 utiliza el WSE-3 Turbo, identificado en las especificaciones difundidas como un motor con 44 GB de SRAM integrada en la oblea. Las fuentes consultadas describen tres WSE-3 Turbo en el sistema CS-4, por lo que la capacidad combinada de SRAM sería de 132 GB si se suman las cifras individuales. Esta memoria no debe confundirse con la HBM instalada en otros sistemas de rack.
La capacidad de memoria constituye una diferencia importante frente a plataformas que incorporan grandes cantidades de HBM, pero no basta por sí sola para establecer cuál sistema ofrece mejor rendimiento. La comparación también depende del modelo utilizado, la precisión, el tamaño de lote, la distribución de la carga y las métricas de latencia.
Causas de movimientos recientes
La información disponible no permite atribuir a un único catalizador confirmado ningún movimiento reciente del mercado relacionado con Cerebras. Una explicación plausible es la atención generada por la presentación de Nexus, el anuncio del CS-4 y la hoja de ruta que contempla DRAM 3D para el CS-6. También pudo influir la confirmación de la asociación con OpenAI para GPT-5.6 Sol Ultrafast, pero la relación causal con cualquier variación bursátil no está demostrada.
Escalamiento entre obleas
Cerebras plantea una ruta de expansión distinta a la de los sistemas de rack que dependen de múltiples aceleradores y redes externas. La arquitectura Nexus está diseñada para organizar tres motores wafer-scale dentro del CS-4 y, según la descripción de la compañía, puede servir como base para configuraciones de mayor escala.
Las cifras de ancho de banda, latencia y rendimiento comunicadas durante la presentación deben leerse como especificaciones o afirmaciones del fabricante. La evidencia disponible no aporta una prueba independiente que permita comparar de forma concluyente el CS-4 con Vera Rubin NVL72 o AMD Helios en tokens por segundo.
Además, una comparación entre arquitecturas no puede reducirse a la cantidad de memoria o al ancho de banda máximo. La organización del modelo, el flujo de datos, la interconexión y el tipo de inferencia determinan qué sistema resulta más eficiente para una carga concreta.
CS-5 y la carrera por los tokens
La hoja de ruta descrita en la información disponible contempla una próxima generación CS-5 y una meta de hasta 10.000 tokens por segundo por usuario en modelos más pequeños. Para modelos frontera de mayor tamaño también se han mencionado objetivos inferiores, pero estas cifras son proyecciones de Cerebras y no mediciones independientes realizadas sobre un producto disponible.
La velocidad de generación se ha convertido en un factor importante para los agentes de IA, que deben encadenar instrucciones, consultar herramientas y reaccionar a cambios en tiempo real. El interés por la inferencia de baja latencia explica la estrategia de Cerebras y su asociación con proveedores de modelos, aunque no garantiza por sí mismo una ventaja general frente a las GPU.
La empresa enfrenta la tensión entre velocidad, capacidad de memoria y producción de obleas. Su hoja de ruta intenta abordar esas restricciones mediante una combinación de modularidad, entrega de energía más eficiente, conexiones a escala de rack y eventual apilamiento 3D de DRAM. El CS-4 representa la plataforma inmediata, mientras que el CS-6 busca ampliar la memoria sin abandonar la arquitectura wafer-scale.
Para Cerebras, la oportunidad consiste en consolidar un nicho de inferencia de baja latencia y alto rendimiento junto con socios como OpenAI. El resultado dependerá de que la compañía pueda convertir sus proyecciones en productos disponibles, sostener las ganancias de rendimiento y resolver la brecha de memoria frente a las plataformas de rack que utilizan grandes cantidades de HBM.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Privacidad
Bluesky permite publicar sin quedar expuesto al feed de Descubrir
IA
Analista de Raymond James ve a Nvidia rumbo a una capitalización de USD $13 billones
Empresas
Hackeo expone datos de 8,7 millones de clientes de aeropuertos británicos
Canadá