AMD adquirió Taalas, startup que graba los pesos de modelos de IA directamente en silicio, logrando hasta 17.000 tokens por segundo en inferencia. La tecnología promete 48 veces más velocidad que GPU de Nvidia, pero con la limitación de que cada modelo queda fijo en el chip.
***
- AMD compró Taalas, una startup que fabrica chips de IA con los pesos del modelo grabados en silicio, alcanzando 16.960 tokens por segundo en pruebas.
- La tecnología de Taalas promete 48 veces más velocidad que las GPU de Nvidia y 8,5 veces más que Cerebras, pero los cambios de modelo requieren fabricar nuevas capas.
- AMD planea combinar sus racks Helios con chips Taalas para ofrecer inferencia premium, buscando competir con el acuerdo Nvidia-Groq.
AMD anunció la adquisición de Taalas, una startup de Toronto que integra los pesos de los modelos de inteligencia artificial directamente en el silicio de sus chips. Esta tecnología permite alcanzar velocidades de inferencia de hasta 17.000 tokens por segundo, un rendimiento muy superior al de las GPU convencionales.
El acuerdo fue anunciado al cierre del mercado del jueves, en un contexto de fuerte competencia por dominar el hardware de IA. Se enmarca en la misma línea que el acuerdo de licencia de USD $20.000 millones que Nvidia firmó con Groq en diciembre pasado, orientado a servicios de inferencia premium.
El enfoque radical de Taalas
Los chips de Taalas no utilizan memoria HBM para almacenar los pesos del modelo, como hacen las GPU. En lugar de eso, los graban directamente en el silicio, lo que los convierte en circuitos integrados específicos de modelo (MSIC).
En febrero, Taalas reveló su primer chip de prueba llamado HC1, fabricado con el proceso de 6 nm de TSMC. Los puntos de referencia mostraron que podía servir el modelo Llama 3.1 8B de Meta a 16.960 tokens por segundo.
Esa velocidad es 48 veces más rápida que la de las GPU de Nvidia y 8,5 veces más rápida que los aceleradores de Cerebras cuando se anunció en febrero. Aunque Llama 3.1 debutó a mediados de 2024, el chip del tamaño de un retículo estaba destinado a probar el concepto.
El chip HC2 de segunda generación, que se lanzará este verano, pretende aumentar el número de parámetros a 20 mil millones. Con ese número, solo se necesitarían 50 aceleradores para soportar un modelo de un billón de parámetros, usando paralelismo de tubería.
En comparación, los sistemas LPX de Nvidia requerirían varias docenas de GPU y al menos 2.000 LPU de Groq para servir el mismo modelo, según lo que se sabe hasta ahora.
La arquitectura desagregada de AMD
Se espera que AMD combine sus racks Helios basados en Instinct con los chips de Taalas, en una arquitectura desagregada. El procesamiento de prompts con alta carga computacional se realizaría en GPU, mientras que la generación de tokens se descargaría a los aceleradores Taalas.
También es posible que AMD adopte una cadencia tick-tock, donde los clientes desplieguen y validen inicialmente los modelos en aceleradores Instinct y luego pasen a los aceleradores Taalas. Vamsi Boppana, vicepresidente sénior de IA de AMD, dijo en un comunicado que la compañía está construyendo una plataforma de IA de pila completa para dar flexibilidad a los clientes.
La tecnología de Taalas tiene un inconveniente importante: una vez que los chips están desplegados, el modelo queda fijo. Cualquier cambio más grande que un adaptador LoRA requerirá una nueva fabricación de los chips, un proceso costoso y que consume tiempo.
Sin embargo, la startup asegura que no hay que empezar de cero. Solo se necesitan cambiar dos capas de metal, lo cual es mucho más barato y requiere menos tiempo que fabricar el chip desde cero.
La tecnología también tiene implicaciones para el desarrollo de modelos. Una técnica llamada escalado en tiempo de prueba, que permite que un modelo ‘piense’ más tiempo antes de responder, consume más tokens y es costosa. Si la velocidad aumenta 10x o 20x, los desarrolladores podrían extender el tiempo de razonamiento sin penalizar al usuario.
Según declaraciones de Taalas en febrero, grabar los pesos de un modelo en silicio es 100 veces menos costoso que entrenar un modelo de frontera. Eso podría atraer a grandes desarrolladores como OpenAI, Anthropic y Meta, que ya son clientes de AMD Instinct.
El acuerdo se espera que se cierre en el cuarto trimestre, sujeto a aprobación regulatoria. Aún no se conocen los términos financieros, pero se sabe que es una adquisición real y no un acquihire.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Juez ordena a Meta pagar $567 millones más en demanda por seguridad infantil en Nuevo México
Hardware
OpenAI y Jony Ive preparan un altavoz inteligente con forma de rosquilla
Análisis de mercado
Worldcoin (WLD) se desploma 6,25% el 6 de agosto de 2026 y toca soporte en $0,2995
AltCoins