Por Canuto  

Nvidia anunció que su acelerador dedicado de inferencia Groq 3 LPX entró en producción completa, con Nebius como primer cliente comprometido y pruebas que reportan 3.400 tokens por segundo para agentes de IA.
***

  • Groq 3 LPX fue diseñado para descargar la generación de tokens de las GPU en la plataforma Vera Rubin NVL72.
  • Artificial Analysis registró 3.400 tokens por segundo con Gemma 4 31B y una ventana de contexto de 100.000 tokens.
  • Nebius planea incorporar el acelerador a su plataforma de inferencia Nebius Token Factory.


Nvidia anunció que su acelerador dedicado de inferencia Groq 3 LPX entró en producción completa, en un movimiento orientado a sostener su liderazgo en la infraestructura para inteligencia artificial. La compañía presentó el componente durante Hot Chips 2026 como una extensión especializada de su plataforma de centros de datos Vera Rubin, con el objetivo de acelerar la generación de tokens que necesitan los agentes de IA para responder, razonar y ejecutar tareas con menor latencia.

La inferencia describe la ejecución en producción de un modelo que ya fue entrenado, una etapa que gana importancia a medida que las empresas despliegan agentes autónomos. Estos sistemas pueden planificar, escribir y ejecutar código, revisar archivos, utilizar herramientas externas y repetir ciclos de trabajo, por lo que una demora en cada paso puede acumularse hasta volver lenta la experiencia del usuario.

Un chip para el cuello de botella de la inferencia

Los agentes de IA procesan grandes cantidades de información antes de generar cada respuesta, pero el problema no termina con la lectura del contexto. La llamada latencia de decodificación puede frenar la producción de tokens, especialmente cuando el sistema debe verificar datos, invocar servicios de terceros y volver a evaluar el resultado durante una secuencia de tareas complejas.

La arquitectura de Vera Rubin NVL72 busca separar esas funciones dentro de un sistema a escala de rack. Sus GPU están orientadas a la ingesta y al procesamiento de contexto a gran escala, mientras que Groq 3 LPX permite descargar las cargas de decodificación en aceleradores especializados, de modo que ambos tipos de procesadores trabajen juntos dentro de un motor de inferencia unificado.

Según Nvidia, un despliegue completo de rack puede aprovechar hasta 256 aceleradores LP30 conectados mediante interconexiones de chips de gran ancho de banda. La empresa sostiene que esta configuración permite calcular cada paso de la cadena de razonamiento de un agente junto con las GPU, con la intención de reducir el compromiso habitual entre rendimiento máximo y tiempos de respuesta.

La apuesta refleja un cambio en las prioridades de los centros de datos de IA, que ya no se concentran únicamente en entrenar modelos cada vez mayores. Para los agentes, la velocidad con que se genera cada token puede determinar si una tarea de varios pasos parece interactiva o se convierte en una espera prolongada, particularmente cuando el sistema debe operar continuamente con herramientas y fuentes externas.

Resultados anunciados y primer cliente

La compañía presentó resultados de terceros para respaldar sus afirmaciones de rendimiento. En pruebas de Artificial Analysis, Groq 3 LPX alcanzó una salida de 3.400 tokens por segundo al ejecutar Gemma 4 31B, un modelo de código abierto, con una ventana de contexto de 100.000 tokens.

Nvidia calificó esa cifra como un récord y afirmó que el acelerador puede ser hasta cuatro veces más reactivo que otras plataformas en cargas de trabajo que exigen baja latencia. De acuerdo con la empresa, la diferencia permitiría completar tareas agénticas de múltiples pasos en minutos en lugar de varias horas, aunque el resultado corresponde a las condiciones específicas de la prueba citada.

El primer cliente comprometido es Nebius Group, proveedor de infraestructura en la nube que planea utilizar los nuevos chips en Nebius Token Factory. La plataforma de inferencia de producción ofrecerá a sus clientes mayores velocidades de generación de tokens para aplicaciones que requieren agentes más reactivos, según la información divulgada por ambas compañías.

Danila Shtan, director de tecnología de Nebius, afirmó que la generación es la fase de la inferencia que define cuán receptivo se siente un sistema. El ejecutivo agregó que la compañía busca que cada paso del ciclo de un agente parezca instantáneo al llevar Groq 3 LPX a producción mediante Nebius Token Factory.

La tecnología detrás de Groq 3 LPX

El nuevo acelerador utiliza tecnología licenciada de Groq Inc., una empresa enfocada en procesadores para inferencia y no en el entrenamiento de modelos. Nvidia pagó USD $20.000 millones a la startup en diciembre para acceder a esa tecnología, y como parte del acuerdo incorporó a Jonathan Ross, fundador de Groq, y a Sunny Madra, quien ocupaba la presidencia de la compañía.

La operación no debe confundirse con Grok, el modelo de inteligencia artificial asociado a SpaceX, ya que Groq es el nombre de una compañía de semiconductores dedicada a hardware especializado. La distinción resulta relevante porque el mercado combina cada vez más nombres de productos, modelos y empresas dentro de una misma carrera por reducir el costo y el tiempo de las aplicaciones de IA.

Jensen Huang, fundador y director ejecutivo de Nvidia, afirmó que las plataformas Grace Blackwell y NVL72 ya habían mejorado el rendimiento y la eficiencia de la inferencia. En su explicación, Vera Rubin amplía esa estrategia con configuraciones de fábrica de IA optimizadas para la era de los agentes, mientras LPX apunta específicamente a una generación de tokens ultrarrápida.

Huang sostuvo que esa combinación puede transformar la forma en que se produce la inteligencia y generar avances en productividad, eficiencia y capacidad de respuesta. La declaración representa la posición de Nvidia sobre el potencial comercial del producto, mientras que la adopción efectiva dependerá del desempeño de los sistemas completos, el software disponible y las necesidades de cada proveedor.

Más componentes para la plataforma Vera Rubin

Durante Hot Chips 2026, Nvidia también anunció que SpaceX se convirtió en otro cliente insignia de la plataforma Vera Rubin. La compañía aeroespacial y de inteligencia artificial planea construir su arquitectura informática de próxima generación alrededor de Vera Rubin, con unidades centrales de procesamiento destinadas a tareas de coordinación, ejecución de herramientas y simulación.

Según Nvidia, esas cargas abarcarán desde centros de datos terrestres hasta satélites. El anuncio amplía el alcance presentado para Vera Rubin, que no se limita a acelerar modelos dentro de un centro de datos, sino que también busca atender sistemas distribuidos con exigencias de coordinación y procesamiento intensivo en CPU.

El fabricante mostró además Spectrum-X Multiplane, una arquitectura Ethernet optimizada para IA que divide las conexiones de un servidor en rutas paralelas. Nvidia dijo que el diseño puede ayudar a escalar clústeres de hasta 512.000 GPU, una dimensión que ilustra la presión sobre las redes de comunicación cuando los modelos y las cargas de trabajo se distribuyen entre miles de procesadores.

La empresa presentó igualmente Nvidia Scale-In, una plataforma de software de infraestructura que busca reducir y acelerar funciones de seguridad, redes y gestión de datos desde los nodos principales de cómputo. También mostró NVLink Fusion, una tecnología que permite conectar procesadores centrales personalizados y unidades de procesamiento de datos con sistemas de rack basados en NVLink de sexta generación.

Qué significa para los agentes de IA

El interés por los aceleradores de inferencia surge de una necesidad concreta: los agentes deben actuar en tiempo real y no solo producir una respuesta aislada. Un sistema que razona, consulta una base de datos, llama una herramienta, revisa el resultado y repite el proceso necesita mantener una cadencia estable de generación, porque cada retraso puede multiplicarse a lo largo del flujo.

Groq 3 LPX intenta abordar ese desafío con hardware dedicado para la fase de decodificación, mientras las GPU de Vera Rubin manejan el procesamiento de contexto. Esta división puede resultar atractiva para proveedores de nube y empresas que ejecuten grandes volúmenes de agentes, aunque la ventaja final dependerá de la arquitectura del modelo, la longitud del contexto y la eficiencia del software que coordina los componentes.

La entrada en producción completa también marca una transición desde la presentación de laboratorio hacia la disponibilidad comercial. El compromiso de Nebius ofrece a Nvidia un primer entorno para demostrar el producto ante clientes de inferencia, pero todavía será necesario observar cómo se comporta en cargas variadas, con diferentes modelos y niveles de concurrencia.

La carrera por la inferencia rápida podría modificar la composición de los centros de datos, al incorporar más procesadores especializados junto con las GPU tradicionales. Si los agentes se convierten en una interfaz habitual para ejecutar tareas empresariales, la velocidad de los tokens dejará de ser un indicador técnico aislado y pasará a influir directamente en el costo, la productividad y la percepción de calidad del servicio.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín