Por Canuto  

El nuevo Nemotron 3.5 Lightning de Nvidia, con solo 31.6 mil millones de parámetros y 3.6 activos, iguala a GPT-oss-120b en inteligencia y alcanza 670 tokens por segundo. La apuesta por la eficiencia redefine la IA de pesos abiertos con benchmarks agénticos superiores.
***

  • Nemotron 3.5 Lightning alcanza 670 tokens por segundo, el doble de rápido que Gemini 3.5 Flash-Lite.
  • El modelo de Nvidia iguala a GPT-oss-120b en el Índice de Inteligencia (24) con solo 3.6B parámetros activos.
  • En benchmarks agénticos, supera a gpt-oss-120b (824 Elo vs 800) y a Nemotron 3 Super (698).


Un modelo compacto que rompe la barrera de velocidad

Nvidia presentó Nemotron 3.5 Lightning, el primer modelo de su nueva línea que prioriza la eficiencia sobre el tamaño. El modelo hereda la arquitectura híbrida Mamba-Transformer de su predecesor Nemotron 3 Nano y tiene 31.6 mil millones de parámetros totales, pero solo 3.6 mil millones se activan en cada paso.

Según la plataforma independiente Artificial Analysis, el modelo obtiene 24 puntos en el Índice de Inteligencia, un salto de nueve puntos respecto al Nemotron 3 Nano (15). Esta puntuación lo coloca a la par con gpt-oss-120b de OpenAI (24) y justo detrás del propio Nemotron 3 Super de Nvidia (26), que es aproximadamente cuatro veces más grande.

Sin embargo, los modelos pequeños más inteligentes de su clase, como Qwen3.6 35B A3B (32) y el nuevo Muse Glimmer de Meta (35), todavía mantienen una ventaja clara. La diferencia clave está en velocidad: Lightning alcanza casi 670 tokens por segundo en pruebas previas al lanzamiento con pesos NVFP4.

Ese rendimiento es el más alto medido entre todos los modelos comparados por Artificial Analysis, casi el doble que el Gemini 3.5 Flash-Lite de Google (386 tokens/s). Una tarea del Índice de Inteligencia se completa en aproximadamente 0.5 minutos, mientras que Qwen3.6 35B A3B necesita 3.5 minutos y Gemma 4 31B unos 5.8 minutos.

Los modelos propietarios aún dominan la frontera de eficiencia general. Gemini 3.5 Flash-Lite obtiene 37 en el Índice de Inteligencia con un tiempo por tarea similar, y GPT-5.6 Luna (max) alcanza 52 puntos en menos de dos minutos. La propuesta de Nvidia es ofrecer una alternativa abierta y rápida para cargas de trabajo prácticas.

Mejoras notables en benchmarks agénticos

Las ganancias más significativas del Nemotron 3.5 Lightning se observan en benchmarks agénticos, donde demuestra su capacidad para manejar tareas complejas. En GDPval-AA v2, alcanza una calificación Elo de 824, superando a gpt-oss-120b (800) y al más grande Nemotron 3 Super (698).

En Terminal-Bench v2.1, la puntuación salta del 7 al 24.3 por ciento, casi igualando al gpt-oss-120b con un 26.2 por ciento. Esta mejora sustancial en pruebas de razonamiento y ejecución de agentes posiciona al modelo como un fuerte candidato para pipelines automatizados.

Nvidia distribuye el modelo bajo la licencia permisiva OpenMDW-1.1, lo que facilita su adopción comercial. La compañía trabajó con socios como CodeRabbit y Harvey en el post-entrenamiento para impulsar el rendimiento en dominios específicos, como revisión de código y aplicaciones legales.

Estos avances no son aislados: Nvidia ya había argumentado en un artículo científico que los modelos con menos de 10 mil millones de parámetros pueden manejar la mayoría de las cargas agénticas tan bien como los de 70 a 175 mil millones, con un costo diez a treinta veces menor.

Con el Lightning, la empresa demuestra que su tesis es viable a nivel de producto: un modelo compacto que supera a rivales más grandes en agilidad y velocidad, sin sacrificar inteligencia en tareas determinadas.

Disponibilidad y licenciamiento

Nemotron 3.5 Lightning ya está disponible en pesos BF16 y NVFP4, esta última variante también obtiene 24 en el Índice de Inteligencia con pérdida mínima de calidad. El modelo maneja solo texto y admite una ventana de contexto de un millón de tokens, ideal para aplicaciones que requieren memoria extensa.

Los pesos se ofrecen desde ahora, y la inferencia sin servidor está disponible a través de proveedores como DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius y Crusoe, entre otros. Esto permite a desarrolladores integrar el modelo en producción sin necesidad de infraestructura propia.

La apuesta de Nvidia por la eficiencia sobre el tamaño no es nueva. El año pasado, sus investigadores publicaron un análisis que indicaba que los modelos más pequeños pueden ser igualmente efectivos en tareas de agentes a una fracción del costo.

Con velocidades de inferencia récord de casi 670 tokens por segundo, el Lightning se convierte en la prueba más clara de esa tesis. Su rendimiento en benchmarks agénticos también supera a gpt-oss-120b, consolidando su posición como un modelo competitivo para aplicaciones empresariales.

La disponibilidad en múltiples plataformas y la licencia permisiva OpenMDW-1.1 invitan a la comunidad a experimentar y adaptar el modelo a casos de uso específicos, impulsando la adopción de IA eficiente en la industria.

Comparación con el ecosistema de IA abierta

El Nemotron 3.5 Lightning llega en un momento en que la carrera por la eficiencia es tan importante como la inteligencia bruta. Mientras Meta apuesta por Muse Glimmer (35 puntos en el Índice de Inteligencia) y Qwen3.6 35B A3B (32), Nvidia elige un punto intermedio con equilibrio entre velocidad y capacidad.

Aunque los modelos propietarios como Gemini 3.5 Flash-Lite (37) y GPT-5.6 Luna (52) superan a Lightning en inteligencia pura, el modelo abierto de Nvidia ofrece una alternativa sin costo de licencia y con latencia mínima. Esto lo hace atractivo para aplicaciones sensibles al tiempo, como trading algorítmico, monitoreo en tiempo real y automatización de procesos.

La ventaja de velocidad también tiene implicaciones económicas: una tarea que tarda 0.5 minutos en Lightning, toma 3.5 minutos en Qwen3.6 y 5.8 minutos en Gemma 4, lo que reduce los costos de cómputo y el tiempo de respuesta en entornos productivos.

En el ámbito de pesos abiertos, Lightning se posiciona como el líder en rendimiento por dólar invertido, materializando la visión de Nvidia de democratizar la IA de alta velocidad.

Su arquitectura híbrida Mamba-Transformer, junto con la cuantización NVFP4, demuestran que es posible reducir el tamaño sin sacrificar precisión en las tareas más exigentes.

Rendimiento práctico y casos de uso potenciales

Los benchmarks agénticos son particularmente relevantes para la adopción empresarial, ya que reflejan tareas como navegar interfaces, ejecutar comandos y tomar decisiones autónomas. La mejora del 7 al 24.3 por ciento en Terminal-Bench v2.1 indica una madurez significativa en este campo.

La colaboración con CodeRabbit y Harvey sugiere que el modelo ha sido optimizado para dominios específicos, como revisión de código y análisis legal, donde la precisión y rapidez son críticas.

Para desarrolladores de bots y agentes, la velocidad de 670 tokens por segundo reduce la latencia percibida, mejorando la experiencia del usuario final. Además, la ventana de contexto de un millón de tokens permite procesar documentos extensos sin fragmentación.

Sin embargo, el modelo no está exento de limitaciones: su puntuación de 24 en el Índice de Inteligencia es inferior a la de sus contemporáneos propietarios y a los modelos abiertos más grandes como Nemotron 3 Super. Para tareas que requieren razonamiento profundo, los usuarios podrían preferir modelos más capaces, aunque a costa de velocidad.

En resumen, Nemotron 3.5 Lightning representa un paso adelante en la optimización de recursos, ofreciendo una alternativa válida para aplicaciones donde el tiempo de respuesta es primordial.

Conclusión: la eficiencia como nuevo campo de batalla

Nvidia ha demostrado que es posible combinar velocidad extrema con inteligencia competitiva en un paquete compacto y de código abierto. La licencia OpenMDW-1.1 permite que empresas y desarrolladores adapten el modelo sin restricciones, acelerando la innovación en el ecosistema de IA.

Los resultados de Artificial Analysis, una fuente confiable en la industria, confirman el avance del modelo en benchmarks estándar y agénticos. La compañía ya había anticipado esta dirección con sus investigaciones previas sobre la eficiencia de modelos pequeños.

Con la disponibilidad inmediata en múltiples nubes, el Lightning podría convertirse en el estándar para aplicaciones en tiempo real, desde asistentes de voz hasta sistemas de trading de alta frecuencia.

Queda por ver cómo responden los competidores, pero por ahora Nvidia marca la pauta con un modelo que prioriza la rapidez sin renunciar a la inteligencia.

El futuro de la IA abierta parece dirigirse hacia la especialización: modelos pequeños y rápidos para tareas concretas, en lugar de gigantes monolíticos. Nvidia ya está liderando ese camino.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín