Por Canuto  

Un desarrollador logra multiplicar por diez la velocidad de inferencia de un modelo Qwen en un DGX Spark de Nvidia, y la clave no está en el hardware sino en el software: decodificación especulativa con pesos FP8. El caso desafía las suposiciones sobre la brecha entre el hardware de gama media y las estaciones de trabajo premium.
***

  • El ingeniero @0xBakeer logró elevar el rendimiento de un DGX Spark con Qwen3.8-27B desde 7.88 hasta 75 tokens por segundo en generación fresca, y hasta 256 en modo agregado.
  • La mejora de 7,4x provino de decodificación especulativa con pesos FP8, no de cambios de hardware; el creador asegura que “el hardware realmente no es la brecha”.
  • El experimento incluye mediciones con y sin edición de tokens: la tasa de aceptación del borrador cae de ~99% a ~30% cuando no hay texto previo para copiar, reduciendo la velocidad a 20 tok/s.


Un salto de 7,4x que viene del software, no del silicio

El desarrollador @0xBakeer publicó una serie de mediciones de rendimiento para el modelo Qwen3.8-27B ejecutado en una única DGX Spark de Nvidia, y los números resultaron sorprendentes: la velocidad de generación pasó de 7,88 tokens por segundo en una configuración inicial a 75 tokens por segundo en solitario, con un modo agregado de 256 tokens por segundo. La prueba se difundió el 16 de agosto de 2026 a través de una cuenta de X, y rápidamente generó discusión entre entusiastas de la IA local.

Lo más llamativo del experimento es que la mejora no provino de un cambio de hardware, sino de una técnica de software. Según el propio autor, el incremento de 7,4 veces se logró gracias a decodificación especulativa con pesos FP8, sin necesidad de cuantización adicional, lo que contradice la idea de que el rendimiento de los modelos grandes depende principalmente de la capacidad del chip.

En respuesta a un usuario que preguntó por el mecanismo exacto, @0xBakeer explicó que el resultado de 75 tok/s se obtiene con una configuración k=14 en la salida y mucha edición, donde la tasa de aceptación del borrador alcanza el 99%. Este detalle es crucial porque muestra que la decodificación especulativa es especialmente efectiva cuando el modelo puede copiar texto del prompt o del contexto previo, algo común en tareas de edición y corrección.

La publicación también incluyó una medición adicional para demostrar el comportamiento en condiciones más adversas: generación completamente fresca, sin nada en el prompt para copiar, donde la aceptación del borrador cae a aproximadamente 30%. En ese escenario, la velocidad se desploma a 20 tokens por segundo, lo que evidencia que la ganancia no es universal y depende del tipo de tarea.

La brecha no es el hardware: el factor software

En uno de los intercambios, el autor respondió a un comentario de @tinfoiltuna afirmando que “el hardware realmente no es la brecha”, y señaló que la mayor parte del número proviene de software. Subrayó que un DGX Spark ofrece un ancho de banda de memoria de 273 GB/s, mientras que un M4 Max de Apple lo duplica aproximadamente y un M4 Ultra lo triplica, lo que hace aún más notable que la técnica de software compense esa diferencia.

Esta declaración desafía la sabiduría convencional de que la velocidad de inferencia está limitada por el ancho de banda de memoria. Si bien es cierto que el hardware impone un techo teórico, el caso demuestra que las optimizaciones algorítmicas pueden acercarse mucho a ese límite e incluso superar las capacidades de equipos más costosos en ciertos escenarios.

La decodificación especulativa no es una técnica nueva en el campo de la IA, pero su aplicación combinada con pesos FP8 en un modelo de 27B parámetros parece haber dado resultados notables. El mecanismo consiste en que un modelo más pequeño (o la misma red con una versión ligera) propone varios tokens candidatos, y el modelo grande los valida en paralelo, lo que reduce el número de pasos de inferencia necesarios.

El hecho de que la aceptación del borrador caiga al 30% en generación fresca indica que la técnica es menos útil cuando el modelo no tiene patrones que imitar. Aun así, los 20 tok/s obtenidos en ese modo siguen siendo un rendimiento respetable para un hardware de gama media, y la cifra de 256 tok/s en modo agregado abre la puerta a aplicaciones en tiempo real que antes parecían reservadas para clústeres de GPU.

Implicaciones para el futuro de la IA local y la nube

El experimento tiene implicaciones directas para el debate sobre si la IA generativa puede ejecutarse de manera eficiente en dispositivos locales o si dependerá siempre de la nube. Si una sola DGX Spark puede lograr velocidades de 75 tok/s en tareas de edición, muchos usuarios podrían optar por soluciones propias en lugar de pagar por APIs de terceros, reduciendo costos y mejorando la privacidad.

Además, el hallazgo podría influir en las decisiones de compra de hardware: en lugar de adquirir las estaciones de trabajo más caras, los desarrolladores podrían optimizar su software para extraer el máximo rendimiento de equipos más asequibles. Esa es la lección que @0xBakeer quiso transmitir al responder a @SpoogemanGhost con un escueto “Apreciado”, agradeciendo el reconocimiento a su trabajo.

El caso también resalta la importancia de compartir hallazgos técnicos en redes sociales, ya que estas pruebas informales pueden tener un impacto inmediato en la comunidad. La discusión generada en torno a la publicación muestra que hay un interés creciente por entender los límites reales del hardware disponible y cómo el software puede empujarlos.

Aunque los resultados son impresionantes, conviene tomar las cifras con cautela porque provienen de un entorno no estandarizado y dependen de configuraciones específicas. Sin embargo, la tendencia es clara: la optimización de software está jugando un papel cada vez más importante en el rendimiento de los modelos de lenguaje, y los próximos avances podrían llegar tanto desde los fabricantes de chips como desde los ingenieros que escriben el código.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín