Por Canuto  

Un estudio del grupo Hazy Research de Stanford revela que la eficiencia de la IA local se multiplicó por 18 en 16 meses, gracias a mejoras en arquitectura y hardware. La nueva métrica ‘inteligencia por julio’ y los modelos híbridos prometen reducir costos de inferencia en la nube hasta un 80%.
***

  • La investigación presenta las métricas IPJ e IPW para medir la eficiencia de la IA local, y encuentra una mejora de 18x en IPJ entre 2024 y 2025.
  • Los avances en hardware (como NVIDIA B200 y SambaNova SN40L) aportaron 5,9x, mientras que las arquitecturas de modelos contribuyeron con 3,1x.
  • Un enfoque híbrido local-nube puede reducir el consumo de energía y costos entre 60 y 80% sin sacrificar calidad, según el estudio.
  • Los modelos locales alcanzaron un 88,7% de precisión en tareas de conversación y razonamiento de un solo turno.


Un estudio reciente del grupo Hazy Research de Stanford cambia las reglas del juego para la inteligencia artificial local: la eficiencia medida en inteligencia por julio se multiplicó por 18 en apenas 16 meses. El hallazgo, presentado en el artículo “Measuring Intelligence Efficiency of Local AI”, introduce dos métricas clave: Inteligencia por Julio (IPJ) e Inteligencia por Vatio (IPW).

IPJ se concibe como el equivalente a las millas por galón para modelos de IA que se ejecutan en hardware propio, mientras que IPW refleja cuánto trabajo útil produce un sistema por cada vatio de consumo continuo. La mejora de 18 veces en IPJ entre mediados de 2024 y finales de 2025 no surgió de un solo avance, sino de una combinación de mejoras en arquitectura y hardware.

El informe desglosa el progreso: las optimizaciones en arquitectura de modelos aportaron aproximadamente 3,1 veces de la ganancia, mientras que las mejoras en hardware y aceleradores proporcionaron un impulso de 5,9 veces. Estos factores, al multiplicarse, alcanzan el factor 18 que documenta el estudio, lo que equivale a un salto sin precedentes en la economía de la inferencia local.

La nueva métrica: inteligencia por julio

Para entender la magnitud del hallazgo, el grupo de Stanford plantea que ejecutar un modelo de lenguaje grande localmente solía ser tan costoso como calentar un apartamento con el motor de un transbordador espacial. Con la evolución reciente, esa ecuación cambió drásticamente, y la investigación ofrece una forma concreta de medirlo: IPJ y IPW.

La métrica IPJ cuantifica la cantidad de inteligencia (medida por precisión en tareas de conversación y razonamiento) que se obtiene por cada julio de energía consumida. Por otro lado, IPW mide la eficiencia sostenida durante la operación continua, lo que resulta crucial para aplicaciones que requieren actividad constante, como asistentes virtuales o procesamiento de datos en tiempo real.

El estudio evaluó una gama de chips, incluyendo NVIDIA Quadro RTX 6000, Apple M4 Max, NVIDIA B200 y SambaNova SN40L. Los aceleradores de IA creados específicamente para este propósito, como B200 y SN40L, superaron ampliamente al silicio de consumo general, como el Apple M4 Max, en todas las métricas de eficiencia. Al final del período evaluado, los modelos locales alcanzaron aproximadamente un 88,7% de precisión en consultas de conversación y razonamiento de un solo turno.

Hardware y arquitectura: la receta detrás del salto

El avance en eficiencia no proviene de una única innovación, sino de la sinergia entre mejoras en el diseño de los modelos y en el hardware que los ejecuta. En el lado de las arquitecturas, la investigación rastreó una progresión desde modelos como Mixtral-8x7B hasta variantes más nuevas de mezcla de expertos y modelos como gpt-oss-120b. Estos diseños enrutan el cálculo de manera más selectiva, activando solo los parámetros necesarios para una consulta determinada en lugar de encender toda la red cada vez, lo que reduce drásticamente el consumo energético.

En el ámbito del hardware, el artículo analizó chips que van desde la GPU NVIDIA Quadro RTX 6000 hasta los aceleradores de última generación NVIDIA B200 y SambaNova SN40L. La diferencia en eficiencia es notable: los aceleradores especializados logran procesar más operaciones por julio que los chips de uso general, lo que explica el 5,9x de mejora atribuido al hardware. Esta combinación de arquitectura eficiente y silicio especializado es lo que permite alcanzar el 18x total.

El estudio también publicó un banco de pruebas de perfilado alrededor de noviembre de 2025, brindando a los equipos una herramienta concreta para evaluar sus propias configuraciones frente a estas fronteras de eficiencia. Esto significa que las empresas pueden ahora medir sus propias implementaciones y compararlas con los nuevos estándares de rendimiento energético.

El modelo híbrido reduce costos hasta un 80%

Uno de los hallazgos con mayor impacto práctico es el potencial del enrutamiento híbrido local-nube. El artículo encontró que manejar las consultas más simples en el dispositivo y enviar solo las complejas a la nube puede reducir el consumo de energía, los requisitos de cómputo y los costos entre un 60% y un 80%, sin sacrificios significativos en la calidad de las respuestas.

Para ilustrar este punto, los investigadores del grupo Hazy Research plantearon un escenario concreto: si una empresa gasta USD $10 millones anuales en inferencia de IA en la nube, un enfoque híbrido bien implementado podría reducir esa cifra a entre USD $2 millones y USD $4 millones, ofreciendo resultados comparables. Esta proyección se basa en que las consultas simples suelen representar la mayoría del tráfico, y manejarlas localmente con modelos eficientes disminuye la carga y el costo de los servicios en la nube.

La métrica IPW mostró un aumento de 5,3 veces para la IA local en un período de dos años, lo que indica que las mejoras sostenidas en eficiencia energética también son una tendencia de largo plazo. Este dato refuerza la idea de que la inversión en hardware especializado y arquitecturas optimizadas es rentable, no solo por el ahorro inmediato en costos operativos, sino también por la reducción de la huella de carbono.

Implicaciones para la industria y próximos pasos

La investigación de Stanford no solo redefine la forma en que se mide la eficiencia de la IA, sino que también señala un camino claro para empresas que buscan reducir sus gastos en infraestructura de inteligencia artificial. Con la publicación del banco de pruebas de perfilado, los equipos técnicos pueden evaluar rápidamente sus propias configuraciones y adaptar sus arquitecturas para aprovechar estas mejoras.

El hecho de que los modelos locales alcancen casi el 89% de precisión en tareas conversacionales sugiere que la inferencia local es una alternativa viable para una amplia gama de aplicaciones, desde asistentes personales hasta sistemas de automatización en empresas. La reducción de costos del 60-80% asociada al enfoque híbrido es un argumento convincente para que las organizaciones reconsideren su dependencia de la nube para todas las operaciones de IA.

De cara al futuro, es probable que veamos una adopción creciente de estas métricas en la industria, así como un mayor desarrollo de hardware especializado en eficiencia energética. El estudio de Hazy Research de Stanford ofrece una guía práctica para navegar esta nueva ola de optimización, y demuestra que la inteligencia artificial local está lejos de ser una utopía; al contrario, se consolida como una opción rentable y sostenible.

Mientras tanto, las empresas que actualmente dependen exclusivamente de servicios en la nube para IA deberían prestar atención a estas cifras. La posibilidad de reducir facturas anuales en millones de dólares manteniendo la calidad es un incentivo poderoso para explorar la implementación de modelos locales y arquitecturas híbridas. El tiempo dirá cuántas organizaciones aprovecharán este avance, pero la evidencia presentada por Stanford es contundente.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín