Un nuevo sistema de inferencia busca cambiar la economía de la IA local: según sus autores, FreeToken puede ejecutar modelos MoE de hasta 753B en equipos personales y superar ampliamente a herramientas como Ollama en velocidad y latencia.
***
- FreeToken afirma lograr una decodificación entre 3 y 4 veces más rápida que Ollama y un prefill entre 6 y 30 veces más veloz.
- El sistema adapta la carga entre CPU, GPU y memoria según el ancho de banda disponible, además de reutilizar estados semánticos entre turnos de agentes.
- Las pruebas reportan la ejecución de modelos de 35B en una laptop con GPU de 8 GB, de 284B en una PC gamer y de 753B en una estación de trabajo.
🚀 FreeToken revoluciona la IA local ejecutando modelos de hasta 753B en PCs comunes.
Ofrece decodificación de 3-4 veces más rápida que Ollama.
La tecnología permite implementar 20 modelos MoE, adaptando la carga entre CPU y GPU con una memoria optimizada.
Resultados:… pic.twitter.com/DqxC0PVm2g
— Diario฿itcoin (@DiarioBitcoin) August 24, 2026
Un equipo de investigadores presentó FreeToken, un sistema diseñado para ejecutar modelos de inteligencia artificial de tipo mezcla de expertos, conocidos como MoE, en computadoras personales. La propuesta intenta resolver uno de los principales obstáculos de la IA local: aunque estos modelos activan solo una fracción de sus parámetros por token, deben conservar un conjunto completo de expertos que suele exceder la memoria de una GPU de consumo.
Según Shuo Yang, uno de los autores del proyecto, FreeToken ofrece una decodificación entre 3 y 4 veces más rápida que Ollama, mientras que el procesamiento inicial del contexto, o prefill, puede ser entre 6 y 30 veces más veloz. Estas cifras proceden de comparaciones divulgadas por los autores y no deben interpretarse como una ventaja universal para cualquier modelo o configuración. El sistema atribuye esa diferencia a una ejecución adaptativa según el ancho de banda entre CPU y GPU, combinada con un mecanismo de caché semántico que reutiliza información entre los turnos de los agentes.
La investigación sostiene que la herramienta puede servir más de 20 modelos MoE y operar sobre equipos que van desde una laptop con una GPU de 8 GB hasta una estación de trabajo equipada con una GPU profesional de 96 GB. El código fue publicado por FlashML y el informe técnico describe una arquitectura que trata la computadora personal como una plataforma elástica de inferencia, en lugar de verla simplemente como una GPU pequeña.
El problema de ejecutar modelos gigantes en una PC
Los modelos de pesos abiertos han reducido la distancia de capacidad frente a algunos sistemas propietarios, pero todavía existe una brecha importante entre descargar sus parámetros y poder utilizarlos de forma sostenida. El informe señala que los modelos de frontera suelen depender de clústeres de GPU de centros de datos, cuyo costo y disponibilidad resultan poco accesibles para usuarios individuales y equipos pequeños.
Las arquitecturas MoE ofrecen una alternativa porque cada token activa solo algunos expertos dentro de un conjunto mucho mayor. El informe utiliza como ejemplo a DeepSeek-V4-Flash, que activa una fracción de sus expertos en cada token y moviliza cerca de 13B parámetros activos dentro de un modelo total de 284B.
Sin embargo, la activación dispersa no elimina la necesidad de almacenar el conjunto completo de expertos. Durante el procesamiento inicial de un contexto largo, las rutas de miles de tokens pueden cubrir casi todos los expertos, lo que obliga a mover grandes volúmenes de datos desde la memoria del sistema hacia la GPU a través de PCIe.
El problema se vuelve más visible en agentes que programan, utilizan herramientas o mantienen conversaciones prolongadas. Cada llamada a una herramienta puede modificar el historial y provocar un nuevo prefill, de modo que una solución rápida para la generación token por token no basta si el sistema pierde demasiado tiempo reconstruyendo el contexto.
Cómo funciona la ejecución adaptativa
FreeToken mantiene en la memoria del sistema el conjunto completo de expertos y utiliza la memoria de la GPU como una caché compartida. Cuando un experto solicitado ya está en la GPU, el sistema lo ejecuta directamente; cuando falta, decide en tiempo de ejecución si conviene transferirlo a la memoria gráfica o procesarlo en la CPU sin mover sus pesos.
La decisión depende de dos mediciones realizadas sobre el equipo donde se instala la herramienta: el ancho de banda efectivo de la transferencia por PCIe y el ancho de banda disponible para procesar expertos desde la memoria anfitriona. La política denominada q⋆ divide las ausencias entre ambas rutas para mantener ocupadas tanto la GPU como la CPU, en vez de forzar todos los expertos faltantes por un único camino.
El sistema también emplea una caché LRU global, cuya residencia cambia conforme el enrutador del modelo selecciona expertos durante la generación. La investigación sostiene que los tokens consecutivos suelen reutilizar expertos cercanos en el tiempo, por lo que una caché que sigue ese patrón puede reducir los fallos frente a una distribución estática fijada al iniciar el modelo.
Cuando la memoria disponible cambia porque el usuario abre un navegador, un juego u otra aplicación, FreeToken puede reconstruir la caché de expertos en un punto seguro del planificador. El conjunto completo de expertos en la memoria del sistema permanece como fuente de verdad, así que reducir la caché afecta el rendimiento, pero no la exactitud del cálculo.
Prefill, agentes y caché semántica
Para reducir la espera del primer token, FreeToken utiliza dos búferes de capas completas. Mientras la GPU calcula una capa, una corriente de transferencia carga simultáneamente los expertos de la siguiente, con el objetivo de ocultar el movimiento de datos detrás del cómputo en lugar de ejecutarlo de forma serial.
El informe estima que una implementación FP4 de DeepSeek-V4-Flash necesita transferir cerca de 140 GB de pesos expertos durante el prefill. Esa operación añadiría aproximadamente 2 segundos en un sistema RTX 5090 con PCIe 5.0 x16, unos 5 segundos en equipos de clase RTX 4090 o RTX 3090 con PCIe 4.0 x16 y 10 segundos o más en conexiones x8 habituales en laptops.
El segundo mecanismo aborda la recomputación de estados en arquitecturas con capas recurrentes o atención híbrida. FreeToken fija puntos de control en límites semánticos, como segmentos de razonamiento, llamadas a herramientas, resultados de herramientas y turnos de conversación, porque esas son las posiciones que los agentes suelen conservar, editar o truncar.
Si un agente elimina una sección del historial, el sistema busca el punto de control válido más profundo antes de la edición y vuelve a procesar únicamente el sufijo nuevo. Así, la caché de estados recurrentes y la reutilización del prefijo para las capas de atención pueden evitar que cada turno repita el cálculo de miles de tokens anteriores.
Causas de movimientos recientes
En este caso no corresponde hablar de un movimiento de mercado: FreeToken es una herramienta de software para inferencia local y el material disponible describe sus prestaciones técnicas, no una variación de precio o de cotización.
Resultados frente a otros motores
Las pruebas principales se realizaron con cuatro escenarios agentivos: problemas matemáticos AIME, un agente de programación mediante OpenCode, el mismo tipo de tarea mediante Claude Code y un agente de correo y calendario operado con OpenClaw. Los investigadores compararon FreeToken con llama.cpp, Ollama, KTransformers y MoE-Infinity, utilizando configuraciones de modelos y formatos de pesos alineados cuando cada motor lo permitía.
En una RTX 5090, FreeToken registró entre 77 y 83 tokens por segundo con Qwen3.6-35B-A3B y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash. El documento calcula ventajas de hasta 2,3 veces frente al rival más rápido en cada carga de trabajo, aunque advierte que algunos motores no pudieron ejecutar todos los modelos o escenarios.
La velocidad de decodificación se mantuvo dentro de un margen de 12% respecto al caso matemático de un solo turno en las tres cargas agentivas. En contraste, KTransformers perdió 31% de su velocidad inicial con DeepSeek-V4-Flash al pasar al escenario de programación de OpenCode, una diferencia que los autores relacionan con la sensibilidad de los motores al crecimiento y la edición del contexto.
La latencia del primer token mostró una separación mayor en los peores casos. FreeToken mantuvo el peor turno por debajo de 44 segundos en todas las celdas evaluadas, mientras que cada línea base superó 150 segundos al menos una vez; los máximos reportados fueron 232 segundos para llama.cpp, 179 segundos para Ollama y 946 segundos para KTransformers.
De una laptop de 8 GB a un modelo de 753B
El estudio también examinó cinco sistemas de consumo con distintas combinaciones de memoria, CPU y conexión PCIe. En una laptop con una GPU de 8 GB, la versión NVFP4 de Qwen3.6-35B-A3B alcanzó 39,3 tokens por segundo, una cifra equivalente a 92% del resultado obtenido con una RTX 4090 en la comparación presentada.
En una computadora de escritorio con RTX 5090, el cambio desde un servidor con más canales de memoria hacia una plataforma de consumo redujo el rendimiento de FreeToken apenas 4%. El documento afirma que llama.cpp retuvo solo 80% de su velocidad en ese cambio, debido a que sus expertos residentes en la CPU quedaron limitados por el ancho de banda de dos canales DDR5.
En una RTX 5090 de escritorio, FreeToken pudo ejecutar DeepSeek-V4-Flash, un modelo de 284B parámetros, a una velocidad descrita como interactiva. La importancia de esa demostración no está solo en la cifra de parámetros, sino en que el modelo completo supera ampliamente la memoria de la GPU y exige coordinar el almacenamiento de expertos con la generación de cada token.
La prueba de mayor escala utilizó GLM-5.2, un modelo de 753B parámetros y 40B activos, sobre una única GPU profesional RTX PRO 6000. FreeToken alcanzó 14,9 tokens por segundo frente a 7,3 de llama.cpp, mientras que la latencia media del primer token fue comparable, con 7,5 segundos para FreeToken y 7,8 segundos para llama.cpp.
Qué significa para la IA local
FreeToken no modifica los modelos ni sustituye expertos para reducir el tráfico, sino que intenta mantener exacto el cálculo original y cambiar la forma de atender los fallos de caché. Esa decisión lo diferencia de enfoques que utilizan versiones de menor precisión, omiten expertos o alteran el enrutamiento para ahorrar ancho de banda, aunque también deja al sistema expuesto a las limitaciones físicas de la memoria y las conexiones de cada equipo.
El informe reconoce que la herramienta todavía depende de condiciones específicas, como poder mantener el conjunto de expertos en la memoria del sistema y establecer rutas de transferencia compatibles con el sistema operativo y los controladores. Cuando no puede registrar toda la memoria para DMA, FreeToken ofrece una ruta de ejecución completamente basada en la CPU para los expertos, con una pérdida de rendimiento potencial.
La propuesta resulta especialmente relevante para agentes de programación y asistentes que encadenan llamadas a herramientas, porque esos usos combinan contextos extensos, turnos frecuentes y cambios semánticos en el historial. En ese entorno, la velocidad máxima de un modelo en una prueba aislada puede importar menos que la capacidad de sostener el rendimiento y evitar pausas prolongadas en cada nuevo turno.
Los autores plantean que el límite de la IA local dependerá cada vez menos de si un modelo cabe por completo en la VRAM y más de la eficiencia con que el software coordine CPU, GPU, memoria e interconexión. Si los resultados se reproducen en equipos de usuarios, la combinación de modelos abiertos y motores adaptativos podría ampliar el acceso a capacidades que hasta ahora estaban asociadas principalmente con centros de datos.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Anthropic enfrenta dudas por la adopción de su modelo Fable 5
Cadena de Suministros
El tungsteno se agota mientras el auge de la IA dispara la demanda de chips
Hardware
Nvidia elevaría más de 15% el precio de sus servidores de IA por el alza de la memoria
Computación Cuántica