Meta presentó Muse Glimmer, un modelo agente multimodal de aproximadamente 30B parámetros que combina 128K de contexto, visión y herramientas de aceleración para operar localmente en equipos con 24 GB de VRAM.
***
- Muse Glimmer utiliza pesos abiertos y se distribuye bajo la licencia Apache 2.0, con versiones cuantizadas para equipos con 24 GB y 32 GB de VRAM.
- Su arquitectura combina GQA, atención local y global, un codificador visual y destilación on-policy para enfrentar tareas largas.
- El componente DFlash elevó la decodificación de aproximadamente 74,9 a 233,4 tokens por segundo en una RTX 5090, aunque el modelo aún queda detrás de otros sistemas en algunas pruebas de GUI.
Un agente diseñado para ejecutarse localmente
Meta presentó Muse Glimmer, un modelo agente multimodal de aproximadamente 30B parámetros que puede procesar texto, imágenes e información de pantalla, además de llamar herramientas y ejecutar código. Según la información difundida por KuCoin, el sistema admite una ventana de contexto de 128K tokens y apunta a funcionar en dispositivos con 24 GB de memoria de video, una combinación orientada a llevar tareas agénticas de larga duración a equipos personales.
El lanzamiento se distingue porque no plantea a Muse Glimmer como un chatbot convencional, sino como una pieza para construir agentes locales capaces de interactuar con entornos cambiantes. El modelo se distribuye bajo la licencia Apache 2.0 y ofrece pesos abiertos, con dos versiones cuantizadas de 4 bits, mientras que sus opciones de despliegue contemplan herramientas como llama.cpp, MLX y ExecuTorch.
En este contexto, un agente no se limita a responder una pregunta, sino que observa un entorno, decide el siguiente paso, utiliza una herramienta y vuelve a evaluar el resultado. Una investigación puede exigir búsquedas sucesivas, un flujo de código puede producir errores y una página web puede cambiar después de cada clic, por lo que el sistema debe conservar la lógica de la tarea mientras incorpora nuevos estados.
Meta diseñó Muse Glimmer a partir de esa presión de ingeniería: mantener el contexto, interpretar capturas de pantalla, recuperarse de desvíos y responder con suficiente rapidez dentro de una GPU de consumo. El resultado no pretende demostrar que un modelo local de 30B reemplaza a los sistemas de frontera en la nube, sino que una arquitectura coordinada puede hacer más viable el despliegue privado de agentes.
Cómo administra la memoria y el contexto
Muse Glimmer utiliza 52 capas de Transformer denso, un tamaño oculto de 6.656 y 32 cabezas de consulta, pero conserva solamente dos cabezas de clave y valor. Esta configuración, conocida como GQA, reduce la cantidad de pares que deben almacenarse en la caché KV, un componente cuya demanda de memoria crece a medida que el modelo procesa conversaciones y trayectorias más extensas.
La arquitectura también alterna tres capas de atención local con una capa de atención global. Las capas locales observan una ventana cercana de aproximadamente 2.048 tokens, mientras las globales permiten intercambiar información a mayores distancias; de las 52 capas, 39 son locales y 13 globales, una distribución que limita el número de capas obligadas a conservar todo el historial.
Una estimación teórica basada en los parámetros publicados sitúa la caché KV en cerca de 1,7 GiB cuando el contexto alcanza 128K, aunque esa cifra no representa una medición oficial de memoria en ejecución. Con atención tradicional y pares independientes para las 32 cabezas, el mismo cálculo podría superar los 20 GiB, de modo que GQA y la atención local resultan decisivas para que el modelo pueda convivir con sus propios pesos dentro de una GPU de 24 GB.
La compresión completa el esquema. La versión K Quant 17GB ocupa aproximadamente 16,8 GB, el módulo visual ronda 1,4 GB y DFlash cerca de 1,6 GB, mientras que una variante Dynamic K Quant cercana a 20 GB está orientada a equipos con 32 GB de VRAM; Meta reporta una pérdida promedio aproximada de 1,0% para la primera y de 0,2% para la segunda en 15 benchmarks.
Visión, estados y recuperación de errores
El componente visual incorpora un ViT-G 14 Perception Encoder de aproximadamente 1.800 millones de parámetros para interpretar capturas de pantalla, páginas web, gráficos y documentos. Una imagen puede transformarse en hasta 4.096 tokens visuales, y el modelo acepta entradas de texto e imagen con salida textual, en lugar de integrar todas las modalidades en un único sistema generativo.
Dentro de un flujo de uso de computadora, el agente observa la pantalla, identifica botones, texto y posiciones, y después ejecuta una acción. Cuando el entorno cambia, recibe otra captura y decide cómo continuar, una dinámica que puede llenar rápidamente el contexto si una tarea de 40 pasos conserva cada imagen completa desde el inicio.
El contexto de 128K ofrece un espacio de trabajo mayor, pero no equivale a una memoria ilimitada ni resuelve por sí mismo los conflictos entre estados antiguos y actuales. Meta no conserva un historial indefinido de capturas en OSWorld Verified, sino que mantiene las más recientes, lo que muestra que la percepción visual y la gestión del contexto son problemas distintos.
El entrenamiento intenta abordar también los errores de ejecución. Muse Glimmer fue destilado del modelo más grande Muse Spark mediante etapas de preentrenamiento, entrenamiento medio y postentrenamiento; en esta última se combinan ajuste supervisado, destilación on-policy y aprendizaje por refuerzo, mientras la destilación on-policy expone al modelo a estados desviados que puede encontrar durante sus propios recorridos.
Velocidad, benchmarks y límites del modelo
La destilación on-policy permite que el estudiante reciba supervisión después de visitar estados que no coinciden con la trayectoria ideal del modelo profesor. Esta estrategia busca mejorar la recuperación tras una llamada de herramienta incorrecta, un mensaje de error o una interacción equivocada con una página, porque el agente debe reconocer que el estado cambió antes de elegir una nueva ruta.
Muse Glimmer ofrece cuatro niveles de fuerza de razonamiento: bajo, medio, alto y xhigh. Los niveles superiores pueden elevar la tasa de éxito en tareas complejas, pero también generan más tokens, expanden el contexto y prolongan la decodificación, un costo especialmente visible cuando el agente mantiene cadenas de pensamiento extensas durante miles de pasos.
Para reducir esa latencia, Meta incorporó DFlash, un acelerador basado en difusión por bloques que predice en paralelo grupos de 16 tokens. El componente reutiliza representaciones ocultas de las capas 1, 13, 25, 37 y 49 del modelo principal, las inyecta en las capas de clave y valor de un redactor de cinco capas y prioriza los tokens iniciales de cada bloque, ya que un error temprano reduce la aceptación consecutiva.
En una RTX 5090, Meta reporta que la versión K Quant 17GB pasó de aproximadamente 74,9 a 233,4 tokens por segundo con DFlash. Para una tarea que acumule 10.000 tokens, esa diferencia equivale, únicamente en decodificación, a reducir el tiempo estimado de cerca de 134 segundos a unos 43, aunque el resultado real también depende del prellenado, la red y la ejecución de herramientas.
El modelo muestra un desempeño destacado en MCP Atlas, DeepSearch QA y Gaia2, pruebas que exigen seleccionar herramientas, investigar en varias etapas o interactuar con aplicaciones con estado. Sin embargo, en OSWorld Verified obtuvo 65,9 frente a 75,6 de Qwen3.6 27B, y en TerminalBench 2.1 registró 51,7 frente a 60,7, una brecha que revela debilidades en interfaces gráficas puras, terminales y ciertos flujos de programación.
Meta advierte que estas comparaciones dependen del prompt del sistema, la definición de herramientas, el andamiaje de ejecución, el máximo de pasos, los parámetros de muestreo y el modelo utilizado como juez. La empresa también señala que las herramientas y prompts empleados con modelos de terceros podrían no estar optimizados para cada sistema, por lo que un ranking aislado no captura toda la capacidad agéntica.
Privacidad y próximos desafíos
La ejecución local puede reducir el envío frecuente de archivos, capturas de pantalla y contexto privado a servidores externos, una ventaja relevante para usuarios y organizaciones que manejan información sensible. No obstante, esa protección se limita a la ruta de los datos: la inyección de prompts, las llamadas erróneas a herramientas, la escalada de privilegios y las acciones irreversibles continúan representando riesgos.
Meta evaluó por separado el riesgo agéntico, la privacidad y la inyección de prompts, y recomienda reforzar los guardarraíles junto con controles humanos para los despliegues reales. Un agente que puede ejecutar código o interactuar con una interfaz necesita permisos acotados, supervisión y mecanismos de interrupción, incluso cuando sus datos permanezcan dentro del dispositivo.
La propuesta de Muse Glimmer une decisiones que normalmente se analizan por separado: GQA y atención local reducen la memoria asociada al contexto, la cuantización comprime los pesos, el codificador visual interpreta el entorno, la destilación on-policy aborda las desviaciones y DFlash acelera la generación. La fuerza de razonamiento, además, permite que los desarrolladores ajusten el presupuesto de cómputo según la complejidad de la tarea.
El lanzamiento sugiere una hoja de ruta para agentes privados capaces de operar de manera prolongada en hardware accesible. Muse Glimmer todavía no elimina la ventaja de los modelos insignia basados en la nube, pero muestra que la combinación de memoria, contexto, percepción del estado y velocidad de inferencia puede acercar ese objetivo a una implementación local más práctica.
El desafío siguiente será convertir esa capacidad técnica en confiabilidad sostenida, especialmente cuando las tareas acumulen errores, pantallas contradictorias y decisiones con consecuencias reales. La promesa de que cada usuario pueda tener su propio agente privado dependerá tanto del rendimiento como de la seguridad con que ese agente actúe fuera de una demostración controlada.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Biohacking
Senolíticos reducen microglía dañina del cerebro envejecido en ratones
AltCoins
Render cae un 1% mientras el volumen se dispara un 41%: análisis de RENDER al 28 de agosto de 2026
IA
OpenAI priorizaría Codex sobre Sora por la eficiencia de sus GPU
Empresas