Z.ai presentó GLM-5.3-Flash, un modelo multimodal de código abierto que se acerca al rendimiento de su hermano mayor con un costo muy inferior y que, según la empresa, opera completamente sobre chips de inteligencia artificial fabricados en China.
***
- GLM-5.3-Flash cuenta con 320.000 millones de parámetros, 18.000 millones activos y una ventana de contexto de un millón de tokens.
- Artificial Analysis le asigna 57 puntos en su Intelligence Index, cerca de los 60 puntos de GLM-5.3, pero con un costo de USD $0,09 por tarea.
- Z.ai sostiene que su software de serving triplicó el rendimiento del modelo sobre hardware chino y redujo la dependencia de Nvidia.
Z.ai presentó GLM-5.3-Flash como el primer modelo nativamente multimodal de la serie GLM-5, en un lanzamiento que combina una apuesta por el rendimiento, los precios bajos y la independencia tecnológica. El sistema reúne 320.000 millones de parámetros totales, aunque solo 18.000 millones permanecen activos durante una tarea, y ofrece una ventana de contexto de un millón de tokens. Sus pesos fueron publicados en Hugging Face bajo una licencia MIT, lo que permite a desarrolladores y empresas examinarlo, adaptarlo y desplegarlo con menos restricciones.
La propuesta llega en un momento en que los modelos chinos están aumentando la presión competitiva sobre los proveedores occidentales de inteligencia artificial. Más allá de los resultados de laboratorio, GLM-5.3-Flash busca resolver una pregunta estratégica para la industria: si un modelo avanzado puede ofrecer resultados comparables con una infraestructura distinta y a una fracción del precio, el acceso a capacidades de IA podría ampliarse rápidamente entre empresas y desarrolladores.
Rendimiento cercano al modelo más grande
Las mediciones de Artificial Analysis ubican a GLM-5.3-Flash en 57 puntos dentro de su Intelligence Index cuando utiliza el máximo esfuerzo de razonamiento. Esa cifra lo deja a solo tres puntos de GLM-5.3, el modelo más grande de la misma familia, que alcanzó 60 puntos, y lo sitúa en un nivel comparable al de GPT-5.6 Terra y Muse Spark 1.2, según la evaluación citada por The Decoder.
La diferencia más llamativa aparece en el costo asociado con esas capacidades. Artificial Analysis calculó un precio de USD $0,09 por tarea para GLM-5.3-Flash, frente a USD $0,68 para GLM-5.3, una brecha de aproximadamente 7,5 veces que coloca al nuevo sistema en una zona especialmente atractiva de la relación entre inteligencia y gasto. En términos empresariales, ese diferencial podría ser relevante para compañías que ejecutan grandes volúmenes de consultas, automatizaciones o procesos basados en agentes.
La API de Z.ai fija el precio de GLM-5.3-Flash en USD $0,15 por cada millón de tokens de entrada y USD $0,50 por cada millón de tokens de salida. Esos valores equivalen a poco más del 10% del precio de GLM-5.3, de acuerdo con los datos del lanzamiento, aunque el costo final de una implementación también dependerá del volumen de uso, la longitud de las respuestas y la infraestructura elegida por cada cliente.
En tareas agénticas, el modelo también mostró resultados competitivos. En GDPval-AA v2 obtuvo una puntuación Elo cercana a 1.770, igualando a GLM-5.3 y Grok 4.6, mientras que solo quedó por detrás de Claude Opus 5, según la comparación difundida por Artificial Analysis. Esa paridad no elimina las diferencias entre sistemas, pero sí refuerza la idea de que los modelos más económicos pueden desempeñarse en escenarios complejos sin replicar completamente el tamaño de los productos de mayor costo.
El costo oculto del razonamiento intensivo
El desempeño de GLM-5.3-Flash no implica que el modelo sea superior en todos los indicadores. Artificial Analysis observó que cerca del 90% de los tokens de salida consumidos por el sistema se destinó al razonamiento, una proporción que puede aumentar el consumo total aunque el precio por token sea bajo. Para los usuarios, esto significa que la tarifa publicada no debe confundirse automáticamente con el costo operativo de cada flujo de trabajo.
El uso intensivo de tokens de razonamiento puede resultar útil cuando una tarea exige planificación, verificación o varios pasos encadenados. Sin embargo, también puede generar respuestas más largas, mayor latencia y un gasto acumulado superior en aplicaciones que ejecutan miles de operaciones, especialmente cuando los agentes deben interactuar repetidamente con herramientas externas o revisar sus propios resultados.
La arquitectura de parámetros activos ayuda a explicar parte de la relación entre capacidad y eficiencia que presenta el modelo. GLM-5.3-Flash maneja 320.000 millones de parámetros totales, pero activa 18.000 millones durante una operación, una configuración que busca conservar una reserva amplia de conocimiento sin utilizar todos los componentes en cada consulta. Esa estructura puede favorecer el rendimiento económico, aunque la utilidad práctica dependerá también de la calidad del software que administra la inferencia.
La ventana de contexto de un millón de tokens constituye otra de sus características centrales. En teoría, permite procesar grandes volúmenes de información dentro de una misma interacción, desde documentos extensos hasta historiales complejos de trabajo, aunque una ventana amplia no garantiza por sí sola que el modelo aproveche cada fragmento con la misma precisión. En aplicaciones reales, la selección de contexto, la gestión de memoria y el diseño de instrucciones seguirán siendo factores decisivos.
Chips chinos y el desafío al dominio de Nvidia
Antes de su presentación oficial, Z.ai probó GLM-5.3-Flash de forma anónima bajo el nombre de ox-alpha en OpenCode y OpenRouter. El sistema se convirtió en el modelo más popular de la semana en esas plataformas y, según la empresa, todo ese tráfico se procesó utilizando chips de inteligencia artificial chinos, sin recurrir a hardware de Nvidia para sostener la operación.
SemiAnalysis informó que la infraestructura llegó a servir 100 billones de tokens diarios, una escala que hasta ahora se asociaba principalmente con laboratorios de frontera. Z.ai afirmó que su eficiencia de hardware y su costo por token se acercaron a los niveles habituales de las GPU de Nvidia, una afirmación relevante porque el desafío no consiste únicamente en fabricar aceleradores, sino en hacerlos funcionar de manera competitiva dentro de sistemas de producción.
El software de Z.ai se construyó sobre SGLang y dividió el procesamiento en etapas capaces de escalar de forma independiente. La compañía aseguró que ese enfoque triplicó el rendimiento respecto de su primer intento sobre el mismo hardware, mientras un agente basado en GLM-5.3 ayudó a optimizar el sistema. El resultado apunta a una conclusión importante para el mercado: una plataforma de IA puede obtener mejoras sustanciales al rediseñar el servicio, incluso sin cambiar físicamente los chips.
El episodio también vuelve a poner el foco en el llamado foso de CUDA, la capa de programación de Nvidia que conecta el software de inteligencia artificial con sus tarjetas gráficas. Esa tecnología acumula casi 20 años de desarrollo y la mayoría de los marcos de IA está optimizada para ella, por lo que migrar a otros aceleradores exige reprogramar operaciones, ajustar el acceso a memoria y localizar nuevos cuellos de botella.
Una competencia que se libra en precio e infraestructura
La aparición de GLM-5.3-Flash amplía la lista de modelos chinos que han ejercido presión sobre los precios de los proveedores occidentales. Su ventaja no depende exclusivamente de una puntuación elevada, sino de la combinación entre un resultado de 57 puntos, una licencia abierta, una ventana de contexto de un millón de tokens y tarifas de API significativamente menores que las de su hermano mayor.
Para las empresas, la posibilidad de elegir entre varios modelos con costos y capacidades distintas puede modificar la forma en que diseñan sus productos. Un sistema como GLM-5.3-Flash podría encargarse de tareas de alto volumen, clasificación, generación de código o procesos agénticos, mientras modelos más costosos quedarían reservados para operaciones que requieran un nivel superior de precisión o razonamiento.
La disponibilidad de los pesos en Hugging Face también cambia el cálculo frente a una API cerrada. Los desarrolladores pueden estudiar el modelo y evaluar despliegues propios, aunque la ventaja económica dependerá de la disponibilidad del hardware, del consumo energético, de la adaptación del software y de la capacidad técnica para mantener el servicio a escala. La licencia MIT facilita ese acceso, pero no elimina los costos de operación ni las decisiones de seguridad que acompañan a cualquier sistema avanzado.
Por ahora, las cifras deben leerse como resultados y afirmaciones asociados con evaluaciones concretas, no como una prueba definitiva de superioridad universal. El rendimiento puede variar según la tarea, el nivel de razonamiento y la infraestructura, mientras que el uso de chips chinos y software propio tendrá que demostrar consistencia a medida que aumenten las cargas. Aun con esas cautelas, GLM-5.3-Flash refuerza la presión sobre una industria que ya no compite únicamente por construir modelos más grandes, sino por ofrecer inteligencia útil al menor costo posible.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Privacidad
Android 17 activa una nueva capa de privacidad, pero no oculta por completo la navegación
Bitcoin
Sparrow Wallet actualiza su software tras recibir alertas de una herramienta de inteligencia artificial
Estados Unidos
Meta refuerza la privacidad de sus gafas inteligentes tras el escándalo de las grabaciones ocultas
Hardware