Por Canuto  

Z.ai presentó GLM-5.3, un modelo que atribuye sus avances exclusivamente al postentrenamiento y que muestra un salto notable en programación, tareas agénticas y descubrimiento de vulnerabilidades. La empresa asegura que el sistema más que duplicó a GLM-5.2 en varios ejercicios de explotación y prepara una versión de pesos abiertos después de completar sus evaluaciones de seguridad.
***

  • GLM-5.3 mejoró de 4,6 a 28,3 en Terminal-Bench 3.0 y de 46,2 a 66,9 en DeepSWE v1.1 frente a GLM-5.2.
  • El modelo obtuvo 84,5% en CyberGym y completó 105 tareas de explotación en dos horas y 130 en seis horas.
  • Z.ai reportó 2.436 vulnerabilidades identificadas en 269 proyectos, con 1.097 problemas de severidad media a alta.


Z.ai presentó GLM-5.3 como una nueva generación de su familia de modelos de inteligencia artificial orientados a la programación y a las tareas agénticas de largo alcance. Según la empresa, el modelo utiliza la misma base que GLM-5.2 y todas sus mejoras provienen del postentrenamiento, una estrategia que amplía las capacidades mediante entornos, tareas y cómputo adicional sin modificar el modelo base.

El lanzamiento tuvo lugar el 14 de agosto de 2026 y coloca el foco en dos avances vinculados entre sí: una mayor capacidad para resolver trabajos complejos de ingeniería y la aparición de habilidades cibernéticas más sofisticadas. Z.ai también anunció que liberará los pesos del modelo aproximadamente dos semanas después, una vez que termine sus evaluaciones y medidas de protección de seguridad.

Un salto en programación agéntica

La compañía sostiene que GLM-5.3 es el modelo de pesos abiertos más capaz para programación y que obtuvo una mejora de 50% frente a GLM-5.2 en su benchmark interno Z.ai Code Bench. La evaluación busca representar escenarios de usuarios reales, con agentes colocados en entornos locales de desarrollo complejos y medidos tanto por la finalización integral de las tareas como por la precisión de listas de verificación detalladas.

En las pruebas públicas, GLM-5.3 pasó de 4,6 a 28,3 en Terminal-Bench 3.0 y de 46,2 a 66,9 en DeepSWE v1.1. También mejoró en Agents’ Last Exam, donde subió de 23,8 a 28,5, aunque los resultados de la tabla muestran que algunos modelos cerrados y de código abierto todavía mantienen ventajas en determinados ejercicios.

En Z.ai Code Bench, el modelo alcanzó una tasa de finalización de 34,5% en el nivel de esfuerzo máximo, con cerca de 75.000 tokens de salida por tarea, frente a 23,4% y 96.000 tokens de GLM-5.2. La empresa interpreta esa combinación como un avance simultáneo en rendimiento y eficiencia, porque el nuevo sistema resuelve más trabajo utilizando menos salida.

La comparación con modelos cerrados también resultó desigual, un matiz importante para interpretar la afirmación de liderazgo. En el nivel alto de esfuerzo, GLM-5.3 obtuvo 31,4% y superó a Claude Opus 4.8, con 29,5% y 120.000 tokens, pero permaneció por debajo de Claude Fable 5, que alcanzó 39,5% en el nivel máximo.

Entornos que imitan trabajo profesional

Para entrenar el modelo, Z.ai amplió sus entornos hacia tareas menos parecidas a ejercicios académicos y más cercanas a unidades reales de trabajo experto. Algunos escenarios pueden representar varios días de labores para un ingeniero experimentado, con acceso a clústeres de cómputo, almacenamiento, documentación interna, bases de código y resultados de experimentos.

En una tarea de infraestructura de aprendizaje automático, por ejemplo, el agente debe diagnosticar cuellos de botella a lo largo de toda la pila de entrenamiento, implementar optimizaciones, ejecutar experimentos y entregar una aceleración medible de extremo a extremo sin perder corrección. El objetivo consiste en que el sistema asuma responsabilidad sobre un trabajo completo, en lugar de depender de que el usuario divida el problema y supervise cada paso.

La empresa explicó que este enfoque desplaza parte de la dificultad desde el modelo hacia el entorno, que debe ser ejecutable, verificable y suficientemente cercano a la práctica profesional. Para ampliar la cantidad de escenarios, sus agentes de investigación recopilan patrones de trabajo real y los convierten en entornos de largo alcance con dependencias de varios pasos y estados ocultos.

Otro agente actúa como juez e intenta resolver cada tarea para comprobar que sea posible, mientras los verificadores se sintetizan sin acceso a la solución de referencia. Las trayectorias de los agentes ayudan a detectar atajos de recompensa, y los sistemas que superan las comprobaciones de oráculo, operación sin cambios y estado no resuelto pueden generar una recompensa binaria para el aprendizaje por refuerzo.

Capacidades cibernéticas y vulnerabilidades

El resultado más inesperado para Z.ai apareció en el área de ciberseguridad, después de incorporar datos y entornos de descubrimiento de vulnerabilidades en la mezcla de postentrenamiento. La empresa esperaba que GLM-5.3 identificara más fallos aislados, pero afirma que el modelo empezó a razonar a través de varias etapas de explotación y a construir planes coherentes para cadenas completas.

En CyberGym, una prueba que parte del código fuente y verifica si el agente puede identificar y validar vulnerabilidades mediante la activación de fallos, GLM-5.3 obtuvo 84,5%. Ese resultado superó el 77,2% de GLM-5.2 y quedó por encima de Mythos 5, con 83,8%, y GPT-5.6 Sol, con 83,6%, según la tabla divulgada por Z.ai.

La diferencia aumentó en ejercicios situados más arriba en la cadena de explotación. En ExploitBench, GLM-5.3 alcanzó 54,4%, más del doble que el 24,4% de GLM-5.2, aunque Mythos 5 y GPT-5.6 Sol registraron 78% y 76,5%, respectivamente.

ExploitGym mostró un patrón similar al medir la cantidad de tareas completadas bajo presupuestos de tiempo normalizados: GLM-5.3 resolvió 105 en dos horas y 130 en seis horas, frente a 29 y 39 de GLM-5.2. Mythos 5 siguió ampliamente por delante, con 181 y 247 tareas, mientras que la metodología ajustó los resultados según la velocidad de generación de cada modelo.

La compañía después probó sus capacidades contra bases de código reales junto con varios equipos de seguridad en China. Tras revisiones de expertos, filtrado y deduplicación, Z.ai reportó 2.436 vulnerabilidades en 269 proyectos, incluidos 1.097 problemas de severidad media a alta que abarcan kernels, sistemas operativos, navegadores, infraestructura de código abierto, aplicaciones web y protocolos de red.

Z.ai indicó que algunos fallos habían permanecido sin detectar durante años o décadas, y que el más antiguo se remontaba a 1981. El registro reportado incluye 107 vulnerabilidades críticas, 990 altas, 1.286 medias y 53 bajas, con una antigüedad promedio de 26,6 años antes del descubrimiento.

La empresa creó un Security Disclosure Ledger para seguir el proceso de divulgación y separar los hallazgos públicos de aquellos que permanecen bajo embargo. El registro contempla el proyecto afectado, la severidad, el CVE cuando existe y el tiempo durante el cual la vulnerabilidad permaneció en el código, aunque Z.ai aclaró que el esfuerzo de divulgación continúa.

La infraestructura detrás del postentrenamiento

GLM-5.3 funciona sobre slime, un framework de código abierto para escalar el aprendizaje por refuerzo, con Megatron en el entrenamiento y SGLang en la generación de trayectorias. Su diseño conecta entrenamiento, generación y almacenamiento de datos en un flujo único, de modo que las matemáticas, los sandboxes, los verificadores y los entornos agénticos se incorporan como generación de datos.

La arquitectura permitió añadir nuevos entornos entre GLM-5.2 y GLM-5.3 sin reconstruir toda la pila de entrenamiento. Z.ai también incorporó técnicas como top-p mask, OPD de top-k y vocabulario completo, además de configuraciones destinadas a mejorar la consistencia entre las rutas de entrenamiento y de generación.

En sus pruebas de consistencia, la diferencia promedio de log probabilities quedó controlada en el nivel de 1e-7, lo que, de acuerdo con la empresa, representa una reducción superior a 99,99% frente a configuraciones anteriores. Ese control busca dar mayor precisión al muestreo, al entrenamiento y al uso de señales provenientes de varios modelos profesores.

El sistema también utiliza almacenamiento local como una capa adicional de caché para conservar estados del modelo y datos que de otro modo ocuparían memoria del host. Con conmutación dinámica de profesores y precarga en el entrenamiento, Z.ai afirma que puede reducir recursos al ejecutar esquemas de varios profesores sin mantener un servicio de inferencia dedicado para cada uno.

Para cargas agénticas y asíncronas, la empresa mejoró la programación conjunta y el balanceo de carga entre el enrutador y slime. Las heurísticas consideran las características de cada entorno para ajustar la relación entre prefilling y decodificación, la concurrencia y otros parámetros de rendimiento; en tareas de programación de largo alcance, estas optimizaciones elevaron más de 2,3 veces el rendimiento integral del aprendizaje por refuerzo.

Acceso, migración y próximos pasos

GLM-5.3 está disponible para los usuarios del GLM Coding Plan y puede utilizarse mediante ZCode, Claude Code, OpenCode y otras herramientas de programación compatibles. El plan incorporó un sistema de cuotas basado en puntos, con cálculo separado para tokens de entrada, entradas en caché y salidas del modelo.

Las llamadas realizadas fuera de las horas pico consumen 50% de los puntos estándar, mientras que el horario pico se ubica entre las 14:00 y las 18:00, de lunes a viernes, en la zona UTC+8. El resto del tiempo, incluidos los fines de semana, recibe la tarifa reducida anunciada por la compañía.

La interfaz de programación de aplicaciones del modelo admite los niveles de esfuerzo low, high y max, con max como configuración predeterminada y recomendada para programación. GLM-5.3 ya no permite desactivar el razonamiento, por lo que las aplicaciones que utilizaban thinking.type con valor disabled deben cambiarlo a enabled y establecer reasoning_effort en low antes de actualizar el identificador del modelo.

La migración es obligatoria porque, según Z.ai, las solicitudes que conserven la configuración anterior fallarán. La empresa también promociona en ZCode una tasa de aciertos de caché superior a 98%, un impulso temporal de cuota de 1,5 veces hasta el 31 de agosto y un modo Goal capaz de planificar, programar, probar y verificar tareas de larga duración.

La liberación local de los pesos queda prevista para aproximadamente dos semanas después del lanzamiento, condicionada a la finalización de las evaluaciones y las protecciones de seguridad. El anuncio deja abierta una competencia especialmente intensa: GLM-5.3 mejora con claridad a su antecesor, pero sus propios datos muestran que los modelos cerrados todavía conservan ventajas relevantes en explotación avanzada y en algunas pruebas de programación.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín