El código creado por inteligencia artificial compila casi siempre, pero su seguridad permanece estancada: solo 56% de las pruebas supera los controles, mientras el volumen de código generado crece rápidamente.
***
- La tasa promedio de aprobación de seguridad pasó de 55% a 56% y permanece prácticamente sin cambios durante un año.
- Los modelos de razonamiento lograron 56%, mientras los especializados en programación marcaron 51%, sin ventaja frente a los modelos generales.
- Java, las inyecciones de scripts entre sitios y las inyecciones de registros concentran algunos de los peores resultados.
La inteligencia artificial ya puede producir código compilable con una consistencia cercana al 100%. Sin embargo, esa capacidad técnica no se ha traducido en una mejora equivalente de seguridad, según el Informe de Seguridad de Código GenAI 2026 de Veracode.
El estudio evaluó más de 100 modelos en cuatro momentos. La tasa promedio de aprobación en seguridad llegó a 56%, apenas por encima del 55% registrado al comienzo de la medición.
El resultado adquiere mayor importancia porque la IA genera aproximadamente la mitad de todo el código comprometido. La proporción de fallos no cambia de forma significativa, pero el volumen de código producido por estas herramientas sí aumentó.
La sintaxis avanza, la seguridad permanece rezagada
Las pruebas muestran una diferencia clara entre escribir código que funciona y escribir código que resiste ataques. Sin una instrucción específica sobre seguridad, los modelos generan código que compila casi el 100% de las veces.
Cuando la tarea exige evitar vulnerabilidades, los sistemas fallan cerca del 44% de las veces. Esos errores incluyen problemas pertenecientes al Top 10 de OWASP, una referencia ampliamente utilizada para clasificar los riesgos más comunes del software.
Chris Wysopal, cofundador y evangelista de seguridad de Veracode, describió la brecha como una señal de alarma para las organizaciones. Según su declaración, los modelos pueden ser casi perfectos desde el punto de vista sintáctico y aun así fallar en casi la mitad de las tareas que requieren seguridad.
El dato no significa que 44% del código generado por IA llegue directamente a producción con una vulnerabilidad. Las pruebas analizaron modelos en bruto, sin agentes, controles automatizados ni revisión humana dentro del proceso.
En una cadena de desarrollo real, los escáneres, las herramientas de corrección, los agentes y los equipos de seguridad pueden añadir barreras antes del despliegue. Por eso, el 56% representa la capacidad de los modelos para evitar fallos en la prueba, no la tasa final de software vulnerable en producción.
El tamaño del modelo no garantiza mejores resultados
El informe también cuestiona la idea de que un modelo creado específicamente para programar debe ser necesariamente más seguro. Los modelos especializados en codificación promediaron 51% de aprobación.
Los modelos de propósito general lograron 52%, una cifra ligeramente superior. La diferencia no respalda la elección automática de una herramienta especializada como estrategia suficiente para reducir riesgos.
El tamaño tampoco cerró la brecha. Los modelos grandes alcanzaron 53%, mientras que los modelos medianos y pequeños registraron 51% en ambos casos.
Estos resultados sugieren que añadir parámetros o elegir una arquitectura enfocada en programación no resuelve por sí solo los problemas de seguridad. La generación de código requiere controles específicos, incluso cuando el modelo ofrece respuestas técnicamente sofisticadas.
El único factor que movió con mayor claridad el resultado fue el razonamiento. Los modelos de razonamiento promediaron 56%, frente a 51% en el resto del grupo, lo que apunta a una posible revisión interna antes de entregar la respuesta final.
GPT-5.5 encabeza una clasificación todavía insuficiente
El GPT-5.5 de OpenAI lideró esta ronda con una aprobación de 68%. Aunque se trata del mejor resultado entre los modelos evaluados, todavía implica fallos en casi un tercio de las tareas de seguridad.
La marca también representa un retroceso frente al líder del año anterior, que había alcanzado 72%. La parte superior de la clasificación, por tanto, no muestra una mejora sostenida en el período analizado.
Seis de los 11 modelos probados se concentraron entre 50% y 53%. El Qwen3.7-max de Alibaba quedó en el último lugar, con 50%, lo que equivale a presentar una vulnerabilidad en cada salida evaluada.
La clasificación incorporó además una mayor diversidad geográfica. El Kimi-K2.6 de Moonshot y el MiMo-V2.5 de Xiaomi superaron a varios modelos occidentales incluidos en la comparación.
La procedencia de los modelos se convierte así en otro elemento para los equipos de adquisición. El rendimiento de seguridad no depende únicamente de la marca, el tamaño o la especialización declarada de cada sistema.
Java y las inyecciones exponen las mayores debilidades
Los promedios generales ocultan diferencias importantes entre lenguajes de programación. Python obtuvo una aprobación de 63%, mientras Java llegó apenas a 30%.
Java fue, con mucha diferencia, el lenguaje más riesgoso dentro de la evaluación. Al mismo tiempo, fue el único lenguaje que mostró una trayectoria claramente ascendente durante el período observado.
Las diferencias también fueron pronunciadas según el tipo de vulnerabilidad. Los modelos respondieron razonablemente bien ante las inyecciones SQL y la criptografía débil, con tasas de aprobación de 83% y 87%, respectivamente.
El desempeño cayó de forma drástica frente a las inyecciones de scripts entre sitios y las inyecciones de registros. Las tasas de aprobación fueron de apenas 15% y 12%, en ese orden.
Estos riesgos no representan casos anecdóticos dentro del desarrollo cotidiano. El informe indica que los modelos apenas reconocen esas vulnerabilidades, un problema relevante para equipos que integran generación automática en aplicaciones, servicios y herramientas empresariales.
El volumen transforma una debilidad técnica en un riesgo empresarial
La tasa de fallos podría parecer manejable si la IA produjera una fracción pequeña del código de una organización. Esa premisa perdió fuerza a medida que las herramientas comenzaron a participar en una parte mucho mayor del desarrollo.
Según el informe, la IA escribe aproximadamente la mitad de todo el código comprometido. La velocidad de producción supera la capacidad de los equipos de seguridad para revisar cada fragmento manualmente.
El problema combina una tasa de fallos estable con un volumen creciente. Como consecuencia, una proporción constante de errores puede traducirse en un número absoluto cada vez mayor de vulnerabilidades potenciales.
La situación también afecta la promesa de que la IA se paga por sí misma mediante mayor productividad. Si las empresas deben revisar, escanear y corregir una cantidad creciente de código, parte del ahorro inicial puede trasladarse a los controles de seguridad.
El informe llega en un contexto de preocupación más amplia sobre la expansión de la superficie de ataque. Veracode tiene un interés comercial evidente, porque vende herramientas para escanear y corregir código, pero los datos provienen de un estándar comparable aplicado de la misma manera durante un año.
Los controles deben acompañar a la generación automática
La evaluación no plantea como respuesta limitar el acceso a los modelos. Wysopal defendió una estrategia basada en seguridad transparente y evidencia verificable.
El ejecutivo resumió el enfoque en tres acciones: escanear el código, corregir los problemas y nunca enviarlo a producción sin revisión. La recomendación mantiene abierta la posibilidad de utilizar modelos potentes, pero exige controles alrededor de ellos.
La conclusión resulta especialmente relevante para empresas que utilizan agentes de programación. Estos sistemas pueden producir cambios rápidamente, pero también acumular errores si carecen de validaciones independientes antes de modificar un proyecto.
La revisión humana sigue siendo una capa importante, aunque no puede actuar como único mecanismo de defensa ante un volumen elevado. Los escáneres automatizados y los procesos de integración deben identificar los fallos que los modelos no detectan.
La brecha entre sintaxis y seguridad permanece abierta después de un año de mediciones. Mientras los modelos no razonen sobre seguridad con la misma eficacia con la que resuelven la compilación, las barreras del flujo de trabajo seguirán siendo indispensables.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Bancos y Pagos
Bebunk enfrenta una supuesta filtración de 12.324 clientes con IBAN y datos KYC
Asia
SMSA Express enfrenta una supuesta filtración de 124,7 millones de registros de envíos
IA
Microsoft y Wiz combinan agentes de IA y detectan más del 90% de las vulnerabilidades
Educación