Microsoft y Wiz demostraron que combinar varios modelos de IA puede superar a los sistemas individuales en la detección y corrección de vulnerabilidades, además de reducir costos operativos.
***
- MDASH de Microsoft alcanzó una tasa de éxito de 95,95% en CyberGym, mientras Project Atlas de Wiz logró 90,9%.
- Atlas identificó más de 200 vulnerabilidades de día cero en software de código abierto ampliamente utilizado.
- Ambas compañías sostienen que asignar cada tarea al modelo más capaz mejora el rendimiento y puede reducir los costos hasta 50%.
Microsoft y Wiz concluyeron que dos mentes artificiales pueden encontrar y remediar más vulnerabilidades que un único modelo. Sus sistemas de agentes alcanzaron resultados superiores al 90% en CyberGym, una referencia para medir la detección de fallas reales en código.
Project Atlas, desarrollado por Wiz, obtuvo una tasa de éxito de 90,9% en esa evaluación. La compañía también informó que el sistema descubrió más de 200 agujeros de seguridad de día cero en software de código abierto ampliamente utilizado.
Por su parte, Microsoft afirmó que su arnés de búsqueda de errores MDASH alcanzó un 95,95% de éxito en CyberGym. El sistema superó en el mismo punto de referencia a Mythos, Gemini y GPT.
Los resultados reflejan una disputa tecnológica que también afecta a la seguridad de aplicaciones financieras, plataformas empresariales y proyectos de infraestructura digital. Para los equipos que protegen servicios conectados, cada vulnerabilidad sin identificar puede convertirse en una ruta de ataque.
La información fue reportada por The Register, que detalló las cifras, los modelos utilizados y las declaraciones de ejecutivos de Microsoft y Wiz. El anuncio llega en un momento de rápida evolución para los agentes capaces de investigar, explotar de forma controlada y corregir errores de software.
Dos sistemas con una estrategia común
El elemento compartido por Atlas y MDASH es la coordinación de varios modelos. En lugar de entregar todo el proceso a una sola inteligencia artificial, ambos sistemas asignan cada fase al modelo que ofrece mejores resultados en esa tarea.
Nir Ohfeld, jefe de investigación de vulnerabilidades en Wiz, explicó que Atlas utiliza Claude Opus 4.6 junto con GPT-5.5. La compañía trabaja además en incorporar Gemini, después de su reciente colaboración con DeepMind en Gemini Flash Cyber.
Atlas todavía no está disponible comercialmente. Wiz lo utiliza internamente para estudiar cómo los modelos de vanguardia pueden aplicarse al escaneo avanzado de código y a la investigación automatizada de vulnerabilidades.
El sistema de Wiz evalúa los modelos mediante Cyber Model Arena, una herramienta interna que califica tareas de modelado de amenazas, búsqueda, validación y generación de pruebas. Sus responsables aseguran que los resultados varían de una capacidad a otra.
Un modelo que razona mejor sobre una cadena de explotación compleja no necesariamente clasifica con mayor precisión los hallazgos. Atlas intenta resolver esa diferencia al dirigir cada etapa hacia el modelo que obtiene el mejor desempeño en esa función.
El diseño de agentes de Microsoft
MDASH combina agentes de equipo rojo y agentes de equipo verde. Los primeros buscan vulnerabilidades, simulan ataques explotables y trazan posibles rutas de intrusión, mientras los segundos intentan remediar los problemas encontrados.
El sistema utiliza MAI-Cyber-1-Flash, basado en el modelo de razonamiento interno MAI-Thinking-1 desarrollado por Microsoft AI. También integra GPT-5.4 para atender tareas que requieren capacidades más amplias.
Microsoft diseñó MAI-Cyber-1-Flash para cubrir hasta el 90% de las tareas. Cuando el sistema identifica un caso más complejo, MDASH transfiere el 10% restante a GPT-5.4.
Hayete Gallot, vicepresidenta ejecutiva de Microsoft Security, afirmó que la compañía logró resultados líderes al combinar un modelo disponible en el mercado con un arnés de múltiples agentes y múltiples modelos. La arquitectura busca aprovechar la especialización de cada componente.
El enfoque no se limita a encontrar un error. MDASH intenta detectarlo, aplicar un parche y validar la solución antes de cerrar el proceso, una secuencia que puede reducir la distancia entre identificar una falla y confirmar que dejó de ser explotable.
Resultados frente a otros modelos
En CyberGym, GPT-5.5 Cyber de OpenAI alcanzó una tasa de éxito de 85,6%. GPT-5.6 Sol obtuvo 83,6%, cifras inferiores a las registradas por Atlas y MDASH en el mismo entorno de evaluación.
Mythos 5 de Anthropic reprodujo la vulnerabilidad objetivo en 83,8% de los desafíos. El resultado también quedó por debajo de los dos sistemas coordinados presentados por Wiz y Microsoft.
Gemini 3.5 Cyber, integrado en CodeMender de Google, logró una tasa de éxito de 83,2%. La comparación muestra que un modelo individual puede quedar atrás cuando un sistema selecciona distintas herramientas para fases específicas de una investigación.
Wiz sostiene que ningún modelo es el mejor en todas las tareas y que ninguno permanece en la cima durante mucho tiempo. La empresa analiza cada nuevo modelo con evaluaciones internas para determinar dónde puede aportar mayor valor.
Estas cifras deben interpretarse dentro del alcance de CyberGym y de las metodologías empleadas por sus desarrolladores. Una tasa elevada en un punto de referencia no garantiza que un sistema encuentre todas las fallas en cada repositorio real, pero sí permite comparar capacidades bajo condiciones comunes.
Menores costos y vigilancia continua
La coordinación de modelos también tiene una justificación económica. Microsoft y Wiz sostienen que usar un modelo interno más pequeño para la mayoría de las tareas permite reservar los sistemas más costosos para los casos que realmente necesitan razonamiento avanzado.
Mustafa Suleyman, CEO de Microsoft AI, afirmó que la combinación puede reducir a la mitad los costos para los clientes. Según su declaración, los modelos se transfieren el trabajo y ofrecen un rendimiento superior al de los sistemas individuales con un costo 50% menor.
Ohfeld advirtió que cada nueva generación de modelos amplía lo que puede hacerse, pero también incrementa los gastos asociados. Apuntar un modelo de frontera a una base de código una sola vez no constituye una estrategia de seguridad sostenible.
Los escaneos profundos pueden ser costosos y sus resultados pierden vigencia cuando el código cambia continuamente. Por esa razón, un análisis puntual no ofrece por sí solo la cobertura permanente que las organizaciones necesitan en cada repositorio.
La visión de Wiz apuesta por una arquitectura que pueda incorporar modelos nuevos sin reconstruir todo el sistema. La empresa busca combinar razonamiento experto donde sea necesario, automatización en las tareas repetitivas y validación rigurosa para que cada hallazgo llegue acompañado de evidencia.
Implicaciones para la seguridad del software
El avance de estos agentes puede acelerar la identificación de errores en bibliotecas y aplicaciones utilizadas por miles de organizaciones. También puede aumentar la presión sobre los equipos de desarrollo, que tendrían que revisar y corregir un volumen mayor de vulnerabilidades.
La posibilidad de simular rutas de ataque y validar parches añade una capa de verificación al proceso. Sin embargo, los resultados dependen de la calidad del código analizado, de los datos disponibles y de la capacidad del sistema para distinguir una vulnerabilidad real de una alerta incorrecta.
El hallazgo de más de 200 vulnerabilidades de día cero por parte de Atlas ilustra el potencial de estas herramientas. Al mismo tiempo, demuestra que el uso de agentes en seguridad puede revelar problemas que permanecieron ocultos durante años en proyectos ampliamente desplegados.
La automatización no elimina la necesidad de investigadores humanos. Los expertos todavía deben priorizar riesgos, coordinar divulgaciones, evaluar el impacto de los parches y decidir cómo responder cuando una falla afecta componentes críticos.
La pregunta central, según Ohfeld, no es qué modelo utiliza un escáner. El desafío consiste en aprovechar de manera continua y económica el mejor modelo disponible, además de conservar el rendimiento cuando aparezca una alternativa superior.
Una carrera que seguirá cambiando
La incorporación prevista de Gemini a Atlas muestra que la arquitectura de Wiz no está vinculada a una única familia de modelos. Su propuesta depende de comparar capacidades y trasladar cada función hacia el sistema que entregue mejores resultados.
Microsoft sigue una lógica similar con MAI-Cyber-1-Flash y GPT-5.4. El modelo interno cubre la mayor parte de las operaciones, mientras el modelo más amplio interviene en los escenarios que requieren una investigación compleja.
Este diseño puede ser especialmente relevante para compañías que necesitan revisar muchos repositorios sin ejecutar un escaneo avanzado sobre cada archivo. La especialización permite reservar recursos para los puntos con mayor probabilidad de contener una falla importante.
La principal limitación seguirá siendo la velocidad con la que cambia el software. Una base de código puede incorporar nuevas dependencias, funciones y configuraciones después de cada revisión, lo que obliga a mantener una supervisión constante.
Atlas y MDASH muestran que la competencia en seguridad de IA no depende solamente de crear el modelo más grande. También depende de construir sistemas capaces de coordinar agentes, comparar resultados, corregir fallas y demostrar con evidencia que una vulnerabilidad fue solucionada.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Seagate dispara sus ingresos 48% y desafía las dudas sobre la infraestructura de IA
Energía
Laboratorio de EE. UU. adapta la tecnología de ChatGPT para modelar reactores nucleares
Asia
EE. UU. lanza AI Spark para frenar el avance de la IA china en el sudeste asiático
Asia