Microsoft ha liberado un agente de pruebas unitarias de código abierto, con licencia MIT, que completó el 92,1% de las tareas en un benchmark interno, frente al 78,9% de GitHub Copilot estándar, reduciendo fallos en 63% y generando menos pruebas con la misma cobertura.
***
- El agente de pruebas de Microsoft supera a Copilot con 92,1% vs 78,9% de finalización de tareas.
- Utiliza un pipeline de Investigación-Planificación-Implementación y cinco verificaciones de calidad.
- Está disponible con licencia MIT y puede integrarse en agentes de codificación existentes.
🚨 Microsoft lanza un nuevo agente de pruebas unitarias 🚨
Superó a GitHub Copilot con un 92,1% de éxito en tareas.
Reduce fallos en un 63% y genera menos pruebas con la misma cobertura.
Ideal para entornos empresariales, es políglota y se integra fácilmente.
Licencia MIT… pic.twitter.com/FUikJErgP6
— Diario฿itcoin (@DiarioBitcoin) August 7, 2026
El equipo .NET de Microsoft ha liberado un agente de pruebas unitarias de código abierto, con licencia MIT, que promete transformar la generación de pruebas en proyectos de software. Esta herramienta, denominada code-testing-generator, logró un 92,1% de finalización de tareas en un benchmark interno, frente al 78,9% del GitHub Copilot estándar, con el mismo modelo y las mismas instrucciones.
nn
Según informó MarkTechPost, se trata de una definición de agente junto con habilidades, no un servicio alojado. Se ejecuta dentro del agente de codificación existente y el código permanece local, lo que facilita su adopción en entornos empresariales con políticas de seguridad estrictas.
nn
¿Qué hace el agente?
nn
El agente coordina el trabajo a través de un pipeline de Investigación-Planificación-Implementación (RPI). Primero, busca en el repositorio el código que necesita pruebas, detecta el lenguaje y el framework de pruebas, lee las pruebas existentes para conocer las convenciones y encuentra los comandos reales de compilación y ejecución.
nn
Ese último paso aborda un fallo común: proyectos de pruebas que compilan localmente pero nunca se ejecutan en CI porque nada los registró. Luego, el agente elige entre tres estrategias: directa, paso único o iterativa. La directa escribe y valida pruebas inmediatamente; la de paso único ejecuta un ciclo; la iterativa lo repite para grandes alcances u objetivos de cobertura.
nn
El agente nunca modifica código de producción y evita pruebas que llamen a URLs externas, vinculen puertos o dependan de temporización. Esto garantiza que las pruebas sean deterministas y no causen efectos secundarios, un requisito esencial en sistemas empresariales.
nn
Además, el agente es políglota: puede trabajar con múltiples lenguajes y frameworks de prueba, lo que lo hace ideal para monorepos con diversidad tecnológica. Su diseño modular permite que los equipos personalicen las guías de lenguaje según sus necesidades internas.
nn
Resultados del benchmark interno de Microsoft
nn
En el benchmark interno de Microsoft, compuesto por 152 tareas de repositorios reales, el agente completó 140 tareas (92,1%) frente a 120 (78,9%) del Copilot estándar, lo que representa un 63% menos de fallos. La superioridad se concentra en instrucciones vagas y tareas dirigidas a diffs específicos.
nn
En 89 instrucciones vagas, el agente resolvió 79 (88,8%) frente a 59 (66,3%) del Copilot, reduciendo los fallos de 30 a 10. En 63 instrucciones detalladas, ambos lograron 61 (96,8%), lo que sugiere que la diferencia radica en la capacidad de interpretar requisitos ambiguos.
nn
En 15 tareas dirigidas a un diff específico, el agente aprobó todas, mientras que el Copilot estándar no aprobó ninguna. Notablemente, el agente generó un 2,3% menos de pruebas (6.963 frente a 7.129) con una cobertura de líneas prácticamente idéntica (72,4% frente a 72,2%).
nn
El tiempo promedio de tarea fue de 359 segundos frente a 380 del Copilot, y el uso de tokens por tarea completada fue un 3,2% mayor. En 45 tareas de .NET, Claude Opus 4.8 alcanzó 43/45 con el agente frente a 35/45 del estándar; GPT-5.5 alcanzó 41/45 frente a 36/45.
nn
En el benchmark externo SWE Atlas, más difícil, la finalización fue de 16/44 frente a 12/44. Estos datos demuestran que el agente no solo mejora en tareas fáciles, sino también en desafíos complejos, lo que respalda su utilidad en entornos de producción reales.
nn
La puerta de verificación: cinco comprobaciones
nn
Antes de informar la finalización, el agente ejecuta cinco verificaciones. La primera consiste en razonar sobre pequeños cambios en el código que deberían hacer fallar las pruebas, una forma ligera de testing de mutación para comprobar que las pruebas detectan errores.
nn
La segunda verificación busca aserciones débiles o faltantes, que podrían dar falsos positivos. La tercera mapea cada escenario solicitado a una prueba concreta, asegurando que no se omita ningún requisito.
nn
La cuarta compila todo el workspace y ejecuta la suite completa, lo que valida la integración con otros módulos. La quinta confirma que el comando de prueba del repositorio descubre las nuevas pruebas, evitando el problema de pruebas huérfanas.
nn
Este proceso de verificación es una diferencia clave frente a la generación en un solo paso, que a menudo produce pruebas que compilan pero no ejecutan correctamente. El agente de Microsoft integra esta validación directamente en su pipeline, garantizando calidad desde el primer intento.
nn
Adicionalmente, el agente documenta sus decisiones de diseño en el mensaje de commit, facilitando la revisión del código por parte de los desarrolladores. Esto mejora la transparencia y la confianza en las pruebas generadas automáticamente.
nn
Casos de uso y público objetivo
nn
El agente es viable desde mantenedores individuales hasta equipos empresariales. Las startups y los equipos de mercado medio son los más beneficiados, porque el agente proporciona investigación del repositorio que un pequeño equipo no tiene tiempo de programar.
nn
Las empresas pueden hacer fork de la guía de lenguaje para adaptarla a sus frameworks internos y estándares de codificación. En cuanto a industrias, es especialmente útil en ecosistemas de software regulados o con alta carga de auditoría, como servicios financieros, salud, seguros y sector público.
nn
También es beneficioso para equipos de plataformas que acumulan deuda de pruebas heredadas, ya que puede rellenar huecos en módulos sin cobertura. Otras aplicaciones incluyen generar pruebas para un diff de pull request, aumentar la cobertura antes de una puerta de liberación y estandarizar convenciones en monorepos políglotas.
nn
El agente se integra con herramientas de CI/CD existentes, ejecutándose de forma local y sin necesidad de servicios externos. Esto reduce costos de infraestructura y mantiene los datos de la empresa seguros.
nn
MarkTechPost destaca que la licencia MIT permite una adopción amplia, y su naturaleza de agente hace que la herramienta evolucione con las contribuciones de la comunidad, acelerando su madurez.
nn
En resumen, Microsoft ha demostrado que un enfoque estructurado de investigación, planificación y verificación supera a la generación improvisada de pruebas. Esta herramienta no solo mejora la fiabilidad del software, sino que también reduce el tiempo de desarrollo.
nn
nn
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
nn
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
SpaceX se desploma: el sueño de Musk choca con la realidad financiera
Estados Unidos
Saturación de deuda de IA obliga a Wall Street a repensar ventas de bonos
Capital de Riesgo
Apuesta temprana en SpaceX da 30% de ganancia a fondo universitario
billonarios