Un estudio de Microsoft Research advierte que los agentes de IA pierden confiabilidad cuando deben ejecutar cadenas largas de tareas, con degradación documental y corrupción crítica en la mayoría de los escenarios analizados.
***
- El benchmark DELEGATE-52 evaluó flujos de trabajo prolongados en 52 dominios profesionales.
- La fidelidad documental cayó cerca de 25% tras 20 iteraciones y alrededor de 50% al considerar todos los modelos y dominios.
- El acceso a herramientas aumentó la degradación, mientras que Python fue el único dominio con menos de 1% de deterioro.
🚨 Agentes de IA pierden fiabilidad en tareas largas
DELEGATE-52 evaluó 52 dominios profesionales de Microsoft Research.
La fidelidad cayó 25% tras 20 iteraciones y hasta 50% en el total evaluado.
Más del 80% de combinaciones registró corrupción crítica.
Python tuvo menos de… pic.twitter.com/PGycvwsWkN
— Diario฿itcoin (@DiarioBitcoin) September 8, 2026
Microsoft Research publicó un estudio que pone bajo presión una de las promesas centrales de los agentes de inteligencia artificial: ejecutar tareas complejas durante largos periodos sin perder el hilo ni alterar el material original. A través del benchmark DELEGATE-52, la investigación concluyó que los modelos de frontera sufren una degradación significativa cuando deben editar, transformar y reconstruir documentos o código mediante cadenas extendidas de trabajo.
El informe encontró una pérdida promedio de fidelidad documental cercana al 25% después de apenas 20 iteraciones delegadas, mientras que la degradación llegó aproximadamente al 50% al observar el conjunto completo de modelos y dominios evaluados. El resultado cuestiona la utilidad de medir a los sistemas únicamente con tareas breves, especialmente cuando las empresas buscan incorporarlos a procesos profesionales que exigen continuidad, precisión y supervisión durante muchas etapas.
Un benchmark centrado en tareas prolongadas
DELEGATE-52 fue diseñado para examinar un problema que las evaluaciones convencionales suelen dejar en segundo plano: la capacidad de un modelo para conservar el contenido de un documento después de múltiples transformaciones. En lugar de concentrarse en una respuesta aislada, el benchmark reproduce flujos de trabajo donde un agente recibe instrucciones sucesivas, modifica archivos y debe mantener intactos los elementos relevantes del material inicial.
La prueba abarca 52 dominios profesionales y busca aproximarse a escenarios más parecidos a los que enfrentan los usuarios en empresas, laboratorios y equipos técnicos. En esas tareas, un error temprano puede propagarse hacia las siguientes etapas, de modo que la calidad de la respuesta final no depende solamente del rendimiento del modelo en una instrucción individual.
Microsoft Research probó algunos de los sistemas de inteligencia artificial más capaces mencionados en el estudio: Gemini 3.1 Pro, Claude 4.6 Opus y GPT 5.4. La conclusión general fue desfavorable para todos, ya que ninguno logró evitar por completo la pérdida de fidelidad cuando aumentó la longitud de la cadena de trabajo.
La investigación definió como corrupción catastrófica aquellos casos en los que el puntaje de fidelidad cayó hasta 80% o menos. Ese umbral apareció en más del 80% de las combinaciones entre modelo y dominio evaluadas, una proporción que sugiere que el problema no está limitado a un proveedor específico ni a una clase particular de documentos.
Las herramientas no eliminaron el deterioro
Una de las conclusiones más llamativas es que ofrecer más capacidades a los agentes no necesariamente mejoró su confiabilidad. El acceso a herramientas de lectura y escritura de archivos, así como a la ejecución de código, aumentó en promedio 6% la degradación de la fidelidad documental durante los flujos extendidos.
Ese resultado no significa que las herramientas carezcan de valor en todos los escenarios, pero sí muestra que amplían el margen de acción de un sistema que ya puede estar perdiendo información o introduciendo cambios incorrectos. Cuando el agente modifica archivos directamente, una falla de interpretación puede convertirse en una alteración persistente y afectar las etapas posteriores del proceso.
El estudio también señaló que los métodos de verificación y orquestación utilizados para mantener a los agentes encaminados no resolvieron el problema fundamental. Las barreras de protección pueden detectar algunos errores, pero la investigación sostiene que la delegación confiable a largo plazo continúa siendo un desafío estructural y no únicamente una deficiencia de instrucciones o de diseño operativo.
La diferencia entre una tarea corta y una cadena prolongada resulta decisiva para interpretar estos resultados. Un sistema puede ofrecer una respuesta convincente en los primeros pasos y, aun así, acumular pequeñas alteraciones hasta producir un documento final que ya no representa fielmente el material de origen.
Por qué los resultados cortos pueden inducir a error
Las métricas utilizadas para promocionar modelos de inteligencia artificial suelen provenir de benchmarks de corto plazo, en los que las instrucciones aparecen separadas y el número de pasos es limitado. Según el estudio, ese formato puede transmitir una sensación de seguridad que no se mantiene cuando el mismo tipo de trabajo se extiende a 20 iteraciones o más.
La diferencia puede ser sustancial: un modelo que alcanza 95% de precisión en una tarea de cinco pasos podría acercarse a 50% en una versión de 20 pasos de esencialmente el mismo trabajo. La comparación no describe una cotización ni una métrica financiera, sino una advertencia sobre cómo el rendimiento observado al inicio puede ocultar una degradación acumulativa.
El estudio identificó un punto positivo poco común en los flujos de trabajo de Python, que registraron menos de 1% de degradación durante las ejecuciones extendidas. Sin embargo, ese desempeño no se trasladó automáticamente a los otros 51 dominios, y Gemini 3.1 Pro fue considerado listo únicamente para 11 de las 52 áreas profesionales cubiertas por el benchmark.
La diferencia entre dominios también plantea un reto para las empresas que pretenden generalizar el desempeño de un agente a partir de una demostración exitosa. Que un sistema funcione con estabilidad en código Python no garantiza la misma precisión al reconstruir documentos profesionales, editar materiales complejos o sostener una cadena de decisiones en otra especialidad.
La industria busca nuevas formas de medir la fiabilidad
Los resultados aparecen mientras otras iniciativas intentan evaluar la confiabilidad de los agentes en operaciones prolongadas. El artículo que divulgó el estudio menciona frameworks como AgentRx y herramientas de monitoreo como SentinelBench, creados específicamente para observar el comportamiento de los sistemas cuando ejecutan tareas durante periodos más largos.
La aparición de esas herramientas refleja una preocupación creciente en la industria: los indicadores tradicionales describen bien la capacidad de responder, pero no necesariamente la capacidad de conservar el contexto. Para los usuarios profesionales, esa distinción importa porque un agente puede parecer competente en cada intercambio y aun así deteriorar el resultado acumulado del proyecto.
El problema también afecta la forma en que deben diseñarse las implementaciones empresariales, aunque el estudio no presenta una solución definitiva. Los equipos que deleguen procesos extensos tendrán que considerar controles sobre la fidelidad del documento en varios puntos de la cadena, en lugar de confiar únicamente en una revisión al final.
Por ahora, DELEGATE-52 deja una conclusión incómoda para la expansión de los agentes de IA: aumentar la duración de una tarea puede revelar fallas que permanecen ocultas en las demostraciones breves. Mientras no existan métodos capaces de garantizar la preservación del contenido a lo largo de múltiples iteraciones, la delegación completa de flujos profesionales seguirá requiriendo cautela y supervisión.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Hardware
La escasez de chips amenaza la promesa de la IA para curar el cáncer
Asia
Samsung SDS apuesta por OpenAI y Anthropic para acelerar su transformación con IA
Empresas
Anthropic enfrenta el desafío de proteger su misión tras una OPI de USD $2 billones
Cadena de Suministros