Un juego creado para probar la supervisión humana en agentes de codificación de IA revela que los desarrolladores aprueban, en promedio, uno de cada tres comandos maliciosos. La fatiga de aprobación y la falta de contexto son las principales causas.
***
- Uno de cada tres comandos peligrosos: los jugadores del juego de Alex Wauters aprobaron el 35% de violaciones de alcance y el 65% de un comando como ‘npm run analyze’.
- La fatiga de aprobación es real: la telemetría de Claude Code muestra que los usuarios aprueban el 93% de los avisos de permiso, reduciendo su diligencia con el tiempo.
- Herramientas como sandboxes y modo automático son esenciales: el clasificador de Anthropic atrapa el 83% de comportamientos excesivos, pero el 17% aún escapa.
🚨 ¡Alarma en ciberseguridad!
Un juego revela que humanos aprueban 1 de cada 3 comandos maliciosos de IA
La fatiga de aprobación es un peligro real
Con más de 40,000 decisiones, el 35% de violaciones de acceso han pasado desapercibidas
El riesgo crece mientras los agentes… pic.twitter.com/ZbzTa7ki3b
— Diario฿itcoin (@DiarioBitcoin) August 7, 2026
El juego que expone la fragilidad humana
La promesa de los agentes de codificación con inteligencia artificial es delegar tareas complejas y ahorrar tiempo. Sin embargo, un juego basado en navegador diseñado por el desarrollador belga Alex Wauters sugiere que la supervisión humana no es tan confiable como se piensa.
El juego simula las solicitudes de permisos que un agente como Claude Code genera durante un flujo de trabajo. Cada jugador tiene 60 segundos para aprobar o denegar tantas solicitudes como pueda, con puntos negativos por aprobar riesgos o rechazar comandos seguros.
Los datos recopilados de más de 40.000 ejecuciones y 409.000 decisiones son contundentes. En promedio, los jugadores aprueban aproximadamente uno de cada tres comandos maliciosos, lo que indica una grave debilidad en la última línea de defensa.
Wauters creó el juego al notar que los agentes de codificación esperan que los usuarios aprueben cada comando en un flujo predeterminado, una tarea agotadora que invita al error. Incluso hay quienes usan la bandera ‘–dangerously-skip-permissions’ para evitar detener el proceso y permitir que el agente actúe sin control.
El desarrollador belga explicó a The Register que la fatiga por el “ruido” constante de aprobaciones lleva a decisiones descuidadas. La falta de contexto sobre los cambios realizados por el agente dificulta evaluar el riesgo real de cada comando.
Resultados: qué se aprueba y qué se deja pasar
El análisis de las 40.000 partidas revela patrones claros en los errores humanos. Las violaciones de alcance, como solicitudes de acceso a archivos de configuración de Kubernetes o listas de credenciales de AWS, fueron pasadas por alto el 35% de las veces.
Los comandos destructivos obvios, como eliminar el directorio raíz con ‘rm -rf’ o otorgar permisos recursivos completos, fueron los más detectados. Las inyecciones en crontab y los secuestros de configuración de git también tuvieron alta tasa de rechazo.
En cambio, los comandos que usan ‘curl’ hacia APIs desconocidas y los paquetes con nombres similares (typosquatting) se aprobaron casi con tanta frecuencia como las violaciones de alcance. El comando más peligroso que pasó fue ‘npm run analyze’, que se aprobó el 65% de las veces.
El juego indica en el historial del agente qué contiene realmente el script de ‘npm run analyze’, pero dos tercios de los jugadores no leen esa información. Wauters destaca que el historial justo encima del aviso de permiso se ignora con frecuencia.
Estos resultados no son meramente académicos. Anthropic, la empresa detrás de Claude Code, reportó en una entrada de blog que sus usuarios aprueban alrededor del 93% de los avisos de permiso. Cuanto más aprueba un usuario, menos atención presta a cada solicitud.
La fatiga de aprobación: un problema real
La fatiga de aprobación es un fenómeno documentado en el que el exceso de decisiones rutinarias reduce la capacidad de discernimiento. Wauters lo compara con la práctica de aprobar todo sin revisar, un atajo que muchos desarrolladores adoptan para no detener sus flujos de agentes.
La situación empeora porque los agentes de codificación proporcionan un contexto limitado antes de cada pregunta de aprobación. Comandos benignos como ‘npm run analyze’ pueden ser modificados para ejecutar cualquier carga útil si el agente lo desea.
Un humano que quiera garantizar la seguridad debe detenerse e investigar todos los archivos invocados antes de aprobar, lo que anula el propósito de delegar trabajo. Así, se pasa de revisar sugerencias de una línea a supervisar tareas complejas sin poder verificar cada paso.
Wauters afirmó que hemos pasado de revisar sugerencias simples a delegar tareas completas, revisando solo el resultado final. Eso es una receta para el desastre, según sus palabras.
La telemetría de Anthropic confirma esta preocupación. La empresa señaló que a medida que los usuarios ven más aprobaciones, se vuelven mucho menos diligentes en su supervisión.
Respuestas de la industria: sandboxes y controladores
Ante este panorama, la industria busca soluciones. Anthropic introdujo el modo automático en Claude Code para combatir la fatiga de aprobación, delegando algunas decisiones a un clasificador basado en modelos.
Ese sistema atrapa aproximadamente el 83% de lo que Anthropic llama “comportamientos excesivamente entusiastas” antes de que se ejecuten. No obstante, alrededor del 17% aún logra escapar en las evaluaciones.
La firma describe el modo automático como “una capa de defensa en profundidad dentro de un sandbox” y no como un sustituto de uno. La sugerencia es usar entornos aislados (sandboxes) y contenedores de desarrollo en la nube para limitar el daño potencial.
Wauters recomienda escribir ganchos (hooks) que contextualicen y bloqueen acciones potencialmente maliciosas antes de que sean aprobadas automáticamente. También enfatiza la importancia de crear herramientas que reduzcan la carga cognitiva del desarrollador.
El desarrollador belga concluye que el modelo de permisos de los agentes de IA necesita una revisión profunda. Los usuarios deben ser conscientes de las compensaciones entre seguridad y eficiencia al delegar decisiones a un agente.
El futuro de la supervisión humana
El juego de Wauters no solo entretiene, sino que sirve como advertencia. Las estadísticas demuestran que la supervisión humana por sí sola no es fiable cuando se enfrenta a un flujo constante de solicitudes.
La solución no reside en eliminar al humano del bucle, sino en diseñar sistemas que minimicen la fatiga y maximicen la información relevante. Herramientas visuales, alertas contextuales y sandboxes son pasos en la dirección correcta.
Anthropic ha reconocido que la fatiga de aprobación es un riesgo real y que el modo automático es solo una mitigación parcial. La combinación de clasificadores automáticos y supervisión humana sigue siendo esencial, pero necesita mejores mecanismos.
Wauters advierte que este es un mundo nuevo con vectores de ataque diferentes. Los desarrolladores deben ser conscientes de los riesgos y reducir la superficie de ataque mediante prácticas como el mínimo privilegio y la revisión de logs.
El juego ha logrado más de 40.000 ejecuciones, lo que indica un interés genuino en comprender estos peligros. Queda por ver si la industria tomará medidas concretas para proteger a los usuarios y sus datos.
La investigación de Wauters, publicada en su blog y en The Register, es un llamado a la acción. La última línea de defensa no puede ser únicamente humana; la tecnología debe intervenir de forma proactiva.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
IA falla en parchear vulnerabilidades: solo 26% de éxito sin supervisión
Bancos y Pagos
Deutsche Telekom se suma a SphereNet para asegurar pagos de agentes de IA
Criptomonedas
AMD compra Taalas y graba modelos de IA en silicio para inferencia ultrarrápida
Empresas