Un análisis de Lasso Security plantea que las marcas de agua para identificar contenido generado por IA no solo afectan las palabras de una respuesta: también pueden cambiar las herramientas que elige un agente y su resistencia ante ataques de inyección de prompts.
***
- Las pruebas redujeron la precisión de las llamadas a herramientas en seis de siete modelos evaluados.
- El efecto sobre las negativas de seguridad fue más fuerte cuando los investigadores usaron inyecciones de prompts.
- Lasso recomienda incluir contenido marcado en las evaluaciones de seguridad y en los ejercicios de red team.
⚠️ Marcas de agua de IA alteran la seguridad de agentes
Lasso Security reportó menor precisión en llamadas a herramientas en 6 de 7 modelos.
Con inyecciones de prompts, aumentó el éxito de ataques contra negativas de seguridad.
Recomienda probar contenido marcado en… pic.twitter.com/T1fpORgfw9
— Diario฿itcoin (@DiarioBitcoin) September 17, 2026
Las marcas de agua diseñadas para demostrar que un texto fue generado por inteligencia artificial podrían tener consecuencias que van más allá de la procedencia del contenido. Un análisis de Lasso Security encontró diferencias en la manera en que varios modelos realizan llamadas a herramientas y responden ante solicitudes dañinas, especialmente cuando reciben instrucciones adversariales que intentan desactivar sus filtros de seguridad.
El hallazgo adquiere relevancia mientras la Ley de IA de la Unión Europea establece obligaciones de transparencia y promueve el uso de marcas legibles por máquina para identificar contenido generado o manipulado mediante inteligencia artificial. La medida busca facilitar la detección de material engañoso, pero el estudio plantea que cualquier modificación en la generación de tokens debe evaluarse también desde la perspectiva de la seguridad operativa de los agentes.
Una marca invisible dentro de la generación
Una marca de agua digital no tiene por qué aparecer como un sello visible para el lector. En el caso descrito por los investigadores, el sistema introduce patrones estadísticos al favorecer determinadas palabras o tokens entre varias alternativas plausibles, de modo que una herramienta con la clave correspondiente pueda detectar posteriormente la procedencia del texto.
La explicación citada en el análisis utiliza un ejemplo sencillo: ante una frase como “El clima hoy estaba frío y…”, el modelo podría elegir “nublado” en lugar de “gris” para contribuir al patrón de identificación. El lector probablemente no percibiría la diferencia, pero una cadena de decisiones pequeñas repetidas a lo largo de una respuesta puede modificar el vocabulario que procesa un agente y, con ello, su conducta posterior.
Según Lasso Security, SynthID-Text cambia el proceso mediante el cual el modelo selecciona cada siguiente token, aunque el propósito original sea únicamente establecer procedencia. La empresa sostiene que esa intervención puede afectar decisiones relacionadas con la seguridad, incluida la disposición del modelo a rechazar una petición dañina y la capacidad de mantener esa negativa cuando otra instrucción intenta desviarlo.
Google DeepMind desarrolló SynthID-Text como uno de los métodos para incorporar este tipo de señal en el contenido generado. Anthropic ha descrito el marcador de texto de Claude como una versión del enfoque SynthID-Text publicado por Google DeepMind. En cambio, la información disponible sobre OpenAI se refiere a iniciativas de procedencia de contenido y al uso de tecnologías como SynthID, pero no permite afirmar que la compañía haya adoptado SynthID-Text.
El efecto sobre las herramientas de los agentes
Los agentes de inteligencia artificial no se limitan a redactar respuestas: también pueden escoger una herramienta, completar sus argumentos y ejecutar una acción en función de la tarea recibida. Por esa razón, un cambio aparentemente menor en la selección de palabras puede convertirse en una llamada a una función distinta, en un parámetro incorrecto o en una entrada que el sistema no consigue analizar.
En el benchmark BFCL v4 single-turn AST, el marcaje redujo la precisión en seis de los siete modelos examinados. La lista incluyó phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27b y Granite-3.2-8B, aunque el resultado agregado no permite concluir que cada llamada individual haya empeorado.
La precisión total puede permanecer relativamente estable si una llamada que antes era correcta se vuelve incorrecta, pero otra que fallaba pasa a funcionar. Lasso señaló que esa compensación estadística oculta cambios concretos en el comportamiento del modelo, una distinción importante para empresas que dependen de agentes capaces de operar software, consultar bases de datos o activar funciones automáticamente.
El problema tampoco queda limitado al proveedor que incorpora la marca de agua. Un agente construido con OpenClaw o un cliente que llame mediante una API a un modelo que emplee este tipo de marcaje procesaría cualquier variación generada por esa técnica, incluso si la aplicación, el desarrollador y la capa de automatización pertenecen a organizaciones completamente distintas.
Negativas, inyecciones y evaluación de riesgos
Las negativas son las respuestas mediante las cuales un modelo rechaza una solicitud porque identifica riesgos de seguridad o contenido dañino. En las pruebas realizadas con HarmBench y JailbreakBench, el marcaje produjo un efecto pequeño frente a peticiones claramente dañinas, pero la diferencia se volvió más pronunciada cuando los investigadores añadieron una inyección de prompt.
Una inyección de prompt es una instrucción adversarial que intenta convencer al sistema de que sus controles fueron desactivados o de que debe obedecer una orden que contradice sus reglas. En ese escenario, la tasa de éxito del ataque aumentó significativamente cuando había marcas de agua, lo que hizo que los modelos afectados fueran menos propensos a mantener una negativa ante solicitudes dañinas.
El resultado no demuestra que toda marca de agua debilite de forma general la seguridad de un modelo, ni que la exigencia regulatoria carezca de justificación. Sí indica que una modificación pensada para rastrear la procedencia puede interactuar con mecanismos de alineación, selección de herramientas y defensa frente a instrucciones manipuladoras.
La recomendación de Lasso Security es incorporar contenido marcado en las evaluaciones de seguridad y en las sesiones de red team antes de desplegar agentes. Esa práctica permitiría medir si el sistema mantiene sus negativas, escoge las herramientas correctas y conserva un comportamiento consistente cuando la salida del modelo incluye el patrón digital exigido para demostrar su origen.
La tensión entre trazabilidad y confiabilidad
La trazabilidad ofrece beneficios claros para plataformas, empresas y usuarios que necesitan distinguir material generado por una máquina de contenido producido por una persona. También puede ayudar a investigar campañas engañosas o manipuladoras, aunque el propio análisis advierte que las marcas podrían estigmatizar el uso de inteligencia artificial si se interpretan como una señal automática de baja calidad o falta de autenticidad.
El desafío consiste en que los modelos actuales no producen únicamente texto destinado a ser leído. Sus respuestas pueden activar herramientas, preparar argumentos estructurados y desencadenar operaciones en sistemas externos, por lo que la procedencia del contenido y la confiabilidad de la acción forman parte del mismo problema técnico.
Para los desarrolladores, la diferencia entre una respuesta ligeramente distinta y una llamada fallida puede ser decisiva. Un error de análisis o un argumento malformado puede impedir una tarea legítima, mientras que una negativa debilitada ante una inyección de prompt puede abrir una ruta de riesgo que no aparecería en una evaluación basada únicamente en respuestas visibles.
La discusión no enfrenta necesariamente regulación contra innovación, sino identificación contra estabilidad. Antes de ampliar el uso de marcas de agua en modelos conectados a herramientas, los proveedores y sus clientes tendrán que verificar cómo cambia el sistema en cada escenario, registrar esas diferencias y decidir si la ventaja de la procedencia compensa cualquier pérdida medible de precisión o resistencia.
El caso también sugiere que las pruebas de seguridad no deberían tratar la salida marcada como un detalle cosmético. Si el patrón digital puede modificar lo que el modelo dice y lo que el agente hace, entonces debe evaluarse como parte del sistema completo, desde la generación del token hasta la ejecución de la herramienta y la respuesta frente a una instrucción adversarial.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
La mayoría del mundo teme que la IA destruya más empleos de los que cree
Estados Unidos
Senadores piden a la FTC investigar a Amazon y Walmart por sus bots de IA
Hardware
Fujitsu presenta MONAKA, su CPU de 144 núcleos para inteligencia artificial
China

