Por Angel Di Matteo   𝕏 @shadowargel

Anthropic comenzó a incorporar marcas de agua imperceptibles en el texto generado por sus nuevos modelos Claude, pero la medida ya enfrenta resistencia. Proyectos de código abierto están desarrollando herramientas para intentar eliminar esas señales mediante limpieza de caracteres, reescritura con otros modelos y eliminación de metadatos.

***

  • Anthropic comenzó a incorporar la tecnología el 2 de agosto en nuevos modelos Claude lanzados en la Unión Europea y planea extenderla globalmente.
  • Proyectos de código abierto ya intentan eliminar las señales de Claude, C2PA y sistemas similares, aunque todavía no pueden demostrar que funcionen contra el detector oficial.
  • Anthropic mantiene en secreto el funcionamiento exacto de su marca y todavía no ha publicado las herramientas necesarias para detectarla.

 

Anthropic acaba de iniciar un nuevo juego del gato y el ratón con la comunidad de desarrolladores. La compañía comenzó a insertar una marca de agua imperceptible directamente en los textos producidos por sus modelos Claude más recientes, pero investigadores y defensores de la privacidad ya trabajan para descubrir cómo eliminarla.

La medida comenzó a aplicarse el 2 de agosto de 2026 a los nuevos modelos lanzados en la Unión Europea. Anthropic indicó que posteriormente extenderá el sistema a nivel mundial, lo que podría convertir el mecanismo en una característica estándar del contenido generado por Claude.

La marca llegará además a prácticamente todas las formas de utilizar los modelos compatibles. Esto incluye el chatbot de Claude, su API, Claude Code y servicios ofrecidos mediante proveedores de nube como AWS, Google Cloud y Microsoft Foundry.

Anthropic introdujo el mecanismo después de adherirse al Código de Prácticas sobre transparencia de la Ley de IA de la Unión Europea. Sin embargo, la decisión ya está provocando una reacción entre desarrolladores que buscan determinar cómo funciona la señal y, especialmente, cómo eliminarla.

La comunidad ya intenta romper la marca de Claude

Uno de los primeros proyectos surgidos alrededor del problema es mikiane/claude-watermark-cleaner, que ya acumulaba 106 estrellas en GitHub según la información de referencia. Su estrategia combina diferentes técnicas para intentar eliminar rastros que puedan identificar el origen de un texto, detalla Decrypt.

La herramienta primero elimina caracteres Unicode invisibles que podrían utilizarse para transportar información oculta. Posteriormente recurre a un modelo diferente de Claude para reescribir el contenido, buscando alterar cualquier patrón estadístico que pudiera haber quedado integrado en la selección original de tokens.

La segunda parte es particularmente relevante porque Anthropic sostiene que su sistema funciona directamente a nivel del modelo. Si la marca consiste en una determinada distribución estadística de palabras o tokens, eliminar caracteres invisibles por sí solo probablemente no sería suficiente.

Otro proyecto tiene una ambición considerablemente mayor. guillaumemeyer/watermarks-remover, que acumulaba unas 4.600 estrellas en GitHub, busca eliminar distintas clases de marcas asociadas con contenido generado mediante inteligencia artificial.

La herramienta trabaja con señales atribuidas a Claude, metadatos C2PA y mecanismos de la misma categoría que SynthID. Su alcance incluye formatos como PNG, JPEG, SVG, PDF y DOCX, ampliando el problema más allá del texto copiado desde un chatbot.

El problema: nadie fuera de Anthropic conoce todavía el detector

Existe una limitación fundamental para estos esfuerzos. Anthropic no ha revelado exactamente cómo crea la marca de agua y tampoco ha publicado todavía su detector ni los umbrales utilizados para determinar cuándo un documento debe considerarse marcado.

Por esa razón, ningún proyecto externo puede garantizar actualmente que haya eliminado realmente la señal. Una herramienta puede modificar sustancialmente un texto y aun así desconocer si permanecen suficientes características estadísticas para que el futuro detector de Anthropic continúe reconociéndolo.

La compañía describe el mecanismo como nativo del texto y aplicado a nivel del modelo. Esto significa que no se trataría simplemente de añadir metadatos o caracteres ocultos después de generar una respuesta.

Investigadores han planteado la posibilidad de que Anthropic esté utilizando una firma estadística. Bajo este enfoque, el modelo modifica ligeramente sus preferencias al seleccionar palabras o tokens para producir una distribución detectable posteriormente mediante una herramienta especializada.

El principio pertenecería a la misma familia general de técnicas utilizada por Google con SynthID Text. Sin embargo, esto continúa siendo una inferencia mientras Anthropic mantenga en secreto su implementación y no publique el detector.

Reescribir el texto podría convertirse en el método de ataque más obvio

Si la hipótesis estadística resulta correcta, uno de los métodos más sencillos para atacar la marca sería precisamente utilizar otro modelo de lenguaje. En lugar de intentar localizar manualmente una señal invisible, el usuario podría pedir a una segunda IA que reescriba suficientemente el contenido.

Ese es precisamente uno de los principios utilizados por claude-watermark-cleaner. La segunda pasada busca modificar la secuencia de tokens y, con ella, la distribución estadística que potencialmente permitiría identificar la intervención de Claude.

Los responsables de watermarks-remover cuestionan por esta razón que una marca estadística pueda funcionar como prueba confiable del origen de un contenido. En su interpretación, el sistema podría terminar incentivando a los usuarios a realizar una segunda pasada mediante otro modelo para limpiar sus propios textos.

Anthropic reconoce además una limitación relacionada. La compañía admite que una edición suficientemente profunda puede eliminar la marca y advierte que la ausencia de una señal detectable no demuestra que un texto haya sido escrito por una persona.

La efectividad real de las herramientas actuales, por tanto, permanecerá en duda hasta que exista una manera pública de probar el resultado. Sin el detector de Anthropic, los desarrolladores pueden intentar destruir posibles patrones, pero no verificar definitivamente si lo consiguieron.

La marca tampoco demuestra que Claude haya escrito todo el contenido

La interpretación de una detección positiva presenta otro problema. La señal demostraría que Claude intervino en el procesamiento del texto, pero no necesariamente que el modelo haya sido responsable de escribir el contenido original.

Una persona podría redactar completamente un documento y posteriormente utilizar Claude únicamente para corregir errores ortográficos, mejorar la redacción o traducirlo. La versión resultante podría incorporar la marca pese a que las ideas y buena parte de la escritura procedieran del usuario.

El mismo principio se aplicaría a traducciones. Un documento escrito originalmente por una persona podría terminar identificado como contenido en el que participó Claude simplemente porque el modelo procesó su versión final.

Por esta razón, una detección positiva no debería interpretarse automáticamente como evidencia de que un documento fue generado íntegramente mediante inteligencia artificial. Anthropic reconoce que la señal demuestra participación de Claude, no necesariamente autoría completa.

Tampoco funciona la lógica inversa. Una marca ausente no permite concluir que el contenido tenga origen humano, especialmente porque la propia compañía admite que modificaciones posteriores pueden degradar o eliminar la señal.

Los archivos tendrán una segunda capa de identificación

Anthropic aplicará una protección adicional cuando Claude produzca archivos. En esos casos, la compañía utilizará metadatos firmados mediante el estándar abierto C2PA, diseñado para proporcionar información sobre la procedencia y modificaciones de contenido digital.

Estos metadatos funcionan de manera distinta a la marca integrada directamente en el texto. Pueden registrar información relacionada con quién produjo determinado archivo y si posteriormente sufrió modificaciones.

La existencia de dos mecanismos también amplía la superficie para quienes buscan eliminarlos. Una herramienta puede intentar borrar los metadatos C2PA de un documento y, aun así, necesitar alterar el contenido para destruir una posible firma estadística interna.

Precisamente por eso, proyectos como watermarks-remover intentan trabajar simultáneamente con diferentes tipos de señales. La batalla técnica no gira únicamente alrededor de encontrar caracteres ocultos, sino de neutralizar varias capas de procedencia digital.

Esto también anticipa un posible escenario de escalada. A medida que proveedores como Anthropic desarrollen marcas más resistentes, los desarrolladores de herramientas de eliminación podrán adaptar sus métodos para intentar degradarlas.

Anthropic ya enfrentó críticas por marcadores ocultos

La reacción de algunos defensores de la privacidad también está condicionada por un episodio anterior relacionado con Claude Code. En marzo, Anthropic eliminó un mecanismo oculto después de que investigadores descubrieran marcadores Unicode no divulgados.

Según la información de referencia, esos marcadores permitían etiquetar determinada información relacionada con la ubicación y el uso de proxies por parte de algunos usuarios.

El antecedente ha aumentado la sensibilidad alrededor de cualquier mecanismo silencioso integrado en el contenido. Aunque la nueva marca de agua tiene un objetivo diferente y forma parte de una política declarada públicamente, vuelve a utilizar señales que el usuario ordinario no puede observar directamente.

Anthropic, por su parte, presenta la tecnología como una herramienta de transparencia destinada a permitir que contenido generado mediante IA pueda mantener información sobre su procedencia incluso después de copiarlo y pegarlo en otros lugares.

La compañía asegura que la marca no altera el significado, la calidad ni la legibilidad de las respuestas. También sostiene que puede sobrevivir a determinadas modificaciones posteriores del texto.

Comienza una nueva carrera entre marcas y herramientas para borrarlas

La discusión trasciende a Anthropic. En Estados Unidos, el proyecto legislativo COPIED Act también impulsa la idea de crear mecanismos estandarizados para identificar y rastrear contenido generado mediante inteligencia artificial.

Para los desarrolladores de modelos, las marcas podrían proporcionar una herramienta para identificar contenido sintético a medida que resulta más difícil distinguirlo visualmente del producido por personas.

Para parte de la comunidad de privacidad y código abierto, sin embargo, una señal persistente introducida por un modelo plantea interrogantes sobre el control que conserva el usuario sobre los documentos que procesa mediante estas herramientas.

El resultado probablemente será una competencia técnica. Anthropic intentará que su señal sobreviva a modificaciones razonables, mientras investigadores buscarán transformaciones capaces de destruirla sin degradar significativamente el contenido.

Por ahora, existe una ventaja importante para Anthropic: solo la compañía conoce exactamente qué está buscando su detector. Pero esa situación podría cambiar cuando publique las herramientas y umbrales que permitirán verificar oficialmente las nuevas marcas.

Ese será también el momento en que proyectos como claude-watermark-cleaner y watermarks-remover podrán enfrentarse a una prueba mucho más concreta. Hasta entonces, la comunidad puede intentar borrar las huellas de Claude, pero todavía no tiene una manera definitiva de saber si realmente consiguió hacerlo.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín