Por Canuto  

Anthropic presentó un esquema de marcas de agua para textos de Claude basado en modificar palabras intrascendentes, una técnica que busca cumplir con la Ley de IA de la UE sin afectar la calidad del contenido. La empresa se apoya en el método SynthID-Text de Google DeepMind para alterar la elección de palabras sin cambiar el significado, aunque reconoce que una reescritura completa puede eliminar la marca.
***

  • Anthropic implementará un marcado de agua en los textos de Claude modificando palabras irrelevantes, inspirado en el sistema SynthID-Text de Google DeepMind.
  • La técnica altera la elección de palabras sin cambiar el significado, permitiendo detectar si el texto fue generado por IA, pero una reescritura completa elimina la marca.
  • La iniciativa responde al cumplimiento de la Ley de IA de la UE y no afecta la velocidad ni el costo del modelo, según pruebas internas de la empresa.


En un movimiento para cumplir con la Ley de IA de la Unión Europea, Anthropic presentó el viernes un plan para marcar con agua los textos generados por su modelo Claude mediante la modificación de palabras intrascendentes. La técnica se basa en el sistema SynthID-Text desarrollado por Google DeepMind, que influye en la elección de palabras que no alteran el significado general de la oración.

Cómo funciona el marcado de agua en Claude

El enfoque de Anthropic consiste en ajustar las palabras que el modelo elige al predecir la siguiente en una secuencia, específicamente aquellas que pueden considerarse intercambiables. Por ejemplo, al completar la frase “El clima hoy estaba frío y…”, Claude podría responder con “frío” o “gris” sin cambiar el sentido, mientras que opciones como “azucarado” serían improbables. La marca de agua se genera desviándose de la palabra predicha hacia otra usando una fuente de aleatoriedad detectable con una clave digital.

Los investigadores de Google DeepMind explican en su artículo que el marcado de agua generativo modifica cuidadosamente el muestreo del siguiente token para inyectar modificaciones sutiles en la distribución del texto. Estas modificaciones introducen una firma estadística que permite determinar si el texto fue generado por un LLM marcado. Anthropic asegura que esto se aplicará únicamente a pasajes de bajo riesgo, sin alterar la precisión ni la coherencia del contenido.

En pruebas internas, la compañía afirma que no ha visto impacto alguno en la calidad, creatividad o legibilidad del texto de Claude. En un estudio controlado con evaluadores humanos, los participantes no percibieron diferencias entre las respuestas con y sin marca de agua, lo que sugiere que la técnica es imperceptible para los usuarios finales.

Sin embargo, la efectividad de la marca depende de que no se aplique a textos fácticos donde hay pocas alternativas. Anthropic señala que el marcado es más escaso en pasajes factuales y en código, donde no se pueden intercambiar nombres de métodos sin afectar la precisión. La empresa reconoce que cierta edición puede eliminar la marca, aunque una reescritura completa donde cada palabra sea reemplazada sí lograría borrarla.

Implicaciones para la calidad del texto y la creatividad

La idea de que algunas palabras son intercambiables puede levantar críticas en el ámbito literario, pero Anthropic defiende que el marcado no afecta la esencia del texto. En un experimento, al pedirle a Claude que completara una frase sobre el clima, el modelo generó una respuesta más literaria de lo esperado, pero la empresa insiste en que la técnica no interfiere con la creatividad. El intercambio de palabras como “frío” por “gris” en contextos de bajo riesgo no modifica la intención comunicativa.

Para los usuarios que intentan pasar texto generado por IA como escritura humana, la marca de agua representa una barrera parcial. Anthropic señala que la edición ligera probablemente no elimine la marca, pero una reescritura completa sí lo haría, aunque en ese caso es discutible si el texto puede considerarse generado por IA. La empresa no parece preocupada por la posibilidad de que el esquema sea derrotado, ya que su motivación principal es el cumplimiento legal y no la prevención de abusos.

La técnica no implica el uso de información de identificación personal, solo indica que Claude participó en la creación del texto. Esto la diferencia de otros métodos de marcado más intrusivos, pero también limita su utilidad para rastrear contenido malicioso. Anthropic publicó el plan como parte de sus esfuerzos de transparencia, destacando que el marcado no aumenta los costos ni afecta la velocidad del modelo.

En el contexto de la regulación europea, el marcado de agua se convierte en una herramienta para demostrar que los modelos cumplen con los requisitos de identificación de contenido generado por IA. Sin embargo, algunos críticos podrían calificarlo de cumplimiento performativo, ya que la técnica es fácilmente eludible con una edición exhaustiva. Anthropic responde que el objetivo es ofrecer una solución práctica sin sacrificar la experiencia del usuario.

Limitaciones y el cumplimiento de la Ley de IA de la UE

Anthropic deja claro que el marcado de agua se implementa como un asunto de cumplimiento legal, optando por una solución que no incrementa los costos de inferencia. La empresa afirma que el algoritmo tiene un impacto insignificante en la velocidad y no produce tokens adicionales, por lo que el precio del servicio se mantiene igual. Esto contrasta con otras técnicas que podrían requerir recursos computacionales extra.

La Ley de IA de la UE exige que los modelos generativos identifiquen su contenido para evitar desinformación y fraudes. El esquema de Anthropic cumple con ese requisito, pero su efectividad depende de que los usuarios no modifiquen el texto sustancialmente. La compañía reconoce que una reescritura completa, donde cada palabra es reemplazada, eliminaría la marca, lo que podría ser utilizado por actores malintencionados para evadir la detección.

El enfoque de DeepMind y Anthropic no es el único en el mercado, pero destaca por su simplicidad y bajo impacto. Otras empresas de IA están desarrollando métodos similares, y se espera que la industria adopte estándares comparables. La publicación del plan busca posicionar a Anthropic como líder en transparencia, mientras prepara a Claude para operar en mercados regulados.

A pesar de las limitaciones, el marcado de agua basado en palabras intrascendentes representa un paso hacia la identificación de contenido generado por IA. La comunidad técnica seguirá evaluando su robustez frente a ataques adversariales, pero por ahora Anthropic confía en que esta solución satisface los requisitos legales sin perjudicar a los usuarios legítimos.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín