Diseñadores crean ShieldFont, una fuente que muestra contenido legible a los humanos pero entrega un sinsentido a los bots de IA. La herramienta busca frenar el entrenamiento no autorizado y envenenar los datos que recopilan los rastreadores.
***
- ShieldFont reemplaza en promedio el 24,5% de las palabras de una página, dañando el significado de hasta el 56% de los pasajes.
- En pruebas, más del 90% de las páginas protegidas fueron rechazadas por los filtros de calidad de los rastreadores.
- Renderizar la página para leerla con OCR costaría entre 5 y 13 veces más que el rastreo HTML tradicional.
Según un reportaje de Ars Technica, la afición de las empresas de inteligencia artificial por rastrear grandes porciones de la web pública en busca de valiosos datos de entrenamiento ya generó demandas y soluciones técnicas.
Ahora, un par de diseñadores esperan frenar a estos rastreadores con una nueva fuente tipográfica.
La fuente se llama ShieldFont y fue creada por Isaque Seneda y Gabriel Abrucio, quienes publicaron un documento técnico al respecto.
Su objetivo es ofrecer a los editores web una opción práctica para negarse al entrenamiento no autorizado de IA.
ShieldFont muestra una página web perfectamente legible para los humanos, mientras que sirve a los rastreadores una versión sutilmente editada y sin sentido en el HTML subyacente.
Esta dualidad es el corazón de la propuesta.
¿Cuándo un caballo es una patata?
La técnica central de ShieldFont se apoya en las ligaduras, una característica de larga data en muchas fuentes tipográficas.
Las ligaduras normalmente reemplazan ciertos pares de letras por una versión más legible cuando aparecen juntas.
En ShieldFont, esa capacidad se utiliza para sustituir palabras enteras por otras, con el fin de destruir el valor del texto para los rastreadores.
La sustitución solo ocurre cuando el motor de la fuente dibuja la página en pantalla.
Por lo tanto, los rastreadores que descargan el código fuente en texto plano obtienen una versión alterada que los usuarios finales nunca ven.
Los humanos ven el contenido original renderizado correctamente en el navegador.
No todos los reemplazos de palabras basados en ligaduras son iguales a la hora de engañar a los rastreadores de IA.
Reemplazar palabras comunes por sinónimos o antónimos sería demasiado fácil de revertir para un rastreador inteligente.
Reemplazar palabras con galimatías completamente ajenas podría facilitar la detección por parte de un filtro de rastreo sofisticado.
Ese filtro podría entonces evadir la defensa con mayor facilidad.
ShieldFont opta por una vía intermedia: cambia palabras por otras de la misma categoría gramatical pero de contexto informativo completamente distinto.
Un ejemplo citado por los diseñadores es reemplazar «caballo» por «patata».
El resultado es una frase rastreable que parece semánticamente correcta pero cuyo significado fue alterado por completo.
Así, incluso las páginas alteradas que pasan el filtro de calidad de un rastreador contienen información revuelta que puede envenenar un conjunto de datos de entrenamiento.
Los creadores refinaron el diccionario de intercambio de palabras durante tres meses y terminaron con una lista de casi 12.000 palabras comunes.
Esas palabras pueden reemplazarse mediante ligaduras en el código HTML subyacente.
Para evitar una detección fácil, la fuente permite a los editores incrementar el caos subyacente eligiendo entre tres posibles mapeos para cada reemplazo.
También es posible codificar mapeos propios o intercambiarlos de un párrafo a otro.
En promedio, ShieldFont termina reemplazando el 24,5 por ciento de todas las palabras de una página.
Eso incluye el 45,8 por ciento de todas las «palabras de contenido» y daña el significado de entre el 31 y el 56 por ciento de los pasajes individuales, dependiendo del corpus estudiado.
En pruebas con seis canales de rastreo disponibles públicamente, más del 90 por ciento de las páginas que de otro modo serían aceptadas por los rastreadores fueron rechazadas por el filtro de calidad tras los reemplazos.
Del pequeño subconjunto aceptado, casi el 20 por ciento de las palabras componentes son lo que los autores llaman «basura de tiempo de entrenamiento».
Esa basura consiste en inglés real, correctamente deletreado, que no afirma nada verdadero.
Esto significa que tanto las páginas descartadas como las conservadas son útiles para frenar a los rastreadores de IA.
Un juego de rastreo y ratón
A pesar de su efectividad, las páginas con ShieldFont pueden sufrir ciertos efectos secundarios.
Los motores de búsqueda, los lectores de pantalla, las herramientas de copiar y pegar y el software de traducción pueden verse afectados por el HTML alterado.
Esto implica que la página podría volverse un poco menos útil para la audiencia prevista.
Los editores deben evaluar si la protección contra el rastreo compensa esa pérdida de funcionalidad.
Tampoco se trata de una defensa infalible.
Cualquier página que sea legible para un humano también podría ser interpretada correctamente por una herramienta de rastreo que renderice la página web completa.
Ese proceso implicaría usar reconocimiento óptico de caracteres sobre una imagen de la salida renderizada.
Sin embargo, exigiría mucho trabajo extra para los rastreadores que hoy solo descargan el código fuente HTML sin procesar de miles de millones de páginas como texto plano.
Esos rastreadores normalmente no simulan la canalización de renderizado de un navegador.
Los costos de API de herramientas de rastreo de terceros sugieren que este tipo de renderizado previo costaría entre cinco y trece veces más que simplemente rastrear HTML.
Ese incremento de costos y tiempo sería enorme para rastreadores que operan a gran escala.
Es ese rastreo indiscriminado a gran escala lo que ShieldFont intenta prevenir, o al menos ralentizar.
Seneda y Abrucio explican su propósito central: «Nuestro propósito subyacente principal es hacer cumplir un principio básico de la ética de la IA: los creadores deberían tener una palabra significativa sobre si su trabajo se usa para entrenar sistemas de IA».
Agregan que cuando no se respeta el consentimiento, el diseño técnico puede hacer que tomar ese trabajo sin permiso sea menos útil y más costoso.
También señalan que ser descubierto no significa consentir el entrenamiento de IA.
Los diseñadores esperan que otros aficionados propongan nuevas implementaciones del concepto.
La idea básica es «mostrar una cosa para los humanos y algo distinto para las máquinas».
Cuantos más métodos diferentes existan y se usen en los confines de la web, más difícil será para los rastreadores de IA aprender a evadirlos todos.
La diversidad técnica es parte de la estrategia.
El llamado a la comunidad y el futuro de la defensa
La propuesta de ShieldFont es solo una pieza en un ecosistema más amplio de defensas contra el rastreo no autorizado.
Los diseñadores reconocen que ninguna solución única será infalible.
Por eso invitan a otros desarrolladores y aficionados a crear sus propias versiones del concepto básico.
La idea de mostrar una cosa para los humanos y otra para las máquinas puede implementarse de múltiples maneras.
Cuantas más variantes existan, más difícil será para los rastreadores de IA entrenar modelos capaces de evadir todas las defensas.
Esta diversidad técnica es una estrategia deliberada de los creadores.
El documento técnico de ShieldFont no solo describe la fuente, sino que también ofrece datos sobre su efectividad en pruebas reales.
Los resultados sugieren que incluso los rastreadores más avanzados tendrían que invertir significativamente más recursos para extraer valor.
Para los editores de sitios web, especialmente en nichos como criptomonedas, blockchain e inteligencia artificial, la protección de contenido es una preocupación creciente.
Muchos de estos sitios generan análisis y datos muy codiciados por empresas de IA.
La aparición de herramientas como ShieldFont refleja una tensión más profunda entre creadores y plataformas de entrenamiento.
Mientras los creadores buscan conservar el control sobre su propiedad intelectual, las empresas de IA buscan cada vez más datos para mejorar sus modelos.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
IA
DeepSeek lanza V4 Pro a $0.87 por millón de tokens, una séptima parte del precio de Grok 4.6
Bitcoin
BIP-110 fracasa: ¿captura minera o gobernanza de Bitcoin funcionando?
Curiosidades
Estudiante del MIT revoluciona la física cuántica con principio de incertidumbre fractal
Energía