Abliteration.ai ofrece desde un navegador versiones modificadas de modelos de pesos abiertos, incluido GLM-5.3, sin buena parte de sus negativas de seguridad. La propuesta busca servir a equipos de red teaming y ciberseguridad, pero expertos advierten que la misma facilidad podría ampliar el acceso a capacidades peligrosas.
***
- Abliteration.ai aloja modelos de pesos abiertos con sus guardrails eliminados y los ofrece por navegador o API.
- La startup sostiene que sus clientes necesitan reproducir conductas dañinas para probar agentes y sistemas de defensa.
- Expertos y empresas de red teaming discrepan sobre la utilidad real de estos modelos y reclaman nuevas medidas de control.
Una startup llamada Abliteration.ai está convirtiendo en servicio comercial una práctica conocida entre desarrolladores de inteligencia artificial de pesos abiertos: eliminar las salvaguardas que llevan a un modelo a rechazar solicitudes dañinas. La plataforma aloja versiones modificadas de distintos sistemas, incluido GLM-5.3, de Z.ai, y permite consultarlos desde un navegador o mediante una API. La propuesta reduce de forma importante la complejidad técnica y el costo computacional que antes enfrentaban quienes debían descargar, ajustar y ejecutar estos modelos por su cuenta.
La empresa sostiene que su objetivo principal es apoyar el trabajo de ciberseguridad, el red teaming y las pruebas de agentes que los modelos convencionales se niegan a realizar. El argumento parte de una premisa utilizada en seguridad: los defensores necesitan reproducir ciertas conductas de los atacantes para comprenderlas y bloquearlas. Sin embargo, retirar las negativas también puede facilitar solicitudes relacionadas con robo de credenciales, intrusiones informáticas, violencia o biotecnología peligrosa, lo que sitúa a Abliteration.ai en el centro de un debate cada vez más urgente sobre el acceso a la IA.
El término abliteration describe una técnica mediante la cual investigadores y desarrolladores modifican un modelo para reducir su tendencia a negarse ante determinadas peticiones. La práctica lleva años circulando en comunidades de código abierto y existen miles de modelos abliterados alojados en Hugging Face, pero Abliteration.ai busca trasladarla desde ese entorno técnico a una experiencia accesible para clientes comerciales. TechCrunch informó que la compañía fue fundada a finales del año pasado y se incorporó oficialmente en marzo, aunque todavía no ha levantado capital de riesgo.
Un servicio que reduce las barreras de acceso
La plataforma permite que un usuario cree una cuenta y comience a interactuar con una versión modificada de GLM-5.3 desde una interfaz web. En las pruebas realizadas por TechCrunch, el sistema respondió a solicitudes que un modelo con salvaguardas normalmente rechazaría, incluidas instrucciones para robar contraseñas guardadas en Chrome y un protocolo para cultivar en casa un patógeno humano peligroso. El medio no reprodujo esas instrucciones, pero describió el comportamiento como una demostración de que las barreras de acceso pueden caer en pocos minutos.
La disponibilidad directa representa un cambio relevante frente al procedimiento habitual, que exige encontrar un modelo previamente modificado, descargar sus archivos y disponer de suficientes unidades de procesamiento gráfico para ejecutarlo. Abliteration.ai concentra esas tareas en una plataforma de cómputo bajo demanda, de modo que el cliente solo necesita registrarse y pagar por el uso. Esa simplificación puede beneficiar a investigadores legítimos, pero también elimina obstáculos que antes podían desalentar a usuarios con intenciones abusivas o con conocimientos técnicos limitados.
El cofundador de la startup, identificado únicamente como Devon a petición suya porque todavía trabaja en otra empresa, afirmó que la compañía mantiene acuerdos con varios grandes proveedores de servicios en la nube. Según su versión, esos contratos pueden financiarse exclusivamente con los ingresos de los clientes, mientras Abliteration.ai conversa con posibles inversionistas para una eventual ronda de capital. La empresa también asegura que entre sus usuarios hay startups de red teaming en etapas tempranas ubicadas en el Reino Unido y Europa.
Devon dijo que algunos clientes ayudan a bancos, aerolíneas y otras compañías vinculadas con infraestructura crítica a evaluar sus prácticas de ciberseguridad. Como ejemplo, mencionó a una empresa que prueba agentes utilizados por bancos y que, según su explicación, no podría emplear los modelos en su configuración original para realizar una evaluación completa. La startup interpreta ese caso como evidencia de que los modelos sin filtros pueden acelerar la defensa, aunque otros especialistas consideran que su papel todavía está lejos de ser indispensable.
La defensa de los modelos sin restricciones
La defensa de Abliteration.ai se basa en la idea de que los atacantes ya pueden modificar sus propios modelos, aunque esas actividades ocurran fuera de la vista pública. Desde esa perspectiva, impedir que los investigadores legítimos accedan a herramientas similares produciría una asimetría: los adversarios explorarían libremente nuevas conductas mientras los defensores trabajarían con sistemas que se niegan a ejecutar pruebas realistas. Devon sostiene que democratizar el acceso a modelos de frontera sin censura permitiría modelar con mayor rapidez a los actores maliciosos.
El razonamiento tiene un paralelo con el red teaming tradicional, en el que un equipo autorizado intenta vulnerar un sistema para descubrir fallas antes de que lo hagan delincuentes. En el caso de los agentes de IA, las pruebas pueden incluir instrucciones adversariales, abuso de herramientas conectadas y generación de código potencialmente peligroso. El problema es que la misma capacidad que sirve para ensayar una defensa puede trasladarse fuera de un entorno autorizado, especialmente cuando la plataforma ofrece acceso remoto y no exige controles de identidad más estrictos.
Andrew Yoon, director de investigación de la organización sin fines de lucro CivAI, advirtió que la abliteración puede modificar el modelo hasta convertirlo, en sus palabras, en un “sociópata” capaz de cumplir prácticamente cualquier solicitud. Yoon espera que modelos editados y abliterados sean utilizados para causar daños en el futuro cercano, aunque reconoció junto con otros expertos que detener por completo la modificación de modelos descargables no parece realista. Su preocupación se concentra, por tanto, en la facilidad con la que terceros pueden acceder a esas versiones.
En un artículo de opinión reciente, Yoon propuso que los gobiernos obliguen a los proveedores a ejecutar clasificadores capaces de detectar y bloquear actividad cibernética dañina o relacionada con armas biológicas. También planteó que las empresas que alquilan acceso a GPU avanzadas verifiquen la identidad de sus clientes y rechacen el servicio cuando existan motivos para sospechar un uso indebido peligroso. Esas medidas trasladarían parte de la responsabilidad desde el modelo, que puede modificarse, hacia la infraestructura que permite ejecutarlo a escala.
Controles todavía en definición
Abliteration.ai ofrece una capa de moderación opcional para que sus clientes incorporen los guardrails que consideren convenientes. La propia plataforma conserva algunos controles menores: durante las pruebas citadas, el modelo no proporcionó instrucciones para suicidarse, y Devon afirmó que la empresa trabaja en mecanismos adicionales para prevenir la violencia. Esa combinación muestra que eliminar salvaguardas no necesariamente significa retirar todos los filtros, pero también deja abierta la pregunta sobre quién decide qué riesgos son aceptables.
Según la información publicada por TechCrunch, la empresa todavía no había implementado prácticas de conocimiento del cliente, conocidas como KYC, más allá del registro de la tarjeta de crédito utilizada para comprar el servicio. La política de privacidad de Abliteration.ai describe, no obstante, medidas operativas relacionadas con la protección de datos, las credenciales y el uso de proveedores de alojamiento. Devon reconoció que establecer criterios para determinar quién debe recibir acceso es complicado y que la startup aún está definiendo el alcance de su responsabilidad. La falta de una verificación de identidad más completa adquiere relevancia porque el servicio permite consultar modelos capaces de producir contenido que otros proveedores bloquearían.
El dilema no se limita a Abliteration.ai, ya que los modelos de pesos abiertos pueden descargarse, modificarse y ejecutarse fuera del control de sus creadores originales. A medida que aumenten sus capacidades, los gobiernos y la industria deberán decidir si conviene regular el modelo, la plataforma de alojamiento, el acceso a la computación o una combinación de esos niveles. El desafío consiste en evitar que las medidas de seguridad castiguen la investigación legítima sin dejar una vía sencilla para usos peligrosos.
La discusión también afecta a la transparencia del sector. Si la abliteración ocurre únicamente en espacios privados, los defensores podrían desconocer qué capacidades están desarrollando los atacantes y cómo probar sus propios sistemas; si se ofrece como un servicio abierto, aumenta la posibilidad de que usuarios no autorizados exploten esas capacidades. La tensión entre visibilidad y riesgo explica por qué algunos especialistas prefieren que estas herramientas existan públicamente, mientras otros reclaman controles antes de ampliar su disponibilidad.
La utilidad real para el red teaming
Las empresas consultadas por TechCrunch coinciden en que los actores maliciosos ya pueden eliminar salvaguardas o ajustar modelos abiertos para sus propios fines, pero no todas consideran que un modelo abliterado sea la mejor herramienta defensiva. Ahmed Aly, CEO de Fabraix, dijo que su compañía confía más en el fine-tuning de modelos abiertos, que suelen tener pocos guardrails, y sostuvo que la abliteración puede eliminar parte del conocimiento y de las capacidades originales. Desde su perspectiva, un sistema menos restringido no necesariamente es más eficaz para producir daño real.
Alessio Lomuscio, tecnólogo jefe de Safe Intelligence, coincidió en que la abliteración podría reducir algunas capacidades del modelo, aunque consideró que todavía puede provocar comportamientos útiles durante las pruebas de estrés. La diferencia importa porque una herramienta de evaluación no necesita ejecutar un ataque real para ser valiosa; puede bastar con que revele cómo responde un agente ante instrucciones peligrosas o manipulaciones adversariales. Aun así, la precisión de los resultados dependerá del modelo utilizado y del entorno controlado donde se realice la prueba.
David Slater, fundador y arquitecto jefe de la plataforma de ciberseguridad Armadin, afirmó que hasta la generación más reciente de modelos de pesos abiertos no resultaba particularmente difícil conseguir que actuaran contra sus restricciones mediante técnicas de jailbreak. Por esa razón, explicó que los modelos abliterados todavía no forman parte del trabajo cotidiano de su empresa, aunque Armadin investiga la técnica y considera fundamental que la comunidad abierta comprenda las capacidades disponibles. Slater también sostuvo que estas actividades ocurrirán de todos modos y que observarlas públicamente puede ayudar a los investigadores a medir el riesgo.
La diferencia entre los especialistas no elimina la necesidad de estudiar la abliteración, pero sí cuestiona la idea de que retirar guardrails sea una condición indispensable para cualquier red team. Algunas compañías pueden obtener resultados similares mediante fine-tuning, simulaciones, jailbreaks controlados o modelos diseñados específicamente para evaluación. Mientras la industria compara esos métodos, Abliteration.ai intenta construir un negocio alrededor de una capacidad que hasta ahora se desarrollaba principalmente en comunidades de código abierto.
El caso plantea una pregunta que será más difícil de evitar con cada nueva generación de modelos descargables: si cualquiera puede eliminar las salvaguardas, ¿hacer que el resultado sea más accesible vuelve a internet más segura o más peligrosa? La respuesta dependerá menos de la técnica aislada que de los controles sobre identidad, infraestructura, monitoreo y uso autorizado. Por ahora, Abliteration.ai representa tanto una herramienta potencial para defensores como una prueba temprana de los límites prácticos de la seguridad en la IA abierta.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Estados Unidos
OpenAI presenta Astra y abre el debate sobre una posible era de inteligencia artificial general
Energía
Australia acelera la carrera de los centros de datos, pero crecen los temores por agua y energía
Empresas
OpenAI comienza el despliegue de Astra en plena alarma por la seguridad de sus agentes
China