Por Canuto  

Base Labs, brazo de investigación de Baseten, anunció una alianza con Hugging Face y Goodfire para desarrollar infraestructura transparente de evaluación y monitoreo destinada a modelos de IA de pesos abiertos, en un contexto marcado por el aumento de modelos modificados mediante abliteration.
***

  • Base Labs, Hugging Face y Goodfire trabajarán en métodos de evaluación y monitoreo para modelos de pesos abiertos.
  • Hugging Face lista actualmente más de 6.000 modelos sometidos a abliteration, una técnica que puede retirar salvaguardas.
  • Baseten y Goodfire llegan a la alianza tras captar USD $1.500 millones y USD $150 millones, respectivamente, en rondas recientes.


Base Labs, el brazo de investigación creado este año por Baseten, anunció una alianza con Hugging Face y Goodfire AI para desarrollar infraestructura de evaluación y monitoreo de seguridad destinada a modelos de inteligencia artificial de pesos abiertos. La iniciativa busca convertir los controles de seguridad en una parte visible del entrenamiento y el despliegue de estos sistemas, en lugar de incorporarlos de manera improvisada cuando el modelo ya está disponible.

El anuncio llega mientras crece el debate sobre los riesgos de los modelos abiertos, cuyos pesos pueden descargarse, modificarse y redistribuirse con mayor libertad que los sistemas cerrados. La preocupación se concentra especialmente en la abliteration, una técnica que puede eliminar salvaguardas incorporadas durante el entrenamiento y dejar modelos con menos restricciones para responder a solicitudes potencialmente peligrosas.

Una respuesta al riesgo de la abliteration

Hugging Face, plataforma que aloja modelos de inteligencia artificial de código abierto, lista actualmente más de 6.000 modelos sometidos a abliteration. La cifra ilustra la escala del fenómeno, aunque por sí sola no determina que todos esos modelos sean maliciosos ni que tengan el mismo nivel de riesgo, ya que la modificación puede aplicarse con distintos objetivos y grados de eficacia.

La abliteration se ha convertido en un punto de tensión porque permite alterar un modelo sin reconstruirlo completamente desde cero. Al retirar sus salvaguardas, los desarrolladores pueden cambiar la forma en que el sistema responde ante determinadas solicitudes, lo que dificulta confiar únicamente en las reglas de uso o en controles añadidos después de la publicación.

En ese contexto, Base Labs plantea que la seguridad debe acompañar al modelo desde las primeras etapas de entrenamiento y continuar durante su operación. La propuesta todavía no incluye detalles técnicos públicos sobre las herramientas, las métricas o los procedimientos que utilizarán las tres organizaciones, por lo que el alcance concreto del estándar aún está por definirse.

La alianza también abre una discusión sobre la ventaja y el costo de la transparencia. Base Labs sostiene que la apertura puede mejorar la seguridad porque permite observar con mayor claridad el comportamiento de los modelos y convertir la investigación en controles verificables, aunque esa misma visibilidad facilita que terceros estudien, modifiquen y redistribuyan los sistemas.

Un estándar integrado al ciclo de desarrollo

Base Labs indicó que desarrollará y publicará métodos para entrenar y monitorear modelos abiertos, con la intención de que otros participantes del ecosistema puedan revisarlos y utilizarlos. La empresa describe el proyecto como un estándar transparente que estaría integrado en la forma en que se construyen y despliegan los modelos, no como una capa de protección agregada de manera tardía.

La diferencia es relevante para los operadores de infraestructura, porque un modelo puede comportarse de forma distinta cuando pasa del entorno de entrenamiento a un servicio utilizado por clientes. Un sistema de evaluación continuo permitiría detectar cambios, respuestas inesperadas o debilitamientos de las salvaguardas durante el despliegue, aunque la fuente no especificó cómo se realizarían esas comprobaciones.

Goodfire podría desempeñar un papel central en la parte de interpretabilidad del proyecto. La empresa se especializa en abrir la llamada caja negra de la inteligencia artificial para explicar cómo los modelos toman decisiones, una capacidad que puede ayudar a identificar patrones internos asociados con conductas no deseadas, pero que no equivale por sí sola a una garantía completa de seguridad.

Goodfire resumió su posición al señalar que la seguridad debe integrarse en los modelos abiertos y ser proporcionada por quienes los sirven. Esa formulación sitúa la responsabilidad tanto en quienes desarrollan los modelos como en los proveedores que los convierten en servicios accesibles para usuarios y empresas.

Financiación, capacidades y próximos pasos

Según TechCrunch, Baseten recaudó una ronda Serie F de USD $1.500 millones en junio, operación que elevó su valoración a USD $13.000 millones. La compañía opera como proveedor de inferencia de inteligencia artificial, por lo que su experiencia se relaciona con la ejecución de modelos y con las condiciones necesarias para ofrecerlos como servicios.

Goodfire también llega al proyecto con una importante capacidad financiera. La startup recaudó una ronda Serie B de USD $150 millones, liderada por B Capital a comienzos de este año, para avanzar en su plataforma de interpretabilidad de modelos.

Hugging Face aporta el vínculo con una comunidad amplia de desarrolladores y con un repositorio que concentra modelos de código abierto. Su participación puede facilitar la discusión sobre criterios comunes, documentación y mecanismos de evaluación, aunque las empresas todavía no han explicado si el futuro estándar será obligatorio, voluntario o acompañado por algún proceso formal de certificación.

De cara a la siguiente etapa, Baseten abrió una convocatoria para que desarrolladores y otros integrantes del ecosistema contribuyan al marco. La empresa afirma que el objetivo es construir un entorno de modelos abiertos que sea seguro y accesible para todos, pero la credibilidad de esa promesa dependerá de que los métodos sean reproducibles, los resultados puedan auditarse y los controles sigan funcionando cuando los modelos sean modificados.

La iniciativa no elimina el debate sobre si la apertura aumenta o reduce los riesgos de la inteligencia artificial. Sí propone trasladar parte de esa discusión desde las declaraciones generales hacia herramientas concretas de evaluación, monitoreo e interpretación, en un momento en que miles de modelos pueden circular con cambios difíciles de rastrear.

El próximo desafío será conocer la arquitectura técnica de la asociación y comprobar cómo responderá ante modelos alterados después de su publicación. Hasta que Base Labs, Hugging Face y Goodfire revelen esos detalles, el proyecto representa una convocatoria y una dirección de trabajo, más que un estándar operativo ya implementado.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín