Por Canuto  

Un nuevo proyecto llamado OpenWALDO busca construir un conjunto de datos de entrenamiento de IA compartido y de código abierto. Liderado por Gregory Kurtzer, fundador de CentOS y Rocky Linux, el esfuerzo financiado por CIQ pretende llevar la transparencia del software libre al mundo de los modelos de inteligencia artificial.
***

  • OpenWALDO ya cuenta con 167,3 mil millones de tokens de fuentes públicas, una fracción mínima frente a los billones usados por los gigantes de la IA.
  • El proyecto, respaldado por la empresa CIQ, busca auditar la procedencia de los datos y evitar trabajo duplicado en el entrenamiento de modelos.
  • Kurtzer sostiene que el código abierto ya ganó la batalla de la confianza en el software, y que la IA necesita la misma propiedad de inspección y bifurcación.

 


Gregory Kurtzer, conocido por fundar CentOS y Rocky Linux, presentó un ambicioso proyecto llamado OpenWALDO. El objetivo es crear un conjunto de datos de entrenamiento de inteligencia artificial compartido y de código abierto.

El nombre es un acrónimo de Open Weights, Artifacts, Licenses, Data, Origins. La iniciativa está financiada por CIQ, la empresa de infraestructura de IA de Kurtzer que también patrocina Rocky Linux.

Kurtzer describió el esfuerzo como un intento de llevar el espíritu del código abierto al diseño de modelos de IA. Según él, esa industria aún no ha alcanzado un nivel verdaderamente abierto.

El problema de los datos cerrados

Incluso los modelos de pesos abiertos que se pueden descargar libremente carecen de transparencia completa. Sus datos de entrenamiento siguen siendo de código cerrado y desconocidos para los usuarios, indica The Register.

CIQ explicó que esos modelos suelen basarse en fuentes problemáticas. Entre ellas figuran datos protegidos por derechos de autor, respuestas destiladas de otros modelos y contenido generado por usuarios sin consentimiento claro.

La empresa advirtió que a menudo no hay forma de saber qué datos entrenaron un modelo determinado. Tampoco se conoce bajo qué licencia se utilizaron ni con qué consentimiento se obtuvieron.

Ese contenido oculto podría contaminar los modelos resultantes. Esto pone en riesgo las pilas de software de los clientes que dependen de esos sistemas.

Además, el entrenamiento secreto genera una enorme duplicación de trabajo. Cada laboratorio dedica tiempo y recursos informáticos a crear sus propios conjuntos de datos, sin compartir avances.

La visión de Gregory Kurtzer

Kurtzer tiene una larga trayectoria en el mundo del código abierto. Fundó CentOS, una distribución derivada de Red Hat Enterprise Linux, y luego Rocky Linux tras los cambios de CentOS.

En el anuncio de OpenWALDO, afirmó: “He pasado mi carrera viendo cómo el código abierto convertía a los usuarios en creadores, a los competidores en colaboradores y los problemas compartidos en infraestructura común que opera a gran escala”.

Para él, ese modelo probado debe aplicarse a la inteligencia artificial. “OpenWALDO lleva ese modelo probado a la IA”, declaró.

Su propuesta es simple: trabajar juntos para construir los cimientos de la IA en abierto. De esa forma, se podría llevar la tecnología al siguiente nivel de manera colaborativa.

Kurtzer también respondió a las preocupaciones de seguridad sobre los modelos abiertos. Recordó que el software de código abierto enfrentó críticas similares en sus inicios.

Beneficios de un corpus compartido

CIQ sostiene que un único conjunto compartido de datos de entrenamiento públicos haría el proceso más eficiente. Cada mejora del conjunto beneficiaría a todos los modelos futuros.

Un laboratorio o empresa podría tomar el corpus como base verificada. Luego añadiría sus propios datos propietarios antes de construir y publicar sus modelos.

De esa forma, existiría una línea clara y auditable de vuelta a las fuentes originales. Esto facilitaría el cumplimiento normativo y reduciría riesgos legales.

La transparencia permitiría a los usuarios saber exactamente qué información alimentó a un modelo. También podrían verificar que no se usaron datos sin permiso.

El proyecto pretende eliminar el trabajo redundante que hoy realizan los laboratorios. En lugar de reinventar la rueda, todos podrían partir de una base común.

El estado actual del proyecto

OpenWALDO ya cuenta con un corpus inicial de 167,3 mil millones de tokens. Estos provienen de registros gubernamentales, artículos académicos de código abierto, listas de correo y literatura de dominio público.

Sin embargo, esa cifra es una gota en el océano. Los modelos de frontera y sus contrapartes de pesos abiertos se entrenan con decenas de billones de tokens.

Hasta ahora, nadie ha entrenado un modelo con el conjunto de OpenWALDO. CIQ no respondió a la pregunta de The Register sobre ese punto.

El proyecto está en una fase temprana y busca colaboradores. Quienes estén interesados pueden consultar el sitio web del proyecto y su página de GitHub.

El éxito de OpenWALDO dependerá de la adopción por parte de la comunidad. Si pocos contribuyen, la iniciativa podría quedar como otro oscuro proyecto de código abierto.

Contexto competitivo

Los modelos de IA abiertos han cobrado protagonismo en los últimos tiempos. Suelen ser más baratos que los servicios cerrados de laboratorios como OpenAI o Anthropic.

Los modelos de pesos abiertos procedentes de China se acercan cada vez más a las capacidades de ChatGPT y Claude. Esto ha llevado a muchas empresas a cuestionar el valor de pagar por servicios que no controlan.

Algunos laboratorios de frontera han advertido sobre los riesgos de seguridad de los modelos abiertos. Kurtzer considera que el código abierto ya ganó esta discusión en el pasado.

“El código abierto ya ha ganado esta discusión antes”, afirmó. Se refería a los argumentos sobre inseguridad y falta de confianza que se usaron contra Linux.

“Linux no ganó por estar certificado como seguro. Ganó por ser inspeccionable, bifurcable y validado por la comunidad”, añadió Kurtzer.

Según The Register, OpenWALDO busca replicar esa propiedad para la IA. La pregunta es si la industria, tan acostumbrada al secreto, estará dispuesta a cambiar.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín