Un desarrollador publicó en Hugging Face metadatos de miles de millones de videos públicos de TikTok, con una licencia no comercial y datos que podrían interesar a quienes entrenan modelos de IA. El método de extracción descrito en su informe, sin embargo, podría entrar en conflicto con las reglas de la plataforma sobre scraping automatizado.
***
- El conjunto gratuito reúne metadatos de unos 5.600 millones de videos públicos y ocupa 460 GB en archivos mensuales.
- El informe del proyecto atribuye la recolección a una API móvil privada de TikTok; los términos de la plataforma, según el reporte, restringen el scraping automatizado sin autorización escrita.
- La licencia permite usos personales y de investigación, mientras que el uso comercial, las actualizaciones y el código del scraper se ofrecen por separado.
Un desarrollador identificado como hashfunction publicó en Hugging Face un conjunto de datos con metadatos de unos 5.600 millones de videos públicos de TikTok. El material está disponible sin costo bajo una licencia que restringe el uso comercial y ofrece información sobre publicaciones, interacción y otros atributos de los videos, no las grabaciones mismas.
Decrypt informó que los archivos suman 460 GB y están organizados en formato Parquet, con un archivo por mes. La tarjeta del conjunto señala que sus registros cubren desde julio de 2014 hasta octubre de 2026. Por su parte, el informe del proyecto menciona otra cifra de videos recopilados, una diferencia que conviene tener en cuenta al evaluar el alcance de la colección, detalla Decrypt.
Qué contiene el conjunto de datos
Las filas incluyen subtítulos, hashtags, identificadores de sonidos, texto que aparece en pantalla y cifras de vistas, me gusta, comentarios, compartidos, guardados y descargas. También incorporan identificadores de productos y vendedores de TikTok Shop, datos que podrían servir para estudiar cómo circulan los contenidos y qué publicaciones se vinculan con ofertas comerciales.
El conjunto incluye además campos propios de la plataforma, como una marca que indica si un video fue generado con inteligencia artificial y otra que señala si TikTok lo excluye de la página Para ti. Según la descripción del proyecto, la etiqueta de IA suele estar vacía en publicaciones antiguas porque esos registros provienen de un archivo, una limitación que afecta la interpretación de esa variable.
La publicación abierta no contiene una columna con el nombre de usuario del creador, pero sí reúne atributos del contenido, como subtítulos, hashtags y personas mencionadas en los videos. El identificador de usuario, en cambio, aparece disponible en el sitio de DataSocial. La diferencia entre los datos gratuitos y los servicios asociados importa para entender qué información puede consultar cada usuario.
Acceso para investigación y límites de TikTok
Los datos de interacción de publicaciones pueden resultar valiosos para investigadores y desarrolladores de inteligencia artificial, porque permiten examinar tendencias de contenido, lenguaje y actividad comercial a gran escala. En teoría, los registros podrían ayudar a analizar qué expresiones se asocian con mayor circulación o qué características aparecen en videos vinculados a productos. Eso no significa que el conjunto, por sí solo, permita predecir con certeza qué se volverá viral.
El acceso oficial de TikTok es más acotado: sus herramientas de investigación están disponibles para investigadores calificados de instituciones académicas en regiones como Estados Unidos, el Espacio Económico Europeo, Reino Unido, Canadá y Suiza, además de algunas organizaciones sin fines de lucro de la Unión Europea. Los interesados deben presentar una solicitud y obtener aprobación, de modo que la descarga pública ofrece una ruta distinta a la vía institucional de la plataforma.
El informe cita la sección 3.4 de los términos de servicio de TikTok para Estados Unidos, que, según el reporte, prohíbe extraer datos mediante software automatizado sin aprobación escrita de la empresa. Esa regla vuelve relevante el método descrito por el proyecto, aunque la publicación del conjunto y la existencia de una licencia propia no equivalen a una autorización de TikTok para recolectar o redistribuir los datos.
El informe de DataSocial afirma que su sistema accedió a una API móvil privada de TikTok sin iniciar sesión, mediante identidades de dispositivo generadas para aparentar ser teléfonos Android, firmas de solicitudes obtenidas por ingeniería inversa y un handshake TLS suplantado. El documento sostiene que, en tres semanas, el sistema reunió 3.230 millones de perfiles de creadores, 5.940 millones de videos y 2.800 millones de comentarios. Esta última cifra de videos difiere de los aproximadamente 5.600 millones descritos en la publicación gratuita, y el material disponible no permite reconciliar ambas cifras.
Un modelo gratuito con servicios de pago
El conjunto se distribuye bajo la licencia CC BY-NC 4.0, que permite compartirlo con atribución para fines no comerciales, y su tarjeta lo presenta como gratuito para investigación y uso personal. La descarga abierta funciona también como una muestra de la oferta de DataSocial: el uso comercial, los perfiles de creadores y las actualizaciones diarias se ofrecen a través de su sitio web.
El código fuente del scraper se vende por separado por USD $1.699, según la información del proyecto. Así, el acceso a los archivos y a las herramientas para generar o mantener una recolección semejante no tienen las mismas condiciones, una diferencia que puede ser importante para empresas que necesiten datos actualizados o quieran incorporarlos a un producto comercial.
El reporte también menciona copias de otro conjunto con 4.500 millones de videos, igualmente descrito como recolectado mediante la API móvil de TikTok. Ese material también se ofrece gratis para uso no comercial, mientras que el código empleado para obtenerlo cuesta USD $1.699, según la información proporcionada.
La colección plantea preguntas sobre quién puede recopilar información pública a gran escala, bajo qué condiciones puede redistribuirla y hasta dónde puede reutilizarse para entrenar sistemas de IA. La licencia del repositorio fija límites para quienes descargan los archivos, mientras que los términos de TikTok y el método descrito por el desarrollador abren una cuestión distinta: si la recolección contó con autorización de la plataforma. La información disponible no lo confirma.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
AltCoins
Bittensor (TAO) el 6 de octubre de 2026: avance con volumen debilitado
Capital de Riesgo
OpenAI busca al menos USD $30.000 millones de fondos emiratíes y BlackRock en plena disputa por la seguridad de la IA
IA
Musubi lleva modelos de decisión de IA a la moderación de contenidos en tiempo real
Empresas
