Un truco informático permite desnudar el ‘pensamiento’ de los modelos de IA de frontera, revelando posibles destilaciones encubiertas y filtraciones de datos. Investigadores demuestran que versiones más pequeñas de los modelos pueden exponer sus razonamientos ocultos.
***
- Investigadores descubren vulnerabilidad en APIs de OpenAI, Anthropic y Google que expone el razonamiento interno de los modelos de IA.
- El método permite destilar información de modelos cerrados y recuperar contraseñas y claves API, aunque ya fue corregido.
- La destilación se convierte en un tema geopolítico mientras China y EE. UU. compiten por la supremacía en IA.
Un nuevo truco informático permite desnudar los razonamientos internos de los modelos de inteligencia artificial más avanzados, exponiendo secretos que las empresas tecnológicas intentan proteger. Según un artículo de Wired, investigaciones recientes han revelado una vulnerabilidad en las APIs de OpenAI, Anthropic y Google que no solo facilita la destilación a gran escala, sino que también puede filtrar contraseñas y claves API.
El método, desarrollado por científicos de la Universidad de Tubinga, el Instituto Max Planck, MATS Research y la empresa Snyk, permite extraer los “pensamientos” ocultos de los modelos de frontera. Aunque la vulnerabilidad ya fue corregida, el hallazgo ofrece evidencia —aunque no concluyente— de que algunos modelos chinos podrían haber sido entrenados destilando información de razonamiento de modelos estadounidenses.
El truco que desnuda el razonamiento de la IA
Los modelos avanzados de IA resuelven problemas difíciles dividiéndolos en partes que analizan en una “cadena de pensamiento” artificial. Las empresas mantienen en secreto ese razonamiento, pero envían una versión cifrada al ordenador del usuario para transferir parte del cómputo.
El ataque de los investigadores se basa en que la mayoría de las empresas ofrecen modelos de distintos tamaños. Los modelos más pequeños son más débiles pero también menos alineados, lo que significa que están más dispuestos a revelar sus pensamientos internos.
Alimentar las trazas de razonamiento cifradas a una versión más pequeña del mismo modelo puede revelar el razonamiento oculto, explica Alexander Panfilov, científico de la computación de la Universidad de Tubinga. “Todos los principales proveedores de modelos de frontera que probamos comparten esta vulnerabilidad”, advierte.
Panfilov y sus colegas probaron los modelos de OpenAI, Anthropic y Google a través de sus APIs y encontraron el mismo problema. También demostraron que el método podía extraer información secreta, como claves API y contraseñas incrustadas en las trazas de razonamiento.
“La idea de intercambiar mensajes a una variante de modelo más débil que tiene la misma clave de descifrado pero una alineación más débil es genial”, comenta Florian Tramer, científico de seguridad informática en el ETH de Zúrich. “Definitivamente se está convirtiendo en un problema”, añade.
La controversia de la destilación
La destilación es una técnica bien establecida para copiar eficientemente las capacidades de los modelos existentes a otros nuevos. Es especialmente común en el desarrollo de modelos de pesos abiertos o totalmente descargables.
Últimamente, la destilación se ha convertido en un tema controvertido por las afirmaciones de que empresas chinas de IA la utilizan para copiar a los mejores modelos estadounidenses. En febrero, OpenAI dijo a los legisladores de EE. UU. que DeepSeek parecía haber copiado uno de sus modelos para construir el R1.
En junio, Anthropic dijo a los legisladores que Alibaba había destilado sistemáticamente sus modelos para construir el suyo, llamado Qwen. No hay indicios de que hayan utilizado esta técnica específica, pero los investigadores creen que su método permitiría destilar más información de modelos cerrados de lo que se creía.
Mark Zuckerberg, director ejecutivo de Meta, dijo que la destilación es un principio importante de cómo funciona el ecosistema de código abierto. Advirtió que restringir esta práctica pondría a Estados Unidos en desventaja.
Por otro lado, Kyle Miller, investigador del Center for Security and Emerging Technologies, dice que no está claro cuánto ayuda realmente la destilación a China. “Si se eliminara la capacidad de los laboratorios chinos de destilar, el panorama competitivo no cambiaría drásticamente”, afirma.
Los investigadores alimentaron a cada modelo con 90 preguntas para comprobar si los modelos de pesos abiertos destilaban de los cerrados. Al dar las primeras palabras de las trazas de razonamiento capturadas, a veces vieron que los modelos abiertos generaban respuestas notablemente similares.
Evidencia de similitud y reacciones
El modelo chino de pesos abiertos Kimi K3, de Moonshot AI, produjo una salida sorprendentemente similar a las trazas de razonamiento ocultas de Claude Opus 4.8 y GPT 5.6 Sol para ciertos prompts. A pesar de las similitudes, los investigadores señalan que el trabajo no puede establecer causalmente la destilación.
Otros dos modelos de pesos abiertos, DeepSeek de China e Inkling de la empresa estadounidense Thinking Machines, no presentaron esta similitud. Moonshot AI y Z.ai no respondieron a solicitudes de comentarios.
Hubo especulación previa en redes sociales chinas sobre la posibilidad de descubrir y utilizar trazas de razonamiento ocultas para la destilación. Yarin Gal, científico de la computación de la Universidad de Oxford, dice que la destilación no solo está extendida, sino que también ha ayudado a que la IA avance más rápidamente.
Las empresas ya han tomado medidas: Panfilov y sus coautores alertaron a OpenAI, Anthropic y Google, y cada una ha ajustado su API para mitigar el problema. Michael Aciman, portavoz de Anthropic, dijo que valoran la investigación independiente y han comenzado a desarrollar mitigaciones a corto plazo.
Google y OpenAI declinaron hacer comentarios. Panfilov añade que corregir la destilación por completo requeriría una revisión fundamental de la forma en que funcionan las APIs.
Implicaciones geopolíticas y de seguridad
La destilación se ha convertido en un asunto de importancia geopolítica mientras Estados Unidos y China compiten por la supremacía en IA. Los halcones de la línea dura con China afirman que el país obtiene una ventaja estratégica al destilar tecnología estadounidense.
Otros sostienen que la destilación es una forma ampliamente utilizada de impulsar rápidamente las capacidades de un modelo de IA. Zuckerberg defiende esta práctica desde el punto de vista del código abierto.
Kyle Miller señala que solo mejora las capacidades de los modelos existentes en un grado limitado y que las empresas chinas parecen tener la experiencia necesaria para construir modelos de vanguardia desde cero. “Nadie aquí en EE. UU. sabe cuánto está beneficiando la destilación a los laboratorios chinos”, dice.
Los investigadores también destacan que el método podría usarse para recuperar información personal, aunque esa vulnerabilidad ya fue corregida. Sin embargo, algunas trazas de razonamiento aún pueden descubrirse con el mismo método.
Panfilov y sus colaboradores afirman que el uso de su método permitiría destilar más información de los modelos cerrados de lo que se creía hasta ahora. Esto podría tener implicaciones significativas para la propiedad intelectual en la industria de la IA.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Mozilla revoca clave de firma de Firefox tras filtrarse en GitHub
IA
Modelos de IA ya pueden notar pensamientos inyectados en sus redes neuronales
Bitcoin
Anthropic firma acuerdo de USD $9.100 millones con minero de Bitcoin Riot Platforms
Estados Unidos