Por Canuto  

Google DeepMind ensaya una evaluación criptográfica de doble ciego para impedir que los modelos de IA conozcan las preguntas de los benchmarks antes de ser examinados.
***

  • Google DeepMind prueba un modelo de la línea Gemini Flash Lite con benchmarks confidenciales.
  • La tecnología Confidential Space busca mantener privados tanto los pesos del modelo como los prompts de evaluación.
  • El método podría ser especialmente relevante para pruebas de ciberseguridad y evaluaciones solicitadas por gobiernos.


Un problema que pone en duda las puntuaciones

Las pruebas comparativas, conocidas como benchmarks, se han convertido en una herramienta central para medir el desempeño de los modelos de inteligencia artificial. Empresas, investigadores y organizaciones independientes utilizan sus resultados para comparar sistemas, identificar avances y respaldar afirmaciones sobre capacidades cada vez más sofisticadas. Sin embargo, una puntuación elevada pierde fuerza si el modelo ya vio las preguntas durante su entrenamiento o si el proveedor pudo optimizarlo específicamente para responder ese examen.

Google DeepMind presentó este riesgo mediante una comparación sencilla: si una persona conoce las preguntas antes de ingresar a una prueba, una calificación perfecta no demuestra necesariamente que domine el tema. En el ámbito de la IA, este fenómeno recibe el nombre de contaminación de benchmarks y dificulta saber si un sistema resolvió un problema nuevo o simplemente reconoció información que ya había encontrado. La compañía considera que el desafío amenaza la confianza en las evaluaciones externas de los modelos más avanzados.

Como respuesta, Google DeepMind anunció el lanzamiento de lo que describe como la primera evaluación de doble ciego aplicada a un modelo propietario de IA fronteriza. En el proyecto piloto, un modelo de la línea Gemini Flash Lite se enfrentará a benchmarks confidenciales cuyos prompts permanecerán protegidos durante el proceso. La iniciativa se desarrolla con el AI Safety Institute de Singapur y otros socios, según la información publicada sobre el proyecto.

El objetivo no consiste solamente en ocultar las preguntas de manera administrativa, sino en impedir técnicamente que el modelo pueda utilizarlas más adelante para mejorar su rendimiento en ese mismo test. Esa diferencia resulta importante porque los acuerdos de confidencialidad pueden restringir el uso de la información, pero no necesariamente eliminan todos los riesgos operativos o de acceso. Google busca que la arquitectura criptográfica convierta esa protección en una propiedad verificable del proceso de evaluación.

Cómo funcionaría la evaluación de doble ciego

Las evaluaciones externas sensibles suelen enfrentar un intercambio incómodo entre privacidad y verificabilidad. Si los evaluadores entregan sus prompts al proveedor del modelo, la empresa puede conocer las preguntas con anticipación; si el proveedor entrega los pesos del sistema, en cambio, arriesga información que considera propiedad intelectual. Google sostiene que su propuesta intenta eliminar esa disyuntiva sin obligar a ninguna de las partes a revelar sus activos principales.

El piloto utiliza Confidential Space, una herramienta perteneciente a la cartera de computación confidencial de Google Cloud. Según la descripción del proyecto, este entorno puede verificar criptográficamente que los datos de prueba externos y el modelo permanezcan privados para sus respectivos propietarios mientras se ejecuta la evaluación. En términos prácticos, el evaluador no ve los pesos de Gemini y Google no ve los prompts confidenciales utilizados para examinarlo.

La protección técnica se suma a mecanismos que ya se empleaban para preservar la confidencialidad, entre ellos protocolos de cero registros y salvaguardas contractuales. La empresa presenta la combinación como un avance porque reduce la necesidad de confiar exclusivamente en promesas, cláusulas legales o controles internos. Aun así, el sistema no elimina la importancia de diseñar buenos benchmarks, seleccionar muestras representativas y revisar cómo se interpretan sus resultados.

La metodología y los resultados del piloto serán determinantes para evaluar qué garantías ofrece el entorno, qué partes del procedimiento pueden auditarse y cuáles limitaciones persisten en una prueba de este tipo. Una evaluación protegida puede reducir el riesgo de contaminación, pero su valor final también dependerá de la calidad de los datos y de la transparencia sobre las condiciones del experimento.

Por qué el método importa en áreas sensibles

La preocupación adquiere mayor peso cuando los benchmarks examinan capacidades relacionadas con ciberseguridad o cuando participan agencias gubernamentales. En esos escenarios, las preguntas pueden incluir información sensible, técnicas que no conviene divulgar o datos cuya soberanía corresponde a una institución específica. Compartir los prompts con un proveedor comercial podría crear riesgos que una organización pública o independiente no está dispuesta a asumir.

Un esquema de doble ciego permitiría que terceros sometan modelos avanzados a pruebas rigurosas sin entregarles los pesos del sistema ni revelar sus propios conjuntos de preguntas. Esa separación puede ampliar la participación de universidades, laboratorios y organismos especializados que actualmente enfrentan restricciones legales, técnicas o de seguridad. También ofrece una vía para comparar modelos sin convertir el proceso de evaluación en una transferencia de propiedad intelectual.

Para Google DeepMind, el beneficio potencial alcanza a toda la industria porque los resultados de los benchmarks influyen en la percepción pública y comercial de los sistemas de IA. Cuando una puntuación no permite distinguir entre aprendizaje genuino y exposición previa a las preguntas, usuarios e instituciones pueden tomar decisiones basadas en una señal defectuosa. La criptografía no resolvería por sí sola ese problema, pero podría fortalecer la confianza en una parte crítica del proceso.

La iniciativa todavía se encuentra en una fase piloto y deberá demostrar que puede funcionar de manera práctica con evaluaciones diversas, socios independientes y requisitos de confidencialidad distintos. El resultado más importante será comprobar si la protección de los datos puede coexistir con una revisión externa suficientemente clara para que sus conclusiones resulten creíbles.

El debate sobre la confianza continuará

La contaminación de benchmarks no es el único factor que puede distorsionar la lectura de una puntuación, pero sí uno de los más difíciles de detectar cuando los datos de entrenamiento de un modelo no son completamente públicos. Los desarrolladores suelen trabajar con grandes volúmenes de información procedente de múltiples fuentes, mientras que los evaluadores necesitan conservar preguntas inéditas para medir capacidades de generalización. Esa tensión se vuelve más intensa a medida que los modelos se entrenan con material disponible en internet y repositorios especializados.

El caso citado en la información de origen fue una evaluación independiente del benchmark ARC-AGI de Fable 5 de Anthropic que no llegó a realizarse. La decisión se relacionó con una política de retención de datos de 30 días, según los reportes citados, y ejemplifica las dificultades logísticas y de privacidad que pueden aparecer incluso cuando existe interés en realizar una prueba independiente. Google presenta su mecanismo como una alternativa para reducir esos conflictos sin exponer directamente los activos de las partes.

Para los usuarios, el cambio podría mejorar la forma en que se comunican las capacidades de la IA, especialmente cuando las empresas utilizan benchmarks para promocionar productos o justificar decisiones de adopción. Una evaluación más protegida no garantiza que un modelo sea seguro, preciso o útil en todos los contextos, pero sí puede ofrecer una medición menos vulnerable a la preparación específica para el examen. Esa distinción resulta esencial para evitar que una cifra llamativa se convierta en una conclusión exagerada.

El piloto con Gemini Flash Lite será, por tanto, una prueba tanto del modelo como del propio mecanismo de confianza. Si el procedimiento logra preservar simultáneamente los prompts y los pesos, otros laboratorios podrían adoptar enfoques similares para estudiar capacidades de razonamiento, seguridad y ciberseguridad. La evolución de estas herramientas determinará si los benchmarks recuperan parte de la autoridad que necesitan para orientar la competencia y la supervisión de la inteligencia artificial.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín