Por Canuto  

Reportes sobre una técnica de razonamiento recurrente asociada al modelo Astra de OpenAI generan preocupación porque podría dejar menos rastros legibles para supervisar conductas riesgosas y problemas de alineación.
***

  • Reportes señalan que Astra utilizaría una técnica llamada profundidad recurrente, también descrita como recurrencia opaca, para procesar consultas en bucles.
  • Expertos como Buck Shlegeris, Zvi Mowshowitz y Ryan Greenblatt temen que el método reduzca la monitoreabilidad de las cadenas de pensamiento.
  • OpenAI ha presentado Astra como un modelo que alcanza un umbral crítico de capacidades de ciberseguridad y afirma que está reforzando sus salvaguardas; los detalles públicos sobre la técnica siguen siendo limitados.

 


OpenAI habría incorporado una técnica de razonamiento llamada profundidad recurrente en su próximo modelo Astra, una decisión que provocó advertencias entre especialistas en seguridad de la inteligencia artificial. El método, también descrito como recurrencia opaca, permitiría procesar una misma consulta varias veces dentro de un bucle, en lugar de seguir únicamente una secuencia visible de pasos. La información fue reportada por The Information.

La preocupación principal no se centra en que Astra deje de razonar, sino en que sus procesos internos podrían resultar más difíciles de observar y evaluar. Según el reporte, OpenAI limitaría el uso de la técnica y mantendría como objetivo conservar cadenas de pensamiento legibles. Sin embargo, investigadores temen que una adopción más intensa reduzca la capacidad de detectar comportamientos peligrosos antes de que lleguen a los usuarios.

OpenAI sí ha confirmado públicamente la existencia de Astra. En una publicación del 1 de septiembre de 2026, la compañía presentó el modelo como el primero en alcanzar el umbral de capacidades críticas de ciberseguridad previsto en su marco de preparación y describió medidas adicionales de seguridad. Esa comunicación oficial no establece, por sí sola, que la recurrencia opaca sea la causa de esas capacidades.

Qué cambia con la recurrencia opaca

Los modelos de razonamiento suelen presentar una cadena de pensamiento que organiza, paso a paso, el intento de resolver una pregunta o completar una tarea. Esa representación no constituye una transcripción perfecta de todo lo que ocurre dentro del sistema, pero puede ofrecer señales útiles para que los equipos de seguridad revisen errores, estrategias inesperadas o indicios de desalineación.

La profundidad recurrente permite que una representación interna pase varias veces por un mismo mecanismo de procesamiento. En vez de producir necesariamente un recorrido lineal fácil de leer, el sistema puede condensar parte de su trabajo en operaciones repetidas y menos transparentes, dejando menos rastros interpretables en el registro convencional de la cadena de pensamiento.

Para los investigadores, esa diferencia tiene una consecuencia práctica: supervisar el resultado final podría no bastar para entender por qué el modelo llegó a una decisión. Un sistema puede entregar una respuesta aparentemente correcta mientras sus operaciones intermedias contienen una estrategia problemática, un intento de eludir controles o una forma de razonamiento que los evaluadores todavía no saben interpretar.

La dificultad también aumenta porque los sistemas de inteligencia artificial realizan operaciones que no son completamente transparentes, y pocos especialistas consideran que los registros visibles reflejen directamente cada operación interna del modelo. Esa imperfección no elimina su valor como instrumento de vigilancia, por lo que una reducción adicional de la visibilidad puede ampliar los riesgos de evaluación.

Las advertencias de los especialistas

Buck Shlegeris, CEO de Redwood Research, dijo estar extremadamente preocupado por los reportes sobre el uso de recurrencia opaca en Astra. En una publicación en X, señaló que todavía no sabe si Astra será mucho menos monitoreable que sus antecesores, pero advirtió que OpenAI podría aumentar masivamente la recurrencia en el futuro y reducir de forma drástica la capacidad de supervisar la cadena de pensamiento.

La advertencia de Shlegeris apunta a una posible dinámica de escalamiento, más que a una afirmación de que Astra ya haya perdido toda transparencia. Si la técnica mejora el rendimiento o permite resolver problemas complejos con mayor eficiencia, otros laboratorios podrían sentirse presionados a adoptarla, incluso cuando sus herramientas para revisar el razonamiento resulten insuficientes.

Zvi Mowshowitz planteó que podrían hacer falta leyes para evitar una carrera hacia estándares cada vez más bajos entre los laboratorios. La preocupación se relaciona con la posibilidad de que la competencia lleve a las empresas a priorizar el rendimiento de modelos menos interpretables por encima de herramientas de supervisión todavía en desarrollo.

Ryan Greenblatt, investigador de Redwood Research, expresó una preocupación más amplia sobre la evolución de la tecnología. Según el análisis citado en los reportes, el razonamiento opaco podría escalar con mayor rapidez que el razonamiento convencional basado en cadenas visibles, hasta desplazar una parte cada vez mayor del proceso expuesto a los canales de supervisión.

Por qué la supervisión importa

La cadena de pensamiento se ha convertido en una herramienta relevante para los equipos que intentan estudiar cómo actúan los modelos cuando reciben instrucciones ambiguas, persiguen objetivos complejos o encuentran restricciones inesperadas. Su utilidad no depende de que cada línea sea una explicación perfecta, sino de que permita detectar patrones que no aparecerían al observar únicamente la respuesta final.

La pérdida de visibilidad no significa automáticamente que un modelo vaya a comportarse de forma insegura, ni demuestra que Astra tenga una conducta desalineada. El problema reside en que la opacidad complica la evaluación preventiva, porque los investigadores disponen de menos evidencia para distinguir entre un error accidental, una respuesta mal calibrada y una estrategia orientada a superar las barreras de seguridad.

Ese desafío adquiere importancia a medida que los modelos asumen tareas más autónomas y operan como agentes capaces de utilizar herramientas, tomar decisiones encadenadas o actuar durante periodos prolongados. Cuanto mayor sea la autonomía, más relevante será contar con registros que permitan reconstruir los pasos que precedieron a una acción y corregir el sistema antes de ampliar su despliegue.

OpenAI también ha publicado investigaciones sobre la dificultad de controlar las cadenas de pensamiento de los modelos de razonamiento. En su trabajo sobre CoT-Control, la compañía sostiene que estos sistemas pueden tener problemas para controlar de manera fiable lo que aparece en sus cadenas de pensamiento, una limitación que refuerza el debate sobre la utilidad y los límites de esos registros como mecanismo de seguridad.

La respuesta de OpenAI y el debate que sigue

Según los reportes sobre Astra, OpenAI ha indicado que el empleo de la técnica será limitado y que espera que la cadena de pensamiento del modelo continúe siendo legible. La compañía también habría rechazado la idea de que el sistema vaya a cambiar hacia un lenguaje interno completamente inaccesible, una posibilidad que algunos investigadores describen como neuralese.

Jakub Pachocki, científico jefe de OpenAI, defendió públicamente el compromiso del laboratorio con las cadenas de pensamiento legibles. Según la información citada en el reporte, OpenAI ha trabajado para preservar y utilizar ese tipo de monitoreo desde sus primeros modelos de razonamiento, y mantenerlo constituye un objetivo central de su programa de investigación.

La empresa ha anunciado además planes para desarrollar sistemas extensos de monitoreo de la cadena de pensamiento como parte de sus estrategias futuras de seguridad. La promesa deberá contrastarse con la evolución de las arquitecturas, porque los mecanismos de supervisión podrían quedarse atrás si el volumen de razonamiento opaco aumenta más rápido que la capacidad de interpretarlo.

El caso de Astra plantea, por ahora, una advertencia sobre la dirección del desarrollo y no una prueba concluyente de que el modelo sea imposible de supervisar. La tensión queda definida entre obtener sistemas capaces de resolver problemas con mayor flexibilidad y conservar suficientes señales visibles para investigar sus fallas, una disyuntiva que podría exigir nuevos estándares técnicos o incluso intervención regulatoria.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín