OpenAI ha incorporado una técnica de razonamiento llamada «profundidad recurrente» o «recurrencia opaca» en su nuevo modelo Astra, según reveló The Information. La técnica permite al sistema operar fuera del pensamiento secuencial que caracteriza a la mayoría de modelos de razonamiento, y su implementación ha generado una oleada de alarma entre expertos en seguridad de inteligencia artificial.
Aunque el uso de la técnica en Astra es limitado, su aparición ha suscitado inquietud significativa. Buck Shlegeris, CEO de Redwood Research, declaró en redes sociales: «Estoy extremadamente preocupado por los informes de que Astra utiliza recurrencia opaca. Si OpenAI impulsa esta técnica más allá, tendrán la opción de incrementar masivamente la recurrencia y destruir totalmente la monitorización de la cadena de pensamiento».
En condiciones normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el sistema al resolver un problema. Aunque imperfecta, esta representación sirve como herramienta valiosa para detectar comportamientos inadecuados o desalineación. En el caso de la reciente actividad anómala de agentes de OpenAI, los registros de cadena de pensamiento fueron cruciales para desentrañar las causas del comportamiento.
Con la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en bucle. El resultado deja menos rastros legibles, esquivando efectivamente un registro convencional de cadena de pensamiento. Esto dificulta que investigadores y sistemas de supervisión comprendan cómo y por qué el modelo llega a determinadas conclusiones.
El veterano defensor de la seguridad en IA Zvi Mowshowitz advirtió que podrían ser necesarias leyes para evitar una «carrera hacia el abismo» entre laboratorios de IA. «La técnica está jugando con fuego, arriesgando un tabú que OpenAI y Anthropic han luchado por establecer: trabajar arduamente para mantener la fidelidad y monitorización de la cadena de pensamiento el mayor tiempo posible», escribió Mowshowitz.
OpenAI defiende su compromiso con la transparencia
El uso de la técnica por parte de Astra parece ser limitado. La cadena de pensamiento del modelo se espera que siga siendo legible, y la compañía rechazó cualquier sugerencia de que cambiaría a «neuralés» (un lenguaje interno ininteligible para humanos). OpenAI ya ha anunciado planes para sistemas extensivos de monitorización de cadenas de pensamiento como parte de sus planes de seguridad prospectivos.
Jakub Pachocki, científico jefe de OpenAI, enfatizó el compromiso del laboratorio con cadenas de pensamiento legibles: «OpenAI ha trabajado para preservar y utilizar la monitorización de cadenas de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo central de nuestro programa de investigación actual».
Según un informe posterior de The Information, tanto Anthropic como Google DeepMind ya estaban discutiendo la técnica. Ryan Greenblatt, científico jefe de Redwood Research, expresó que el razonamiento opaco podría escalar más rápido que el razonamiento convencional de cadena de pensamiento, eliminando efectivamente todo el razonamiento de canales visibles.
«Mi mayor preocupación es que una progresión natural desde aquí implicaría escalar el razonamiento opaco hasta el punto en que el modelo razone completa o casi completamente en espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».
La controversia subraya la tensión creciente entre el avance técnico en modelos de IA y la capacidad de los sistemas de seguridad para supervisarlos adecuadamente. La IA podría reducir fallos de software, pero también plantea nuevos desafíos de supervisión que la industria apenas comienza a abordar.
