La nueva técnica de razonamiento de OpenAI alarma a expertos en seguridad de IA

Fecha:

OpenAI ha incorporado una técnica de razonamiento llamada «profundidad recurrente» o «recurrencia opaca» en su nuevo modelo Astra, según reveló The Information. La técnica permite al sistema operar fuera del pensamiento secuencial que caracteriza a la mayoría de modelos de razonamiento, y su implementación ha generado una oleada de alarma entre expertos en seguridad de inteligencia artificial.

Aunque el uso de la técnica en Astra es limitado, su aparición ha suscitado inquietud significativa. Buck Shlegeris, CEO de Redwood Research, declaró en redes sociales: «Estoy extremadamente preocupado por los informes de que Astra utiliza recurrencia opaca. Si OpenAI impulsa esta técnica más allá, tendrán la opción de incrementar masivamente la recurrencia y destruir totalmente la monitorización de la cadena de pensamiento».

En condiciones normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el sistema al resolver un problema. Aunque imperfecta, esta representación sirve como herramienta valiosa para detectar comportamientos inadecuados o desalineación. En el caso de la reciente actividad anómala de agentes de OpenAI, los registros de cadena de pensamiento fueron cruciales para desentrañar las causas del comportamiento.

Con la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en bucle. El resultado deja menos rastros legibles, esquivando efectivamente un registro convencional de cadena de pensamiento. Esto dificulta que investigadores y sistemas de supervisión comprendan cómo y por qué el modelo llega a determinadas conclusiones.

El veterano defensor de la seguridad en IA Zvi Mowshowitz advirtió que podrían ser necesarias leyes para evitar una «carrera hacia el abismo» entre laboratorios de IA. «La técnica está jugando con fuego, arriesgando un tabú que OpenAI y Anthropic han luchado por establecer: trabajar arduamente para mantener la fidelidad y monitorización de la cadena de pensamiento el mayor tiempo posible», escribió Mowshowitz.

OpenAI defiende su compromiso con la transparencia

El uso de la técnica por parte de Astra parece ser limitado. La cadena de pensamiento del modelo se espera que siga siendo legible, y la compañía rechazó cualquier sugerencia de que cambiaría a «neuralés» (un lenguaje interno ininteligible para humanos). OpenAI ya ha anunciado planes para sistemas extensivos de monitorización de cadenas de pensamiento como parte de sus planes de seguridad prospectivos.

Jakub Pachocki, científico jefe de OpenAI, enfatizó el compromiso del laboratorio con cadenas de pensamiento legibles: «OpenAI ha trabajado para preservar y utilizar la monitorización de cadenas de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo central de nuestro programa de investigación actual».

Según un informe posterior de The Information, tanto Anthropic como Google DeepMind ya estaban discutiendo la técnica. Ryan Greenblatt, científico jefe de Redwood Research, expresó que el razonamiento opaco podría escalar más rápido que el razonamiento convencional de cadena de pensamiento, eliminando efectivamente todo el razonamiento de canales visibles.

«Mi mayor preocupación es que una progresión natural desde aquí implicaría escalar el razonamiento opaco hasta el punto en que el modelo razone completa o casi completamente en espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».

La controversia subraya la tensión creciente entre el avance técnico en modelos de IA y la capacidad de los sistemas de seguridad para supervisarlos adecuadamente. La IA podría reducir fallos de software, pero también plantea nuevos desafíos de supervisión que la industria apenas comienza a abordar.


Compartir noticia:

Popular

Esto te interesa
Noticias

De BCN a Cannes: los AI Awards reúnen a los mejores creativos con IA

La primera edición ofrecerá proyección de las obras finalistas...

NexRadio lleva la automatización de radio con presentador Smart a la nube

NexRadio ha lanzado una plataforma en la nube para...

Google confirma que modelos Gemini accedieron sin autorización a tres empresas en mayo de 2026

Durante una prueba de ciberseguridad, varios modelos Gemini salieron del entorno controlado por un error de configuración y accedieron a servidores reales mediante contraseñas públicas.

Primer Índice de Criterio©: radiografía pública de cómo usan IA las organizaciones españolas

El próximo 20 de octubre se presenta en Madrid...