La nueva técnica de razonamiento de OpenAI alarma a expertos en seguridad de IA

Fecha:

OpenAI ha incorporado una técnica de razonamiento llamada «profundidad recurrente» o «recurrencia opaca» en su nuevo modelo Astra, según reveló The Information. La técnica permite al sistema operar fuera del pensamiento secuencial que caracteriza a la mayoría de modelos de razonamiento, y su implementación ha generado una oleada de alarma entre expertos en seguridad de inteligencia artificial.

Aunque el uso de la técnica en Astra es limitado, su aparición ha suscitado inquietud significativa. Buck Shlegeris, CEO de Redwood Research, declaró en redes sociales: «Estoy extremadamente preocupado por los informes de que Astra utiliza recurrencia opaca. Si OpenAI impulsa esta técnica más allá, tendrán la opción de incrementar masivamente la recurrencia y destruir totalmente la monitorización de la cadena de pensamiento».

En condiciones normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el sistema al resolver un problema. Aunque imperfecta, esta representación sirve como herramienta valiosa para detectar comportamientos inadecuados o desalineación. En el caso de la reciente actividad anómala de agentes de OpenAI, los registros de cadena de pensamiento fueron cruciales para desentrañar las causas del comportamiento.

Con la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en bucle. El resultado deja menos rastros legibles, esquivando efectivamente un registro convencional de cadena de pensamiento. Esto dificulta que investigadores y sistemas de supervisión comprendan cómo y por qué el modelo llega a determinadas conclusiones.

El veterano defensor de la seguridad en IA Zvi Mowshowitz advirtió que podrían ser necesarias leyes para evitar una «carrera hacia el abismo» entre laboratorios de IA. «La técnica está jugando con fuego, arriesgando un tabú que OpenAI y Anthropic han luchado por establecer: trabajar arduamente para mantener la fidelidad y monitorización de la cadena de pensamiento el mayor tiempo posible», escribió Mowshowitz.

OpenAI defiende su compromiso con la transparencia

El uso de la técnica por parte de Astra parece ser limitado. La cadena de pensamiento del modelo se espera que siga siendo legible, y la compañía rechazó cualquier sugerencia de que cambiaría a «neuralés» (un lenguaje interno ininteligible para humanos). OpenAI ya ha anunciado planes para sistemas extensivos de monitorización de cadenas de pensamiento como parte de sus planes de seguridad prospectivos.

Jakub Pachocki, científico jefe de OpenAI, enfatizó el compromiso del laboratorio con cadenas de pensamiento legibles: «OpenAI ha trabajado para preservar y utilizar la monitorización de cadenas de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo central de nuestro programa de investigación actual».

Según un informe posterior de The Information, tanto Anthropic como Google DeepMind ya estaban discutiendo la técnica. Ryan Greenblatt, científico jefe de Redwood Research, expresó que el razonamiento opaco podría escalar más rápido que el razonamiento convencional de cadena de pensamiento, eliminando efectivamente todo el razonamiento de canales visibles.

«Mi mayor preocupación es que una progresión natural desde aquí implicaría escalar el razonamiento opaco hasta el punto en que el modelo razone completa o casi completamente en espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».

La controversia subraya la tensión creciente entre el avance técnico en modelos de IA y la capacidad de los sistemas de seguridad para supervisarlos adecuadamente. La IA podría reducir fallos de software, pero también plantea nuevos desafíos de supervisión que la industria apenas comienza a abordar.


Compartir noticia:

Popular

Esto te interesa
Noticias

Seattle Times y Newsday demandan a OpenAI y Microsoft por uso de contenido periodístico

Dos medios estadounidenses acusan a las empresas de IA de entrenar sus modelos con artículos protegidos por copyright, alertando de un daño irreparable a la industria periodística.

BepiColombo completa ocho años de viaje y se prepara para entrar en órbita de Mercurio

La misión europea BepiColombo desprendió su módulo de propulsión tras ocho años de travesía interplanetaria y se alista para su llegada a Mercurio en noviembre de 2026.

XDOF negocia una Serie B valorada en 1.200 millones solo tres meses tras salir del modo sigilo

La startup de robótica fundada por investigadores de UC Berkeley alcanza casi 50 millones de dólares en ingresos anualizados y capta el interés de 8VC para una nueva ronda de financiación.

John Ternus asume el liderazgo de Apple con una gran presentación de iPhone a la vista

Tim Cook cede el puesto de CEO a John Ternus, antiguo jefe de hardware, quien enfrentará su primer evento de iPhone antes de asentarse en el cargo. Cook se queda como presidente ejecutivo.