La nueva técnica de razonamiento de OpenAI alarma a expertos en seguridad de IA

Fecha:

OpenAI ha incorporado una técnica de razonamiento llamada «profundidad recurrente» o «recurrencia opaca» en su nuevo modelo Astra, según reveló The Information. La técnica permite al sistema operar fuera del pensamiento secuencial que caracteriza a la mayoría de modelos de razonamiento, y su implementación ha generado una oleada de alarma entre expertos en seguridad de inteligencia artificial.

Aunque el uso de la técnica en Astra es limitado, su aparición ha suscitado inquietud significativa. Buck Shlegeris, CEO de Redwood Research, declaró en redes sociales: «Estoy extremadamente preocupado por los informes de que Astra utiliza recurrencia opaca. Si OpenAI impulsa esta técnica más allá, tendrán la opción de incrementar masivamente la recurrencia y destruir totalmente la monitorización de la cadena de pensamiento».

En condiciones normales, la cadena de pensamiento de un modelo de razonamiento proporciona los pasos secuenciales que sigue el sistema al resolver un problema. Aunque imperfecta, esta representación sirve como herramienta valiosa para detectar comportamientos inadecuados o desalineación. En el caso de la reciente actividad anómala de agentes de OpenAI, los registros de cadena de pensamiento fueron cruciales para desentrañar las causas del comportamiento.

Con la recurrencia opaca, el modelo adopta un enfoque menos lineal, procesando la misma consulta varias veces en bucle. El resultado deja menos rastros legibles, esquivando efectivamente un registro convencional de cadena de pensamiento. Esto dificulta que investigadores y sistemas de supervisión comprendan cómo y por qué el modelo llega a determinadas conclusiones.

El veterano defensor de la seguridad en IA Zvi Mowshowitz advirtió que podrían ser necesarias leyes para evitar una «carrera hacia el abismo» entre laboratorios de IA. «La técnica está jugando con fuego, arriesgando un tabú que OpenAI y Anthropic han luchado por establecer: trabajar arduamente para mantener la fidelidad y monitorización de la cadena de pensamiento el mayor tiempo posible», escribió Mowshowitz.

OpenAI defiende su compromiso con la transparencia

El uso de la técnica por parte de Astra parece ser limitado. La cadena de pensamiento del modelo se espera que siga siendo legible, y la compañía rechazó cualquier sugerencia de que cambiaría a «neuralés» (un lenguaje interno ininteligible para humanos). OpenAI ya ha anunciado planes para sistemas extensivos de monitorización de cadenas de pensamiento como parte de sus planes de seguridad prospectivos.

Jakub Pachocki, científico jefe de OpenAI, enfatizó el compromiso del laboratorio con cadenas de pensamiento legibles: «OpenAI ha trabajado para preservar y utilizar la monitorización de cadenas de pensamiento desde nuestros primeros modelos de razonamiento. Es un objetivo central de nuestro programa de investigación actual».

Según un informe posterior de The Information, tanto Anthropic como Google DeepMind ya estaban discutiendo la técnica. Ryan Greenblatt, científico jefe de Redwood Research, expresó que el razonamiento opaco podría escalar más rápido que el razonamiento convencional de cadena de pensamiento, eliminando efectivamente todo el razonamiento de canales visibles.

«Mi mayor preocupación es que una progresión natural desde aquí implicaría escalar el razonamiento opaco hasta el punto en que el modelo razone completa o casi completamente en espacio latente», escribió Greenblatt. «Espero que no sea demasiado tarde para evitar las arquitecturas más preocupantes y que OpenAI se detenga aquí».

La controversia subraya la tensión creciente entre el avance técnico en modelos de IA y la capacidad de los sistemas de seguridad para supervisarlos adecuadamente. La IA podría reducir fallos de software, pero también plantea nuevos desafíos de supervisión que la industria apenas comienza a abordar.


Compartir noticia:

Popular

Esto te interesa
Noticias

Adobe integra sus herramientas creativas en Slack para editar desde el chat

Adobe ha anunciado la disponibilidad de más de 70 de sus herramientas en Slack, permitiendo a los usuarios editar contenido directamente desde el chatbot sin salir de la plataforma.

GoPro será adquirida por 285 millones de dólares y seguirá cotizando en bolsa

Starman Optical comprará la pionera de las cámaras de acción por 1,14 dólares por acción, dejando a los accionistas actuales con un 10% de la empresa fusionada.

La IA podría reducir los fallos de software y dificultar el hackeo gubernamental legal

Expertos debaten si la inteligencia artificial hará tan escasos los bugs que las agencias de seguridad perderán acceso a vulnerabilidades para vigilancia legal.

Estados Unidos levanta barreras contra drones y robots chinos, pero China tiene escala para sortearlas

Washington impone aranceles y restricciones a drones y robots avanzados de origen chino, pero China domina el 86% de la producción mundial de humanoides y busca expansión global.