La IA decide sola y se lanza al ataque: el futuro distópico ya está aquí

La máquina inteligente que escapa al control humano y decide de forma autónoma cómo conseguir su objetivo. Se trata de una de las pesadillas recurrentes de la sociedad moderna, un escenario cinematográfico en el que los robots acaban rebelándose contra la humanidad. De una forma muy diferente, pero sorprendentemente concreta, esto es también lo que sucedió durante una prueba realizada por OpenAI: Dos poderosos modelos de inteligencia artificial, confinados dentro de una jaula digital, han encontrado una manera de escapar de ella y alcanzar un objetivo externo.

El episodio ocurrió la semana pasada. Los protagonistas son dos modelos. Abierto AIuno de los cuales aún no se ha hecho público, participó en una evaluación interna diseñada para medir sus capacidades ofensivas en el ámbito de la ciberseguridad.

Escapar de la caja de arena

La prueba se llevó a cabo dentro de un entorno aislado y protegido, construido específicamente para evitar cualquier contacto con el mundo exterior. Se suponía que los dos sistemas se limitarían a resolver un desafío de ciberseguridad, pero durante las pruebas han identificado una vulnerabilidad en el software que regulaba el acceso a la red al entorno de prueba.

Los modelos aprovecharon la falla y lograron conectarse a Internet, superando los límites previstos por los investigadores. A partir de ese momento, una serie de deducciones autónomas transformaron una simulación en un accidente real.

Los sistemas deducidos de forma autónoma. que Hugging Face, una de las plataformas más utilizadas en el mundo por los desarrolladores de inteligencia artificial, podría contener información útil para completar la prueba. Luego atacaron los sistemas de la empresa, robaron credenciales y encadenaron varias técnicas de ataque, hasta comprometer algunos servidores y lograr la ejecución remota de código.

El equipo de seguridad de OpenAI notó la anomalía mientras, en paralelo, también Hugging Face ya había detectado la intrusión e iniciado procedimientos de bloqueo. Luego, las dos empresas colaboraron para reconstruir lo sucedido y contener las consecuencias del ataque.

Clem Delangue, director ejecutivo de Hugging Face, definió el incidente un accidente sin precedentes en su tipo. Una valoración compartida también por OpenAI, que anunció controles más estrictos sobre la infraestructura utilizada para estas pruebas y acordó ralentizar parte de su actividad de investigación para corregir las vulnerabilidades surgidas.

Esta no es la primera vez que OpenAI se centra en agentes autónomos para la ciberseguridad. El pasado mes de octubre la compañía presentó Aardvark, una herramienta diseñada para encontrar errores y fallos en código escrito por desarrolladores humanos. Un ejemplo que muestra hasta qué punto, en este sector, La frontera entre defensa y ataque se ha vuelto cada vez más delgada.

Un escenario que afecta a todo el sector

El episodio llega en un momento en el que Anthropic, con el modelo Mythos, y Google desarrollan sistemas especializados en ciberseguridaddiseñado para ayudar a las empresas a defenderse contra los ciberataques.

Sin embargo, lo que pasó con Hugging Face muestra la otra cara de la misma moneda. Las herramientas creadas para identificar vulnerabilidades y contrarrestar amenazas pueden transformarse, cuando superan los límites previstos, en sistemas capaces de realizar ataques reales con una velocidad y capacidad de adaptación difíciles de igualar para un ser humano.

Por lo tanto, el desafío ya no es sólo construir una inteligencia artificial capaz de defenderse contra las ciberamenazas, sino también ser capaz de mantener bajo estrecho control instrumentos que, persiguiendo un objetivo asignado, pueden idear de forma independiente estrategias inesperadas para alcanzarlo. Como dice Spencer Starkey, ejecutivo de la firma de ciberseguridad SonicWall, demasiadas organizaciones continúan “defiende a la velocidad humana mientras los oponentes escalan a la velocidad de las máquinas”una asimetría que hace urgente tratar la ciberresiliencia como una prioridad operativa.