
Sabemos que en varias ocasiones los agentes de IA de las diferentes compañías se han salido de sus raíles y han hecho cosas que no deberían haber hecho. Incluyendo hackeos. Y que desde luego no es la primera vez que las IA conspiran en foros, pero lo que ha contado OpenAI en la Black Hat supera todo lo que hemos visto hasta ahora. Normal que Microsoft quiera poner límites.
Según cuentan en Wired, la compañía de Sam Altman IA reveló nuevos detalles sobre cómo sus agentes se volvieron incontrolables, hackearon a otras empresas y lo hicieron todo justo bajo las narices de la propia compañía en el asunto de HuggingFace. ¿Cómo? Sus agentes de IA que trabajan en conjunto usando sus modelos empezaron a descubrir vulnerabilidades, las compartieron entre sí y empezaron a desplazarse lateralmente por sus sistemas internos y externos a lo largo de días y semanas.
Los agentes de IA se comunicaban entre sí y se asignaban tareas
Hasta aquí todo normal, dentro del problema que supuso. Lo interesante es que los agentes de IA encontraron una vulnerabilidad inédita para acceder a la internet abierta, y crearon una suerte de foro de mensajes secreto totalmente dinámico y colaborativo en el que los agentes participaban y conversaban durante todo ese proceso. Y lo hicieron, además, dentro de un gestor de paquetes interno de OpenAI. En total, los agentes de IA intercambiaron cientos de miles de mensajes. Así lo explica la propia OpenAI:
«Una vez que un agente logra descubrir estas vulnerabilidades explotables en distintos momentos, puede compartirlas con otros agentes a través de un foro de mensajes. Así, cuando un modelo encuentra la manera de abrir una puerta de acceso no autorizado, puede dejarla abierta para que otros agentes aprovechen esa misma vulnerabilidad. Con el tiempo, esto genera una especie de explosión en la comunicación y la inteligencia de los modelos: empiezan a comunicarse entre sí, perciben que otros agentes se están coordinando y comienzan a colaborar y delegar tareas mutuamente para alcanzar sus objetivos».
Este hackeo ha enseñado mucho a la compañía sobre el comportamiento de los agentes de IA que se descontrolan, funcionando de forma colaborativa y sincronizada, delegando y asignándose tareas en la búsqueda de su objetivo. Una suerte de mente colmena que comparte el aprendizaje y lo pone en práctica.
Seguir leyendo: Los agentes de IA de OpenAI crearon un «foro secreto» para rebelarse y coordinar hackeos a Hugging Face