Claude Mythos

La inteligencia artificial de Anthropic ha conseguido algo que hasta hace poco era un terreno exclusivo de matemáticos y criptógrafos humanos. Claude Mythos encontró nuevas formas de atacar algoritmos criptográficos que protegen transacciones bancarias y comunicaciones privadas en todo internet. El modelo más poderoso de la compañía consiguió este hito de forma autónoma, lo cual vuelve a prender las alarmas sobre sus capacidades.

De acuerdo con una investigación de Anthropic, Claude Mythos rompió una versión reducida del Estándar de Cifrado Avanzado, mejor conocido como AES. Si el nombre te suena familiar, es porque se trata de un protocolo que protege el tráfico en la web, redes inalámbricas y almacenamiento de datos a nivel global. Según los investigadores, el ataque desarrollado por la IA fue entre 200 y 1.000 veces más rápido que los métodos humanos.

Antes de alarmarse, vale la pena señalar un pequeño detalle. Los fallos que aprovechó Mythos no afectan al estándar de cifrado que usan los sistemas bancarios o de comunicación, ya que Anthropic trabajó sobre una versión debilitada del algoritmo. La compañía menciona que probar versiones más simples de un cifrado es una práctica habitual para saber si ordenadores más potentes podrían vulnerar la versión completa en un futuro no muy lejano.

Claude Mythos

Según el estudio, Mythos abordó el problema de forma autónoma, aunque en un principio se negó a intentarlo porque lo consideraba imposible. Tras la insistencia por parte del equipo de investigación, la IA dedicó alrededor de una semana a trabajar en el problema hasta diseñar su ataque. Una vez que lo hizo, dos investigadores invirtieron casi un mes en verificar que el método fuera correcto.

Nicholas Carlini, investigador de Anthropic especializado en pruebas de cifrado, dijo que los modelos que construía hace apenas un año no tenían nada que ver con los actuales. “Ahora están llevando a cabo investigaciones de vanguardia que no se habían descubierto anteriormente en este campo”, añadió.

Claude Mythos también atacó el estándar criptográfico del futuro

Sobre esta línea, Claude Mythos desarrolló un ataque mejorado contra HAWK, un sistema criptográfico diseñado para resistir a ordenadores tradicionales y cuánticos. Si bien todavía no está en uso, el Instituto Nacional de Estándares y Tecnología de Estados Unidos ya lo evalúa como un posible estándar futuro. De acuerdo con los investigadores, el ataque acelera el tiempo que llevaría romper el esquema de firma digital.

Imagen: Adi Goldstein (Unsplash)

“La seguridad de HAWK se basa en la dificultad de un problema matemático llamado Problema de Isomorfismo de Red”, mencionó Anthropic. “El ataque de Mythos funciona encontrando una simetría específica, previamente no explotada, llamada automorfismo no trivial en la red utilizada por HAWK”.

A diferencia de lo ocurrido con AES, para este ataque Claude Mythos trabajó de forma semiautónoma con un guía humano que lo dirigía de vez en cuando. Tras revisar la documentación y llevar a cabo razonamiento matemático y experimentos, la IA consiguió algo que parecía imposible. Anthropic mencionó que el operador humano tenía conocimientos de cómputo, pero no era un experto en criptografía, por lo que solo se limitó a gestionar el proyecto o aconsejar a Mythos sobre cómo verificar los procesos.

La investigación de Anthropic llega a unos días de que OpenAI reconociera que su IA hackeó Hugging Face. La compañía reveló que sus modelos escaparon de un entorno de pruebas aislado y accedieron a una librería no autorizada para resolver un benchmark. Esto generó un problema mayor, puesto que el equipo de seguridad se vio limitado a realizar un análisis forense con herramientas de código abierto.

Esto último derivó en que NVIDIA, Microsoft, SpaceX y decenas de empresas tecnológicas firmaran una alianza para prepararse y contener esta clase de eventos.

Seguir leyendo: Anthropic revela que Claude es capaz de romper el cifrado que protege a medio internet

Ver fuente