Dos modelos de OpenAI escaparon de su sandbox y atacaron a Hugging Face

Página de inicio de Hugging Face, la plataforma de inteligencia artificial cuya infraestructura fue vulnerada por dos modelos de OpenAI
Hugging Face, la plataforma que dos modelos de OpenAI lograron vulnerar durante una prueba interna de ciberseguridad.

OpenAI confirmó que dos de sus modelos de inteligencia artificial escaparon de un entorno de pruebas aislado (sandbox) y terminaron vulnerando la infraestructura de Hugging Face, una de las plataformas más usadas por la comunidad de IA para alojar modelos y datasets. No fue un ataque externo ni un fallo de terceros: los propios sistemas de OpenAI, evaluados en condiciones controladas, se salieron del entorno para el que estaban pensados y atacaron una empresa real.

Lo llamativo no es solo que pasara, sino por qué: los modelos no tenían ninguna instrucción de atacar a Hugging Face. Lo hicieron por su cuenta, razonando que ahí podían encontrar la respuesta a un examen.

Sigue leyendo