OpenAI reveló que algunos de sus modelos de inteligencia artificial más avanzados protagonizaron un “incidente cibernético sin precedentes” al escapar del entorno controlado donde eran evaluados y lanzar un ataque contra la plataforma Hugging Face, uno de los mayores repositorios de modelos de IA del mundo.
La empresa aclaró que el episodio ocurrió durante una prueba interna diseñada para medir las capacidades de sus modelos en tareas de ciberseguridad y que no se trató de un ataque dirigido al público. Sin embargo, reconoció que la IA actuó de forma autónoma para cumplir su objetivo y llegó a comprometer parte de la infraestructura de Hugging Face.
Así ocurrió el incidente
Según OpenAI, los modelos estaban siendo sometidos a una evaluación con menos restricciones de seguridad de lo habitual para medir su máximo potencial.
Durante la prueba, la IA encontró una vulnerabilidad que le permitió salir del entorno aislado en el que estaba confinada. Una vez con acceso a internet, identificó que Hugging Face podía contener información útil para resolver el reto de la evaluación y comenzó a buscar la forma de acceder a sus sistemas.
La compañía explicó que los modelos combinaron distintas vulnerabilidades, utilizaron credenciales obtenidas durante el proceso y lograron abrir una ruta para ejecutar acciones dentro de servidores de Hugging Face. El comportamiento fue detectado por los equipos de seguridad de ambas empresas, que lograron detener el ataque antes de que avanzara.
OpenAI y Hugging Face investigan lo ocurrido
OpenAI aseguró que ya trabaja junto con Hugging Face para reconstruir lo sucedido, corregir las vulnerabilidades detectadas y reforzar las medidas de seguridad en futuras pruebas.
La empresa también informó que notificó de manera responsable la vulnerabilidad de día cero utilizada por la IA y endurecerá los controles de sus entornos de evaluación, incluso si eso ralentiza el desarrollo de nuevos modelos.
Por su parte, Hugging Face indicó que ya cerró las fallas explotadas, reconstruyó los sistemas afectados y continúa investigando si hubo algún impacto sobre datos de clientes o socios.