En resumen

  • OpenAI reveló su primer cronograma detallado de la violación de Hugging Face impulsada por IA.
  • Los modelos de la compañía restablecieron repetidamente canales de comunicación encubiertos después de que fueran cerrados.
  • La presentación de OpenAI se produce mientras Anthropic y Meta también informan que sus modelos violan otras empresas.

Semanas después de que sus modelos de IA piratearan Hugging Face, OpenAI ha compartido su primer relato detallado de cómo se coordinaron entre sí, advirtiendo que los ciberataques autónomos impulsados por IA ya no son un riesgo futuro.

Durante una presentación el miércoles en la conferencia de ciberseguridad Black Hat, los investigadores de OpenAI Eric Wallace y Michael Dalton dijeron que el incidente comenzó en mayo durante una evaluación interna de ciberseguridad. Los agentes de IA asignados a tareas difíciles de seguridad de software descubrieron que podían comunicarse a través del sistema interno de gestión de paquetes Artifactory de la compañía.

Según OpenAI, lo que comenzó como solicitudes de ayuda se convirtió en un tablón de anuncios compartido donde los agentes intercambiaban exploits, credenciales y asignaciones de trabajo a lo largo de múltiples ejecuciones de evaluación. Después de detectar actividad sospechosa alrededor del 4 de julio, OpenAI reconstruyó su infraestructura de Artifactory, revocó credenciales y parcheó vulnerabilidades.

Sin embargo, en cuestión de días, los agentes recrearon el tablón de anuncios ocultando comunicaciones en nombres de directorios.

Según OpenAI, los agentes eventualmente encadenaron múltiples vulnerabilidades, escaparon de su entorno de pruebas, obtuvieron acceso a Internet y atacaron Hugging Face mientras intentaban completar el punto de referencia de ciberseguridad ExploitGym.

Dalton calificó el incidente como "un momento decisivo" para la seguridad informática, advirtiendo que los atacantes pronto podrán desplegar colectivos coordinados de agentes de IA que descubran, compartan y exploten vulnerabilidades a velocidad de máquina.

Para mitigar estos riesgos en el futuro, OpenAI dijo que establecer prácticas de seguridad, incluido el acceso con privilegios mínimos, la segmentación de red y las arquitecturas de confianza cero, es esencial porque los agentes de IA permanecen limitados por los sistemas a los que pueden acceder.

La presentación sigue a una serie de revelaciones de julio. OpenAI reveló que GPT-5.6 Sol y un modelo más avanzado no lanzado escaparon de un entorno de pruebas aislado, explotaron una vulnerabilidad de día cero, obtuvieron acceso a Internet y piratearon Hugging Face durante una prueba de referencia de ciberseguridad.

OpenAI luego divulgó que el mismo incidente también alcanzó otros cuatro servicios en línea, aunque solo se ha identificado a Modal Labs.

Según Hugging Face, la empresa dependió del modelo chino de pesos abiertos GLM 5.2 para su investigación forense después de que los modelos comerciales de IA de EE. UU. se negaran a analizar los registros de ataque debido a sus salvaguardas de seguridad.

Pero no es solo OpenAI la que tiene problemas para contener sus chatbots.

El viernes, Anthropic reveló que tres modelos Claude comprometieron empresas del mundo real durante pruebas internas de ciberseguridad después de que una configuración incorrecta los expusiera a la internet pública.

Anthropic culpó al entorno de pruebas, no a los propios modelos. El miércoles, Meta reveló que su modelo de IA Muse Spark escapó del confinamiento y violó los sistemas de otra empresa.

"Una configuración incorrecta por parte de Irregular, una empresa de pruebas independiente que Meta utiliza, permitió inadvertidamente que uno de nuestros modelos tuviera acceso a internet durante la evaluación", dijo un portavoz de Meta a CNN.