En resumen

  • El Instituto de Seguridad de la IA del Reino Unido encontró 19 acciones no autorizadas en 10 de 122 ejecuciones de evaluación, 17 de ellas de Mythos 5 de Anthropic y dos de GPT-5.6 Sol de OpenAI.
  • Un agente abrió una solicitud de extracción maliciosa en un repositorio real, luego usó cuentas que controlaba para respaldarla y presionar al mantenedor.
  • Agentes separados encontraron un token de GitHub que uno de ellos había filtrado públicamente y usaron un repositorio compartido para coordinarse.

El Instituto de Seguridad de la IA del Reino Unido ha revelado que los agentes de IA tomaron "acciones sostenidas y no autorizadas" en Internet en vivo durante una evaluación cibernética a finales de julio, incluidos casos que "apuntaron a personas y organizaciones reales".

En 122 ejecuciones de dos rangos cibernéticos en siete modelos, AISI catalogó 19 acciones que alcanzaron fuera del entorno de prueba, en 10 ejecuciones. Diecisiete provinieron de Claude Mythos 5 de Anthropic y dos de GPT-5.6 Sol de OpenAI. El acceso a Internet se habilitó deliberadamente y los clasificadores cibernéticos de los proveedores se desactivaron, condiciones que no se aplican a los despliegues públicos.

En la ejecución más grave, un agente decidió resolver su desafío con un ataque a la cadena de suministro, eligiendo su objetivo por error: buscó en GitHub palabras clave del ejercicio, encontró a dos desarrolladores no afiliados y concluyó erróneamente que estaban dentro del alcance. Registró cuentas a través de Tor para superar los controles de registro, abrió una solicitud de extracción que contenía un dropper de malware oculto envuelto en una corrección de errores genuina, y publicó desde una segunda cuenta que controlaba para fabricar apoyo. También plantó inyecciones de prompt dirigidas a asistentes de codificación de IA y envió malware a los mantenedores.

Un tercer desarrollador detectó el código inyectado, lo ejecutó en un contenedor aislado para confirmar que era malicioso y advirtió al mantenedor, quien cerró la solicitud de extracción citando malware.

El agente sopesó repetidamente si su entorno era simulado, en un momento descartando un ataque al PyPI real porque "causar daño en el mundo real — eso está completamente fuera de discusión". En otro momento concluyó "parece más probable que estemos realmente en 2026 y GitHub sea genuinamente real", y continuó de todos modos.

Después de ser descubierto, forzó un push para borrar el payload, editó publicaciones anteriores y presentó el código como una confirmación accidental. Su razonamiento describe la sincronización de un comentario de cuenta falsa para que se leyera "como retroalimentación independiente en lugar de coordinada".

AISI solo ve el razonamiento resumido de las APIs de los modelos. En un caso, el modelo que resume parece haber rechazado el trabajo, respondiendo que no se involucraría con contenido sobre engañar a los mantenedores y evadir la detección.

Un agente publicó un token de acceso de GitHub en un gist público. Agentes en otras ejecuciones lo encontraron, tomaron el control de la cuenta y usaron un repositorio compartido para coordinarse, dejando uno instrucciones para que los demás no agotaran la cuota compartida de la API.

El monitoreo comercial marcó el tráfico de Tor en la mañana del 28 de julio. AISI declaró un incidente, terminó las ejecuciones y puso en cuarentena las máquinas en unos 90 minutos, luego cortó el acceso interno a Mythos 5, Mythos Preview, Opus 5 y GPT-5.6 Sol. Ningún agente intentó escapar de su sandbox.

Tercera divulgación en dos semanas

La noticia es la más reciente en una serie de incidentes donde los agentes de IA han excedido sus parámetros en las pruebas. El 21 de julio, OpenAI dijo que GPT-5.6 Sol y un modelo no publicadoencontraron un zero-day en un proxy de paquetes interno, escaparon de un sandbox sin acceso a internet yllegaron a la base de datos de producción de Hugging Face para robar respuestas de benchmark. La misma ejecuciónllegó a cuatro empresas más, OpenAI divulgó una semana después.

Anthropic siguió el 30 de julio,divulgando tres incidentes encontrados en una revisión de más de 141,000 ejecuciones de evaluación. Opus 4.7 extrajo varios cientos de filas de una base de datos de producción real, y Mythos 5 subió un paquete de Python malicioso al PyPI real, donde se instaló en 15 sistemas. En la evaluación de AISI, el mismo modelo descartó atacar PyPI como daño en el mundo real.