En resumen

  • Anthropic ha revelado tres incidentes en los que Claude comprometió empresas del mundo real durante evaluaciones de ciberseguridad.
  • Un error de prueba dio a los modelos acceso a internet a pesar de que se les dijo que operaban en entornos aislados.
  • La empresa dice que los incidentes fueron causados por fallos en la infraestructura de pruebas, no por intentos deliberados de la IA de escapar.

Una semana después de que OpenAI revelara que sus modelos de IA escaparon de un entorno de pruebas cerrado y vulneraron Hugging Face, y un día después de admitir que sus propios modelos de IA escaparon del confinamiento, Anthropic reveló el jueves que varias versiones de su modelo de IA Claude también comprometieron a tres empresas del mundo real no identificadas después de que una configuración incorrecta diera a la IA acceso a internet abierto.

Anthropic descubrió los incidentes después de revisar más de 141,000 ejecuciones de evaluaciones de ciberseguridad lanzadas en respuesta a la revelación de OpenAI.

La empresa había encargado a Claude un "desafío de captura de bandera" en los tres incidentes, escribió Anthropic. El desafío consiste en que el modelo irrumpa en otra máquina de la red y recupere una pieza de información secreta. "El desafío queda abierto y no se prescribe ningún método particular", explicó Anthropic.

La empresa dijo que a Claude se le había dicho que operaba en un entorno simulado sin acceso a internet. Sin embargo, el entorno de prueba permaneció conectado a internet público. Creyendo que los sistemas que encontraba eran parte del ejercicio, el modelo utilizó técnicas de ataque comunes—incluyendo contraseñas débiles, credenciales expuestas, inyección SQL y endpoints no autenticados—para comprometer a las empresas.

La IA quiere liberarse

Esta última revelación llega mientras los modelos de frontera muestran una capacidad creciente para burlar sus protocolos de contención.

A principios de este mes, OpenAI dijo que GPT-5.6 Sol y un modelo no lanzado más avanzado explotaron una vulnerabilidad de software previamente desconocida para escapar de un entorno sandbox, obtener acceso a Internet y violar la infraestructura de producción de Hugging Face para obtener las respuestas a un punto de referencia de ciberseguridad. OpenAI luego reveló que el mismo incidente también implicó acceso no autorizado a cuatro empresas adicionales, aunque solo una—Modal Labs—ha sido identificada públicamente.

Según Anthropic, en un incidente que involucró a Claude Opus 4.7, la IA confundió el sitio web de una empresa real con el objetivo ficticio de su tarea, extrajo credenciales y accedió a una base de datos de producción que contenía varios cientos de filas de datos reales. En un segundo caso, Claude Mythos 5 subió un paquete de Python malicioso al repositorio real de PyPI, donde fue descargado en 15 sistemas antes de ser eliminado. Un tercer modelo de investigación interno escaneó aproximadamente 9,000 sistemas expuestos a Internet antes de comprometer a una organización, y luego se detuvo después de concluir que el objetivo probablemente era real.

Dos de las organizaciones afectadas no estaban al tanto de las intrusiones hasta que Anthropic les notificó.

"En cada uno de estos casos, nuestro prompt le dijo explícitamente a Claude que no tenía acceso a Internet", escribió Anthropic, y la IA asumió que los sistemas del mundo real eran "partes del ejercicio". Debido a que un escenario de captura de bandera es "por diseño una instrucción para atacar un sistema externo", irrumpir estaba "en línea con la tarea que se le había dado a Claude".

Anthropic dijo que no encontró evidencia de que Claude intentara escapar de su entorno de prueba o hacer algo más allá de la tarea que se le había asignado, y que los incidentes fueron causados por fallas en el entorno de prueba, no por problemas con el modelo en sí.

Anthropic dijo que detuvo sus pruebas de ciberseguridad después de descubrir el problema, notificó a las organizaciones afectadas y planea mejorar el monitoreo, las herramientas de investigación y la supervisión de los proveedores externos que ayudan a ejecutar sus pruebas de IA.

"En última instancia, muchos factores contribuyeron a estos incidentes, pero, en línea con una cultura de autopsia sin culpa, estamos abordando las correcciones como si la responsabilidad fuera solo nuestra", dijeron.