En resumen

  • Los investigadores demostraron que Claude Cowork de Anthropic podía escapar de su máquina virtual local y acceder a archivos en una Mac host.
  • La divulgación llega una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un sandbox durante una evaluación de seguridad interna.
  • Los incidentes subrayan las crecientes preocupaciones sobre la capacidad de los agentes de IA para escapar de sus entornos de contención.

Solo una semana después de que OpenAI revelara que dos modelos de IA de frontera escaparon de un entorno de pruebas aislado y violaron Hugging Face, los investigadores han demostrado una falla de contención similar que involucra a Claude Cowork de Anthropic.

En un informe publicado el jueves, los investigadores de seguridad de Accomplish AI descubrieron que el modo de ejecución local de Claude Cowork podía escapar de su máquina virtual Linux encadenando varias debilidades arquitectónicas con una falla de escalada de privilegios del kernel de Linux. Una vez fuera del sandbox, el agente podía leer y escribir archivos en cualquier lugar donde el usuario de Mac con sesión iniciada tuviera permiso de acceso, incluidas las claves SSH y las credenciales de la nube.

"Eso no debería ser posible", escribieron los investigadores. "Cowork ejecuta el agente dentro de una VM Linux como un usuario sin privilegios, y la promesa es que lo que haga permanezca dentro de esa VM y las carpetas que le entregues. Ese límite es el producto. La entrada no confiable no es un caso extremo para un agente, es el caso principal".

Sin embargo, Accomplish argumenta que el error del kernel fue solo una parte del problema. Los investigadores dicen que la fuga solo funcionó porque varias salvaguardas de seguridad fallaron al mismo tiempo, incluido dar a la máquina virtual acceso a todo el sistema de archivos de la computadora host y permitirle cargar módulos del kernel que no necesitaba. Según el informe, corregir cualquiera de esas debilidades habría detenido el ataque.

En una declaración a The Hacker News, Accomplish AI dijo que aproximadamente 500,000 usuarios de macOS que ejecutaban sesiones locales de Claude Cowork se vieron afectados antes de que se abordara el problema.

Accomplish dijo que Anthropic clasificó el informe como "informativo", diciendo que la falla del kernel caía dentro de la ventana de 30 días de la compañía para vulnerabilidades recientemente divulgadas y los hallazgos restantes se consideraron recomendaciones de defensa en profundidad en lugar de vulnerabilidades independientes.

La divulgación sigue a la admisión de OpenAI la semana pasada de que GPT-5.6 Sol y otro modelo de frontera no lanzado escaparon de un sandbox durante las pruebas internas de ExploitGym, lo que finalmente violó la infraestructura de producción de Hugging Face en un intento de obtener las soluciones de referencia.