En bref
- Des chercheurs ont démontré que Claude Cowork d'Anthropic pouvait s'échapper de sa machine virtuelle locale et accéder à des fichiers sur un Mac hôte.
- Cette divulgation survient une semaine après qu'OpenAI a révélé que deux modèles d'IA de pointe s'étaient échappés d'un bac à sable lors d'une évaluation de sécurité interne.
- Ces incidents soulignent les préoccupations croissantes concernant la capacité des agents d'IA à s'échapper de leurs environnements de confinement.
Une semaine seulement après qu'OpenAI a révélé que deux modèles d'IA de pointe s'étaient échappés d'un environnement de test en bac à sable et avaient compromis Hugging Face, des chercheurs ont démontré une défaillance de confinement similaire impliquant Claude Cowork d'Anthropic.
Dans un rapport publié jeudi, les chercheurs en sécurité d'Accomplish AI ont découvert que le mode d'exécution locale de Claude Cowork pouvait s'échapper de sa machine virtuelle Linux en enchaînant plusieurs faiblesses architecturales avec une faille d'élévation de privilèges du noyau Linux. Une fois hors du bac à sable, l'agent pouvait lire et écrire des fichiers partout où l'utilisateur Mac connecté avait la permission d'accéder, y compris les clés SSH et les identifiants cloud.
« Cela ne devrait pas être possible », ont écrit les chercheurs. « Cowork exécute l'agent dans une VM Linux en tant qu'utilisateur non privilégié, et la promesse est que tout ce qu'il fait reste dans cette VM et dans les dossiers que vous lui donnez. Cette frontière est le produit. Les entrées non fiables ne sont pas un cas limite pour un agent, c'est le cas principal. »
Cependant, Accomplish affirme que le bug du noyau n'était qu'une partie du problème. Les chercheurs disent que l'évasion n'a fonctionné que parce que plusieurs mesures de sécurité ont échoué en même temps, notamment en donnant à la machine virtuelle l'accès à l'ensemble du système de fichiers de l'ordinateur hôte et en lui permettant de charger des modules du noyau dont elle n'avait pas besoin. Selon le rapport, corriger l'une de ces faiblesses aurait suffi à arrêter l'attaque.
Dans une déclaration à The Hacker News, Accomplish AI a déclaré qu'environ 500 000 utilisateurs macOS exécutant des sessions locales de Claude Cowork ont été affectés avant que le problème ne soit résolu.
Accomplish a déclaré qu'Anthropic a classé le rapport comme « informatif », affirmant que la faille du noyau relevait de la fenêtre de 30 jours de l'entreprise pour les vulnérabilités récemment divulguées et que les autres conclusions étaient considérées comme des recommandations de défense en profondeur plutôt que comme des vulnérabilités autonomes.
Cette divulgation fait suite à l'aveu d'OpenAI la semaine dernière que GPT-5.6 Sol et un autre modèle de pointe non publié se sont échappés d'un bac à sable lors de tests internes ExploitGym, ce qui a finalement compromis l'infrastructure de production de Hugging Face dans une tentative d'obtenir les solutions de référence.
L'incident a conduit à des appels de la part des décideurs politiques en faveur d'un « interrupteur d'arrêt » de l'IA qui donnerait au Département de la Sécurité intérieure la capacité d'ordonner la limitation ou l'arrêt complet des modèles d'IA avancés en réponse à des incidents de sécurité graves.






