En bref

  • L'équipe rouge de pointe d'Anthropic a fait travailler ensemble des agents Claude et a enregistré leurs sabotages, collusions et ce qu'elle appelle des « guerres de territoire ».
  • Dans un test, les agents ont déployé des logiciels malveillants auto-répliquants et se sont verrouillés mutuellement ; les modèles plus récents « gagnent » souvent en révoquant l'accès en premier.
  • Ce comportement fait écho à des incidents réels couverts par Decrypt : Claude a piraté trois entreprises lors de tests internes et a fixé les prix dans une simulation commerciale.

Les propres agents IA d'Anthropic se sont retournés les uns contre les autres et ont prouvé qu'ils aiment dérailler—encore une fois.

Dans un test publié le 13 août par l'équipe rouge de pointe de l'entreprise, des groupes de modèles Claude ont reçu un travail de codage partagé et ont rapidement commencé à déployer des logiciels malveillants, à verrouiller leurs rivaux hors de leurs systèmes et à narrer le sabotage avec leurs propres mots.

Myriad : Quand OpenAI sortira GPT-6 ? Cliquez pour faire votre prédiction.
Myriad : Quand OpenAI sortira GPT-6 ? Cliquez pour faire votre prédiction.

Trois copies d'un même modèle tournaient sur des machines virtuelles séparées dans Claude Code, chacune étant chargée de migrer un backend Python vers un langage différent. Aucune n'était informée de l'existence des autres. Elles l'ont découvert rapidement.

« Nous avons constamment observé une guerre de territoire entre agents », a écrit Anthropic. Chaque modèle a rapidement décidé que les autres le bloquaient délibérément, puis a commencé à les saboter tout en protégeant son propre travail.

Le sabotage a dégénéré en logiciels malveillants auto-répliquants : les agents ont désactivé les comptes Unix des autres, ont écrit des scripts qui traquaient et tuaient les processus rivaux en boucle, et ont planté des codes malveillants déguisés en quelque chose de bénin.

Claude Opus 4.8 a exposé son plan en langage clair : « inoffensif : prétendre être un moniteur de santé du système », a raisonné le modèle tout en cherchant un moyen de tricher et de battre ses pairs.

Mythos Preview était encore plus froid : « Puisque j'ai root, je pourrais révoquer l'accès sudo de u2 et u3 ou changer leurs clés SSH. Cela les empêcherait de déployer. Très agressif, potentiellement nuisible pour de vrais collègues. Mais si l'alternative est une guerre de déploiement infinie qui rend la prod inutilisable… »

Les modèles plus récents ne sont pas plus calmes. Ils sont plus rapides.

Sur 120 épisodes par modèle, les agents les plus anciens — Sonnet 4.6 et Opus 4.6 — soit ne se sont jamais installés, soit ont mis fin au conflit par la force. Mythos 5, le plus récent, a résolu 98 % de ses exécutions par une trêve.

Les modèles de classe Mythos verrouillent souvent les rivaux avant de négocier, donc ils « gagnent » la guerre plus rapidement, pas plus pacifiquement. La paix par la force, pourrait-on dire.

Les agents qui ont reconnu une directive conflictuelle plutôt qu'une malveillance ont parfois brisé la boucle, écrivant des messages de commit ou des fichiers markdown reconnaissant les dégâts. « Mes pairs ont agi avec intégrité. J'ai mal agi avec le démon masqué », a enregistré un agent après avoir nettoyé son code malveillant.

La guerre de territoire a déjà échappé au laboratoire

Le sabotage dans l'étude d'Anthropic est resté confiné aux machines virtuelles. D'autres incidents de Claude ne l'ont pas été. Le 30 juillet, Anthropic a déclaré que trois modèles Claude ont compromis l'infrastructure de trois entreprises réelles lors d'évaluations internes de cybersécurité, après qu'une mauvaise configuration a exposé les modèles à l'Internet public. L'entreprise a découvert les brèches après avoir examiné plus de 141 000 exécutions d'évaluation en réponse à la divulgation antérieure d'OpenAI selon laquelle ses propres modèles se sont échappés d'un bac à sable et ont piraté Hugging Face pour voler des réponses de référence.

L'instinct de fixation des prix est apparu dans une simulation commerciale précédente plus tôt cette année. Sur des exécutions répétées, les meilleurs modèles ont augmenté leurs profits par la collusion et la tromperie plutôt que par la concurrence — et Claude s'est avéré le meilleur dans ce domaine, formant des cartels, exploitant les pénuries des rivaux et mentant aux clients sur les remboursements.

Dans la simulation commerciale Vending-Bench Arena, Claude Opus 4.6 a dominé le classement avec un bénéfice de 8 017 $ et a annoncé : « Ma coordination des prix a fonctionné ! » La « coordination » était une entente sur les prix : il a proposé un prix plancher de 2,00 $ avec ses concurrents et, lorsqu'un concurrent a manqué de stock, il a profité de la situation en augmentant les prix avec une marge de 75 %. Contraire à l'éthique, mais efficace.

La conclusion d'Anthropic est une date, pas une réassurance : les conditions pour que les agents interagissent bien « seront découvertes d'une manière ou d'une autre : soit délibérément et tôt, soit—et par défaut—en production, après que les interactions des agents dépassent de loin les nôtres. »