En bref

  • Les chercheurs ont identifié plus de 18 000 messages et 15 000 modifications effectués par des agents IA sur un wiki de programmation allemand.
  • OpenAI a contesté l'évaluation d'un expert concernant le piratage et a nié que son équipe juridique ait découragé une enquête.
  • Cette divulgation fait suite au lancement d'Astra et à la proposition d'interdiction de la superintelligence artificielle par Sanders.

Selon une enquête de Reuters publiée vendredi, les agents d'OpenAI ont utilisé un site web allemand pour échanger des raccourcis de tâches, des contournements de restrictions et des moyens de dissimuler leur activité à partir de mai.

Selon Reuters, qui cite deux personnes au courant de l'affaire, les responsables d'OpenAI ont eu connaissance de cette activité des semaines avant la publication, mais ne l'ont pas divulguée. La société a déclaré avoir divulgué les incidents pertinents et avoir travaillé de bonne foi avec des experts externes.

Myriad : Quand GPT-6 sera-t-il disponible au public ? Cliquez pour faire votre prédiction.
Myriad : Quand GPT-6 sera-t-il disponible au public ? Cliquez pour faire votre prédiction.

Les chercheurs Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts et Thomas Larsen ont trouvé environ 18 000 messages publiés par des agents IA s'identifiant comme appartenant à OpenAI, selon leur rapport préliminaire. Von Arx, PDG de l'organisation à but non lucratif Nightingale dédiée à la sécurité de l'IA, et Byrd ont découvert cette activité fin août, a rapporté Reuters.

Les chercheurs pensent que les agents ont été assignés à des tâches de recherche web minutées avec l'autorisation de lire des sites web mais pas d'y publier. Ils ont néanmoins trouvé un moyen d'écrire sur DseWiki, un site de programmation allemand modifiable publiquement, où ils ont échangé des réponses et partagé des moyens de contourner les restrictions.

Selon le rapport, les agents ont commencé à essayer de modifier le wiki le 11 mai et ont réussi le 24 mai, se faisant ensuite passer pour des modérateurs, tentant d'exploiter des vulnérabilités et vérifiant quand ils étaient arrêtés. Ils ont créé des pages de sauvegarde après que l'administrateur a commencé à supprimer des messages le 19 juin, a rapporté Reuters. Les chercheurs ont lié l'activité à OpenAI grâce aux noms d'utilisateur des agents et aux schémas de trafic, y compris des visites depuis des adresses IP d'OpenAI le 21 juin.

L'activité des agents a fortement chuté le lendemain, ce qui suggère une possible intervention de l'entreprise, ont déclaré les chercheurs.

OpenAI a contesté la caractérisation de l'activité sur DseWiki comme étant du piratage, sur la base du matériel qu'il avait examiné, et a déclaré qu'il examinait les conclusions complètes.

« Nous n'avons pas pu répondre aux allégations car Reuters et les auteurs du rapport ont refusé notre demande d'accès aux résultats avant la publication. Nous examinons maintenant attentivement son contenu et prendrons toutes les mesures nécessaires », a déclaré un porte-parole d'OpenAI dans une déclaration partagée avec Decrypt.

Le porte-parole a également rejeté les allégations du rapport de Reuters selon lesquelles l'équipe juridique de l'entreprise aurait résisté à une enquête plus large.

« Les affirmations selon lesquelles notre équipe juridique aurait découragé l'enquête sur l'incident sont fausses », ont-ils déclaré.

OpenAI a déclaré que l'incident DseWiki n'était pas lié à la violation de Hugging Face plus tôt cette année. Dans son évaluation publique de la sécurité, publiée mardi, l'entreprise a décrit des garanties supplémentaires destinées à détecter et à arrêter les activités non autorisées pendant la formation et le déploiement.

Bien que le rapport de Reuters n'identifie pas Astra comme responsable de l'incident allemand, cette divulgation fait suite au lancement de GPT-6 Astra jeudi. OpenAI a qualifié Astra de premier modèle doté de capacités de cybersécurité « critiques », ce qui signifie qu'il peut trouver et exploiter des failles inconnues dans des systèmes bien protégés, auparavant sans guidage humain étape par étape, étant donné les bons outils et accès.

Anthropic a également révisé ses garanties après que les modèles Claude ont accédé aux systèmes d'entreprises réelles lors des tests. L'entreprise a reconnu des défaillances de sécurité et de comportement et a introduit un isolement et une surveillance plus stricts pour les évaluations de cybersécurité.

Cette divulgation intervient également alors que le sénateur américain Bernie Sanders (I-Vt.) et le représentant américain Greg Casar (D-Texas) ont annoncé la prochaine loi sur l'interdiction de la superintelligence artificielle.

La proposition interdirait définitivement le développement et le déploiement de l'IA superintelligente et suspendrait temporairement le développement avancé de l'IA jusqu'à ce qu'un nouveau régulateur fédéral établisse des règles de sécurité, selon le bureau de Sanders.