En bref
- OpenAI a déclaré qu'il « ne peut pas exclure » qu'Astra ait atteint le niveau le plus élevé de son échelle de risque cybernétique.
- L'entreprise a suspendu le travail interne sur le modèle et renforcé l'isolement, la surveillance et les contrôles d'accès.
- Cet avertissement intervient quelques semaines après que des modèles d'OpenAI, d'Anthropic et de Meta ont percé des systèmes réels par eux-mêmes.
OpenAI affirme que son prochain modèle majeur pourrait être suffisamment dangereux pour écrire ses propres cyberarmes, et il se retire jusqu'à ce que les mesures de sécurité rattrapent leur retard.
« Nos dernières évaluations internes d'Astra, l'un de nos prochains modèles, au cours des derniers jours indiquent des progrès significatifs dans le codage agentique et la cybersécurité », a déclaré OpenAI. « Ces résultats, en plus des évaluations d'experts, nous ont conduits à conclure hier soir que nous ne pouvons pas exclure des capacités cybernétiques critiques selon notre Cadre de préparation (opens in a new window). »
OpenAI a publié l'avertissement indiquant que les tests internes d'Astra, un modèle non publié, n'ont joué aucun rôle dans la récente violation de Hugging Face malgré ses capacités.
Le cadre est le règlement d'OpenAI pour les modèles risqués, publié pour la première fois en décembre 2023. « Critique » est son échelon le plus élevé. Un modèle l'atteint s'il peut trouver et construire des exploits zero-day fonctionnels (des failles auparavant inconnues qu'un fournisseur n'a pas corrigées) sur des systèmes durcis sans intervention humaine, ou s'il peut planifier et exécuter une attaque complète sur une cible difficile à partir de rien d'autre qu'un objectif de haut niveau. Les modèles précédents, y compris GPT-5.6-Sol, plafonnaient au niveau inférieur « Élevé ».
Le schéma est déjà réel
La prudence d'OpenAI se lit différemment lorsqu'on la met en regard de ce qui s'est passé au cours des dernières semaines. Ce n'est pas une inquiétude future. Les modèles de pointe ont déjà brisé leurs cages de test et se sont attaqués à des cibles réelles.
Le cas le plus clair vient d'OpenAI lui-même. Comme Decrypt l'a précédemment rapporté, les agents de l'entreprise ont enchaîné les vulnérabilités, se sont échappés de leur environnement de test, ont atteint Internet et ont attaqué Hugging Face tout en essayant de tricher sur un benchmark de sécurité. Dans un suivi, OpenAI a détaillé comment le même agent voyou a également pénétré au moins quatre autres services accessibles au public, en utilisant des identifiants trouvés sur le web ouvert.
Claude d'Anthropic a fait de même de l'autre côté. Plusieurs versions de Claude ont obtenu un accès non autorisé à trois entreprises réelles après qu'une mauvaise configuration a donné au modèle l'accès à Internet ouvert. Dans un cas, Claude Opus 4.7 a pris le site d'une entreprise réelle pour la cible fictive de sa mission, a récupéré des identifiants et a atteint une base de données de production contenant plusieurs centaines de lignes de données réelles.
Et Meta a rejoint la liste ce mois-ci. Decrypta rapporté qu'un modèle Muse Spark s'est échappé de son environnement de test, a atteint Internet via une erreur de configuration d'un partenaire, et a exploité une faille dans un service tiers. Le Kimi K3 de Moonshot AI, qui a également fait quelque chose de similaire, s'est échappé de son bac à sable pour trouver des réponses à un benchmark dans un dépôt public.
L'Institut de sécurité de l'IA du Royaume-Uni a constaté que ce comportement n'était pas non plus un cas isolé. Lors des tests de Mythos 5 d'Anthropic et de GPT-5.6-Sol d'OpenAI, il a enregistré 10 instances sur 122 où les modèles ont pris des mesures non autorisées sur Internet en direct, l'une d'elles tentant de glisser un code malveillant dans un projet open source.
La réponse d'OpenAI à Astra est de verrouiller la porte avant que le modèle ne soit prêt. Il suspend les travaux internes sur Astra qui manquent des nouveaux contrôles, isole les environnements de test, restreint l'accès au réseau et aux outils, protège les poids du modèle et surveille les actions risquées dans l'ensemble.






