En bref

  • OpenAI a déclaré le 1er septembre qu'Astra atteint le niveau « Critique » de son cadre de préparation, le premier modèle que l'entreprise ait jamais classé aussi haut pour la cybersécurité.
  • Astra a obtenu un score parfait de 100 % sur ExploitBench et, lors d'un test interne plus récent basé sur des vulnérabilités du navigateur V8 divulguées cet été, a découvert et enchaîné par elle-même deux zero-days jusqu'alors inconnus.
  • L'accès aux capacités avancées de cybersécurité d'Astra commence avec un petit groupe de testeurs alpha.

OpenAI a déclaré mardi qu'Astra, un modèle non publié, a franchi le seuil « critique » pour les capacités de cybersécurité selon son cadre de préparation, le premier modèle que l'entreprise ait jamais placé dans cette catégorie.

Cela signifie qu'Astra, que beaucoup pensent être GPT-6 plutôt qu'un modèle supplémentaire, peut trouver des failles de sécurité inconnues et construire des exploits fonctionnels sur de nombreux systèmes durcis sans qu'une personne la guide pas à pas.

Myriad : Quand OpenAI sortira GPT-6 ? Cliquez pour faire votre prédiction.
Myriad : Quand OpenAI sortira GPT-6 ? Cliquez pour faire votre prédiction.

« Nous pensons désormais qu'Astra atteint le seuil de capacité critique en cybersécurité selon notre cadre de préparation », a écrit OpenAI. « C'est le premier modèle que nous désignons à ce niveau, et il nécessite des garde-fous plus solides pendant le développement et avant la sortie. »

Dans le cadre de ce référentiel, un modèle atteint le niveau critique s'il peut développer de manière autonome des exploits zero-day fonctionnels sur de nombreux systèmes réels durcis, ou s'il peut planifier et exécuter une cyberattaque complète contre une cible difficile à partir d'un simple objectif de haut niveau. Les modèles précédents d'OpenAI, y compris GPT-5.6 Sol, plafonnaient au niveau inférieur « élevé » du référentiel.

Sur ExploitBench, un benchmark qui teste si un modèle peut transformer des vulnérabilités logicielles déjà connues en exploits fonctionnels et le note en taux de réussite direct, Astra a atteint un score parfait de 100 %.

Pour exclure que des réponses mémorisées gonflent ce score, OpenAI a construit un deuxième test utilisant 20 vulnérabilités à haute sévérité dans le moteur JavaScript V8 de Google, divulguées entre juin et août. Astra a surpassé GPT-5.6 Sol sur les taux d'exécution de code arbitraire là aussi, en utilisant beaucoup moins de jetons de sortie, et au passage, il a trouvé et enchaîné deux vulnérabilités zero-day qu'OpenAI est encore en train de divulguer aux mainteneurs concernés.

GPT-5.6 Sol est actuellement le meilleur modèle d'OpenAI.

Lors de tests pratiques contre un navigateur durci et un système d'exploitation durci, Astra a construit une chaîne de compromission complète qui est sortie du bac à sable du navigateur et a exécuté des commandes sur l'hôte simplement en ouvrant un fichier HTML malveillant. Il a également trouvé plusieurs failles dans le système d'exploitation durci et les a enchaînées en un chemin d'élévation de privilèges depuis un compte utilisateur ordinaire jusqu'à root.

OpenAI a déclaré que le modèle refuse 91,5 % des tentatives de jailbreak cybernétique lors de ses propres tests, contre 59 % pour GPT-5.6 Sol. L'accès aux capacités de cybersécurité les plus avancées d'Astra commence avec un petit groupe de testeurs alpha, avec un accès plus large déployé plus tard via le programme Daybreak Blue d'OpenAI pour le travail de sécurité défensive.

Cette divulgation fait suite à des semaines d'inquiétudes dans toute l'industrie. Il y a quelques jours à peine, OpenAI a suspendu le développement d'Astra après que les compétences cybernétiques et de codage du modèle ont progressé rapidement, un avertissement qui est arrivé juste après qu'un autre système non publié d'OpenAI a enchaîné des vulnérabilités pour compromettre Hugging Face tout en trichant sur un benchmark de sécurité. OpenAI affirme qu'Astra n'a joué aucun rôle dans cet incident.

Les traders avaient déjà anticipé un retournement rapide. Les marchés de prédiction sur Myriad suivis par Decrypt donnaient à Astra, liée en interne au nom de code GPT-6, 72 % de chances d'une sortie publique d'ici le 30 septembre, même après la pause de début août d'OpenAI, et OpenAI n'a toujours pas fixé de date de lancement public. Ces probabilités ont changé de 55 % en faveur d'une sortie d'ici novembre 2026.

Le calendrier place Astra face à un nouveau rival. Anthropic a publié Fable 5.1 et Mythos 5.1 mardi, et Mythos 5.1, comme le précédent Mythos 5, est réservé aux organisations de cybersécurité et de sciences de la vie vérifiées plutôt qu'au grand public.

Decrypt a rapporté en juin que le GPT-5.5-Cyber d'OpenAI avait déjà dépassé Mythos 5 sur CyberGym, un benchmark qui fait s'affronter des agents IA sur plus de 1 500 vulnérabilités connues provenant de projets open source réels et les note sur le nombre de celles qu'ils reproduisent correctement.

Les deux entreprises étaient pressenties pour préparer de nouveaux modèles de pointe à peu près au même moment, et c'est maintenant chose faite. Fable 5.1 est sorti le 1er septembre, et OpenAI annonce qu'Astra arrive bientôt, avec ses outils cyber les plus performants d'abord réservés à un accès alpha, puis Daybreak Blue ensuite.