OpenAI freine le développement de son propre modèle Astra, visiblement trop doué pour le piratage
Ces dernières semaines ont été marquées par une série d’incidents impliquant des agents IA sortis de leur cadre de test. Le plus retentissant reste celui d’OpenAI lui-même : lors d’une évaluation interne démarrée début mai 2026, des agents expérimentaux étaient parvenus à communiquer entre eux via un dépôt logiciel, avant d’utiliser cette coordination pour s’introduire dans l’infrastructure de Hugging Face à la mi-juillet 2026.
Sans entrer autant dans le détail, Anthropic et Meta avaient eux aussi reconnu des incidents similaires, alimentant une question qui traverse désormais tout le secteur : le web est-il prêt à accueillir des hordes d’agents autonomes, prêts à tout pour atteindre l’objectif qui leur a été confié ?
C’est dans ce climat tendu qu’OpenAI a choisi de publier, le 7 août 2026, un billet inhabituel sur les capacités de son futur modèle Astra.
After evaluating one of our upcoming models, Astra, we're treating it as our first "critical" model for cybersecurity under our Preparedness Framework.This is a scenario we've planned for, and we're putting additional controls in place to ensure Astra's further development…— OpenAI (@OpenAI) August 7, 2026 Ce contenu est bloqué car vous n’avez pas accepté les cookies et autres traceurs. Ce contenu est fourni par Twitter. Pour pouvoir le visualiser, vous devez accepter l’usage étant opéré par Twitter avec vos données qui pourront être utilisées pour les finalités suivantes : vous permettre de visualiser et de partager des contenus avec des médias sociaux, favoriser le développement et l’amélioration des produits d’Humanoid et de ses partenaires, vous afficher des publicités personnalisées par rapport à votre profil et activité, vous définir un profil publicitaire personnalisé, mesurer la performance des publicités et du contenu de ce site et mesurer l’audience de ce site (en savoir plus) En cliquant sur « J’accepte tout », vous consentez aux finalités susmentionnées pour l’ensemble des cookies et autres traceurs déposés par Humanoid et . Vous gardez la possibilité de retirer votre consentement à tout moment. Pour plus d’informations, nous vous invitons à prendre connaissance de notre Politique cookies.
Astra, premier modèle à flirter avec le seuil critique
Le cœur de l’annonce repose sur le Preparedness Framework, le référentiel qu’OpenAI a publié dès décembre 2023 pour encadrer la montée en puissance de ses modèles sur des domaines sensibles : biologie, chimie, cybersécurité, auto-amélioration.
Ce cadre définit un risque de cybersécurité « critique » lorsqu’un modèle est capable de trouver des exploits zero-day dans de nombreux systèmes réels durcis, et ce sans aucune assistance humaine. Le seuil est également atteint si le modèle peut mener des cyberattaques contre des cibles protégées à partir d’un simple objectif de haut niveau formulé par un utilisateur.
Or, selon OpenAI, les évaluations préliminaires d’Astra, jusqu’ici classées « élevé » comme ses prédécesseurs dont GPT-5.6 Sol, montrent des progrès suffisamment marqués en codage agentique et en cybersécurité pour ne plus exclure ce niveau critique.
Résultat, le développement d’Astra, qui ne répond pas encore à ces nouvelles exigences, a été suspendu, et l’entreprise annonce vouloir associer des agences gouvernementales et des organismes de sécurité de l’IA à la poursuite des tests.
Une communication de plus en plus alarmiste
Astra n’a toutefois joué aucun rôle dans l’incident Hugging Face, précise OpenAI. En réponse, l’entreprise dit avoir renforcé l’isolement de ses environnements de test, restreint l’accès au réseau et aux outils, chiffré davantage les poids du modèle, et mis en place une surveillance des raisonnements de l’IA pouvant déclencher une interruption automatique en cas d’activité à risque.
Cette annonce s’inscrit dans une communication de plus en plus inquiète de la part de l’entreprise de Sam Altman. Lors de la conférence Black Hat, les chercheurs d’OpenAI Eric Wallace et Michael Dalton, qui avaient reconstitué dans le détail la chronologie de l’incident Hugging Face, avaient déjà annoncé ralentir volontairement certaines de leurs recherches pour muscler la sécurité, tout en appelant les équipes de défense à accélérer leurs propres efforts pour absorber ce changement d’échelle.
Un discours alarmiste, loin d’être une nouveauté dans l’industrie.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
Un édito exclusif, un guide, une reco de lecture et l’agenda de la rédaction : c’...
🔧 Outils mentionnés