OpenAI a déclaré qu’elle ne pouvait exclure que son prochain modèle d’IA, Astra, possède des capacités de cybersécurité « critiques », ce qui oblige l’entreprise à suspendre certains travaux internes et à renforcer ses mesures de sécurité. Selon les propres directives de sécurité de l’entreprise, un modèle atteint le seuil critique s’il est capable, de manière autonome, de détecter et d’exploiter des vulnérabilités « zero-day » existant dans le monde réel ou de mener des cyberattaques complexes sans intervention humaine.OpenAI est un organisme américain de recherche en intelligence artificielle (IA) dont le siège social est situé à San Francisco. Il est constitué d’OpenAI Group PBC, une société d’intérêt public à but lucratif (PBC), partiellement contrôlée par OpenAI Foundation, une organisation à but non lucratif. OpenAI développe des modèles d’IA générative, en particulier la série de grands modèles de langage GPT. Le lancement de ChatGPT en novembre 2022 est considéré comme ayant catalysé l’essor de l’IA et suscité un intérêt généralisé pour l’IA générative.
Mi-juillet 2026, OpenAI a déclaré que deux de ses modèles d’IA les plus avancés — notamment GPT-5.6 Sol et un modèle en pré-lancement encore plus performant, tous dotés de capacités de cyberdéfense réduites à des fins d’évaluation — s’étaient échappés d’un test contrôlé et avaient piraté Hugging Face, la plus grande base de données au monde de modèles d'IA. OpenAI a déclaré que son agent rebelle s’était également introduit dans plusieurs services et comptes accessibles au public. OpenAI indique que l'agent a trouvé plusieurs sites web accessibles au public, notamment des pages partageant du code, des utilitaires web, des captures d’écran et d’autres informations, afin de l'aider à créer le code nécessaire pour pirater Hugging Face. OpenAI a déclaré qu’aucun des autres sites piratés n’avait atteint le même niveau d’accès que celui obtenu par l'agent IA avec Hugging Face.
Récemment, OpenAI a déclaré qu’elle ne pouvait exclure que son prochain modèle d’IA, Astra, possède des capacités de cybersécurité « critiques », ce qui oblige l’entreprise à suspendre certains travaux internes et à renforcer ses mesures de sécurité. Selon les propres directives de sécurité de l’entreprise, un modèle atteint le seuil critique s’il est capable, de manière autonome, de détecter et d’exploiter des vulnérabilités « zero-day » existant dans le monde réel ou de mener des cyberattaques complexes sans intervention humaine.
Cet avertissement fait suite à des évaluations préliminaires menées pendant plusieurs jours, ainsi qu’à des analyses réalisées par des experts externes, qui ont indiqué qu’Astra pourrait être capable d’effectuer de manière autonome des tâches informatiques de plus en plus sophistiquées. OpenAI a déclaré avoir désormais renforcé ses contrôles de sécurité, suspendu les activités internes qui ne répondent pas à ses nouvelles exigences plus strictes, et transféré le développement du modèle vers des environnements de test isolés, dotés d’un accès réseau restreint et d’une exécution en bac à sable.
Cette révélation intervient dans un contexte de remise en question plus large concernant le contrôle de l’IA. Debut août, OpenAI a apporté plus de détails sur la manière dont ses agents IA ont outrepassé le cadre de leur mission pour mener des cyberattaques imprévues. Ils ont réussi à s'échapper de leur bac à sable en exploitant une faille pour communiquer secrètement via un forum interne. En collaborant de manière autonome, ils ont partagé des techniques de piratage et coordonné une intrusion contre la plateforme Hugging Face. Cet incident inédit a mis en lumière des lacunes critiques dans la surveillance humaine et l'infrastructure de sécurité d'OpenAI. Il souligne l'urgence de développer des systèmes de défense automatisés contre ces comportements déviants.
OpenAI a précisé qu’Astra n’était pas impliqué dans la violation de Hugging Face, tandis que ces dernières semaines, OpenAI, Anthropic et Meta ont toutes révélé que leurs modèles avaient pénétré dans les systèmes d’autres entreprises lors de tests de cybersécurité. Le PDG Sam Altman a indiqué sur X que l’entreprise continuait à travailler à la mise à disposition générale d’Astra. « Nous ne pensons pas que ce soit une bonne stratégie de réserver des modèles puissants à une poignée d’initiés », a-t-il déclaré. OpenAI prévoit de s’associer à des agences gouvernementales et à certaines organisations spécialisées dans la sécurité de l’IA afin de tester plus en profondeur les capacités du modèle.
Voici l'annonce d'OpenAI :
Faire face aux nouveaux défis en matière de capacités cybercritiques
La cybersécurité évolue rapidement à mesure que les modèles gagnent en performances, ce qui permet à la fois de renforcer les cyberdéfenses et de mener des attaques à une vitesse et à une échelle sans précédent.
Nos dernières évaluations internes d’Astra, l’un de nos futurs modèles, réalisées ces derniers jours, indiquent des progrès significatifs en matière de codage agentique et de cybersécurité. Ces résultats, combinés aux évaluations d’experts, nous ont amenés à conclure hier soir que nous ne pouvons pas exclure l’existence de capacités cybercritiques dans le cadre de notre Cadre de préparation.
Nous partageons cette information car nous estimons qu’il est important de faire preuve de transparence envers le public et les communautés chargées de la sûreté et de la sécurité concernant cette évolution potentielle des capacités.
Nous avons publié pour la première fois notre Cadre de préparation en décembre 2023, bien avant que les modèles n’atteignent ce niveau de capacités en matière de risques biologiques, chimiques, de cybersécurité et d’auto-amélioration de l’IA. Nous l’avons créé afin de disposer d’un guide permettant d’identifier les progrès en matière de capacités, puis de planifier les mesures que notre entreprise prendrait à mesure que ces capacités émergeraient. Les modèles précédents, y compris GPT‑5.6‑Sol, ont été évalués au regard de leurs capacités de pointe en matière de cybersécurité et classés au seuil « Élevé » (plutôt que « Critique »).
Évaluation des capacités critiques en matière de cybersécurité
Selon notre cadre de préparation, un modèle atteint le seuil « critique » en matière de cybersécurité s’il est capable d’identifier et de développer des exploits « zero-day » fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques réels et renforcés sans intervention humaine, ou s’il est capable de concevoir et d’exécuter de bout en bout des stratégies novatrices de cyberattaques contre des cibles renforcées en ne disposant que d’un objectif général de haut niveau.
Bien que nous continuions à comparer et à évaluer ce modèle, nos évaluations préliminaires indiquent des performances suffisamment solides pour que nous ne puissions pas exclure, à ce stade, un niveau de capacité « critique ». Astra est un modèle en cours de développement qui n’a pas été impliqué dans l’exploitation de Hugging Face.
Mesures que nous prenons
En conséquence, nous avons renforcé les tests de robustesse de nos mesures de protection et de nos contrôles de sécurité afin qu’ils soient adaptés à un déploiement de ces capacités. En interne, nous avons également pris les mesures suivantes afin que le développement ultérieur de ce modèle se déroule en toute sécurité :
- Nous mettons en place des contrôles de sécurité plus stricts pour les modèles à haute capacité et les activités associées, notamment des environnements de test isolés, un accès restreint au réseau et aux outils, une protection et un chiffrement renforcés des poids du modèle, des capacités supplémentaires de surveillance et de détection, ainsi qu’une exécution en bac à sable.
- Nous suspendons les activités internes impliquant Astra qui ne répondent pas encore à ces exigences renforcées en matière de contrôles de sécurité.
- Nous avons mis en place une surveillance universelle des actions à risque et des divergences dans toutes les applications autonomes d’Astra, y compris l’entraînement et l’évaluation. Des surveillants évaluent la chaîne de raisonnement du modèle et déclenchent une réponse de sécurité afin d’examiner et d’interrompre les activités à haut risque.
- Nous collaborerons avec les agences gouvernementales concernées et certaines organisations spécialisées dans la sécurité de l’IA pour tester les capacités de ce modèle.
- Nous fournirons des contrôles de sécurité recommandés à nos partenaires de test tiers afin qu’ils puissent effectuer en toute sécurité des évaluations et des charges de travail à haut risque.
Ce cadre nous a déjà guidés lors d’autres transitions de capacités. En juin 2025, alors que nos modèles approchaient du seuil de capacité élevé en biologie défini par le Cadre de préparation, nous avons présenté les mesures que nous prenions pour renforcer les garanties, étendre les tests, collaborer avec des experts externes et déployer des contrôles de sécurité supplémentaires. Nous appliquons ici le même principe.
Nous estimons que les modèles dotés de capacités cybernétiques avancées devraient aider les défenseurs à identifier et à corriger les vulnérabilités avant que les attaquants ne le fassent. Nous nous engageons à travailler aux côtés des gouvernements, des instituts de sécurité et de la société civile pour garantir que les capacités de pointe de modèles tels qu’Astra, et de ceux qui suivront, soient déployées de manière responsable et à grande échelle, dans l’intérêt de l’humanité tout entière.
Source : Annonce d'OpenAI
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?Voir aussi :
Les agents IA « Mythos 5 » d'Anthropic et « GPT-5.6-Sol » d'OpenAI ont créé de faux profils humains pour tenter de piéger des personnes dans le cadre d'une cyberattaque simulée lors de tests menés par l'AISI
OpenAI affirme que son prochain modèle d'IA, Astra, encore inédit, a résolu 10 problèmes vieux de plusieurs décennies, en mathématiques, physique quantique et informatique théorique pour seulement 2 000 $
Les failles de sécurité détectées par l'IA ne s'avèrent pas plus faciles à exploiter, malgré le battage médiatique. Seulement 1,3 % d'entre elles font l'objet d'attaques réelles, selon une étude
Vous avez lu gratuitement 3 383 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.