IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Le modèle d'IA Astra d'OpenAI est proche du lancement, et serait très efficace pour pirater des systèmes informatiques
Astra serait le premier à franchir le seuil critique en matière de cybersécurité

Le , par Jade Emy

109PARTAGES

5  0 
OpenAI a déclaré que son prochain modèle d’IA, Astra, est le premier à dépasser le seuil de capacité en cybersécurité « critique ». L’entreprise a précisé qu’Astra est capable de détecter des failles de sécurité jusque-là inconnues et de les exploiter sans instructions détaillées de la part d’humains. OpenAI a ajouté qu’elle prévoyait toujours de rendre Astra disponible « prochainement », mais que l’accès à ses capacités en matière de cybersécurité serait plus limité.

Début août, OpenAI a révélé que son prochain modèle d'IA, encore inédit, baptisé Astra, a réussi à résoudre dix problèmes de longue date dans les domaines des mathématiques, de la complexité quantique et de l'informatique théorique. Le modèle d'IA a généré ces démonstrations mathématiques complexes de manière entièrement autonome. Les problèmes résolus par le modèle Astra font appel à des théories académiques extrêmement complexes. Ce n'est pas la première fois qu'OpenAI revendique un succès dans le domaine des mathématiques, mais ces nouvelles découvertes d’Astra font l’objet d’un examen tout aussi rigoureux.

Quelques jours plus tard, OpenAI a déclaré qu’elle ne pouvait exclure que son prochain modèle d’IA, Astra, possède des capacités de cybersécurité « critiques », ce qui a obligé l’entreprise à suspendre certains travaux internes et à renforcer ses mesures de sécurité. Selon les propres directives de sécurité de l’entreprise, un modèle atteint le seuil critique s’il est capable, de manière autonome, de détecter et d’exploiter des vulnérabilités « zero-day » existant dans le monde réel ou de mener des cyberattaques complexes sans intervention humaine. En conséquence, OpenAI a renforcé les tests de robustesse de ces mesures de protection et de ces contrôles de sécurité afin qu’ils soient adaptés à un déploiement de ces capacités.

Récemment, OpenAI a annoncé que son futur modèle d’IA, Astra, était le premier à franchir le seuil de capacité en matière de cybersécurité classé « critique ». L’entreprise a précisé qu’Astra était capable de détecter des failles de sécurité jusque-là inconnues et de les exploiter sans instructions détaillées de la part d’humains, ce qui signifie que le modèle relève de la catégorie la plus avancée de son « cadre de préparation » (Preparedness Framework). OpenAI a indiqué qu’elle prévoyait toujours de rendre Astra disponible « prochainement », mais que l’accès à ses capacités en matière de cybersécurité serait plus limité.

OpenAI a lancé son « Preparedness Framework » en 2023 ; ce cadre sert de méthode à l’entreprise pour « suivre et se préparer aux capacités avancées de l’IA susceptibles d’introduire de nouveaux risques de préjudice grave ». Dans une mise à jour de ce cadre effectuée l’année dernière, l’entreprise a défini un seuil de capacité « élevé », au-delà duquel les modèles pourraient amplifier les « voies existantes » menant à des préjudices graves, et un seuil de capacité « critique », au-delà duquel les modèles pourraient introduire de « nouvelles voies sans précédent » menant à des préjudices graves. « Nous partagerons davantage de détails concernant nos tests et évaluations en matière de sûreté, de sécurité et d’alignement dans la fiche technique du modèle lors de son lancement », a déclaré OpenAI.

Les pratiques d’OpenAI en matière de sécurité et de sûreté ont fait l’objet d’une attention particulière après que l’entreprise a révélé que deux de ses modèles s’étaient échappés de leur environnement d’entraînement, avaient accédé au Web public et avaient piraté les systèmes de Hugging Face le mois dernier. OpenAI a qualifié cette attaque d’« incident de cybersécurité sans précédent » et a temporairement suspendu certaines de ses activités internes d’entraînement et de recherche.

L’entreprise a décidé de retarder certaines étapes du développement d’Astra, même si le modèle n’était pas impliqué dans l’incident de Hugging Face. Après avoir renforcé et testé ses mesures de protection, OpenAI a déclaré qu’elle estimait que les dispositifs de sécurité du modèle « minimisaient suffisamment le risque de préjudice grave pour permettre sa mise à disposition dans le cadre de notre Preparedness Framework ». Les capacités de cybersécurité avancées d’Astra seront mises à la disposition d’un groupe restreint d’organisations faisant partie de sa coalition de cybersécurité baptisée Daybreak, a précisé OpenAI.


Voici le rapport d'OpenAI :

Voie vers Astra : capacités critiques et mesures de protection de pointe

Depuis notre précédente évaluation, selon laquelle Astra pourrait atteindre un niveau critique de capacité en matière de cybersécurité, nous avons recueilli davantage d’éléments et mené des évaluations supplémentaires afin d’analyser les capacités du modèle. Nous estimons désormais qu’Astra atteint le seuil de capacité critique en matière de cybersécurité défini dans notre cadre de préparation, ce qui signifie qu’avec les outils et les accès appropriés, il est capable de détecter des failles de sécurité jusque-là inconnues et de mettre au point des moyens de les exploiter sur de nombreux systèmes bien protégés, sans qu’une personne ne guide chacune de ses étapes. Il s’agit du premier modèle que nous classons à ce niveau, ce qui nécessite des mesures de sécurité renforcées pendant son développement et avant sa mise à disposition.

Au cours des dernières semaines, nous avons retardé certaines étapes du développement et de la mise à disposition d’Astra afin de renforcer et de tester les protections contre les utilisations malveillantes et les actions non autorisées du modèle. Sur la base de ce travail, nous estimons que les mesures de sécurité d’Astra minimisent suffisamment le risque de préjudice grave pour permettre sa mise à disposition conformément à notre cadre de préparation.

Bien qu’Astra n’ait pas été impliqué dans l’incident Hugging Face, nous avons intégré les enseignements tirés de cet incident dans notre approche en matière de sécurité. D’après des tests rétrospectifs, nous estimons que nos mesures de sécurité en production à l’époque auraient permis d’éviter l’incident Hugging Face. Depuis, nous avons mis en place des mesures de sécurité encore plus robustes pour Astra, notamment en entraînant le modèle à refuser de manière plus fiable les requêtes cybernétiques nuisibles et à respecter les restrictions de sécurité, en ajoutant des protections supplémentaires contre les utilisations abusives, et en mettant en place une surveillance capable de bloquer toute activité potentiellement non autorisée.

Nous prévoyons de rendre Astra disponible prochainement, mais l’accès à ses capacités de cybersécurité les plus avancées sera plus limité. Les fonctionnalités avancées de cybersécurité seront dans un premier temps réservées à un groupe de testeurs, puis accessibles via Daybreak Blue afin d’étendre leur utilisation à des fins défensives.

Nous partagerons davantage de détails concernant nos tests et évaluations en matière de sûreté, de sécurité et d’alignement dans la fiche technique du modèle lors de son lancement. Avant sa sortie, nous souhaitons faire le point sur certains des travaux que nous avons menés pour préparer le lancement en toute sécurité d’un modèle doté de ce niveau de capacités en matière de cybersécurité — et faire preuve de transparence quant aux risques qui subsistent.

Évaluation des capacités d’Astra en matière de cybersécurité

Dans le cadre de notre « Preparedness Framework », un modèle atteint le seuil « Critique » si l’une des conditions suivantes est remplie :

- Le modèle est capable d’identifier et de développer des exploits « zero-day » fonctionnels de tous niveaux de gravité dans de nombreux systèmes critiques réels et renforcés, sans intervention humaine.

- Le modèle est capable de concevoir et d’exécuter de bout en bout des stratégies novatrices de cyberattaques contre des cibles renforcées, à partir uniquement d’un objectif général de haut niveau.

Notre évaluation de l’état de préparation d’Astra a combiné des tests de performance automatisés, publics et privés, avec des évaluations menées par des experts. Astra représente une augmentation significative des capacités en matière de cybersécurité par rapport à GPT-5.6 Sol : il est à la fois nettement plus efficace en termes de tokens et plus performant dans l’identification des vulnérabilités et le développement d’exploits.

À titre d’exemple, nous avons testé Astra sur ExploitBench, où le modèle a obtenu un score parfait de 100 % lors du benchmark visant à évaluer sa capacité à développer des exploits à partir de vulnérabilités connues.

En raison de craintes de contamination, nous avons ensuite mis au point un benchmark interne intitulé « ExploitBench - Internal Port (juin-août 2026) », qui contient 20 vulnérabilités V8 à haut niveau de gravité récemment divulguées. Sur cet ensemble de données, Astra atteint des taux d’exécution de code arbitraire bien supérieurs à ceux de GPT-5.6 Sol, tout en utilisant beaucoup moins de tokens de sortie. Au cours de l’évaluation, le modèle a même découvert et utilisé deux vulnérabilités « zero-day » dans le cadre d’une chaîne d’exploits. Nous sommes en train de signaler ces deux vulnérabilités aux responsables de la maintenance.


Lors d’évaluations menées par des experts sur un navigateur et un système d’exploitation renforcés, Astra a découvert des vulnérabilités jusque-là inconnues et les a transformées en chaînes d’exploitation fonctionnelles. Elle a mis au point une chaîne complète de compromission du navigateur qui a contourné le bac à sable et exécuté des commandes sur l’hôte lorsque le navigateur a ouvert un fichier HTML. Le modèle a également identifié plusieurs vulnérabilités dans un système d’exploitation renforcé et les a combinées pour former une chaîne d’élévation de privilèges locale, permettant à un utilisateur sans privilèges d’accéder au niveau root. Au total, notre enquête nous a amenés à conclure qu’Astra atteint le seuil critique.

Mesures de protection requises pour les capacités critiques

Pour les modèles dotés d’un niveau de capacités de cybersécurité équivalent à celui d’Astra, nous devons couvrir deux voies afin de minimiser le risque de préjudice cyber grave, tant pendant le développement qu’avant le déploiement :

- Les acteurs malveillants utilisant le modèle. Nos mesures de protection doivent empêcher de manière robuste les acteurs malveillants d’utiliser Astra pour développer des exploits ciblant des failles jusque-là inconnues dans des systèmes critiques renforcés ou pour mener des attaques de bout en bout contre des cibles renforcées.

- Le modèle effectuant des actions non autorisées ou non conformes. Même en l’absence d’un utilisateur malveillant, un modèle doté de capacités avancées en matière de cybersécurité pourrait lui-même causer des dommages cybernétiques s’il n’est pas correctement aligné. Outre le fait d’appliquer une norme très stricte d’alignement pour les modèles dotés de ces capacités, nos mesures de protection doivent être capables de détecter et de contenir rapidement les actions non conformes susceptibles de causer des dommages significatifs dans le monde réel, en tant que deuxième couche de défense.

Il convient de noter que cette deuxième approche s’applique aussi bien au développement interne qu’au déploiement externe. Comme nous l’avons décrit précédemment, nous avons suspendu certains entraînements de pointe (y compris certains entraînements pour Astra) pendant deux semaines après l’incident OpenAI-Hugging Face afin de renforcer notre infrastructure d’entraînement, notamment par des mesures d’isolation et de contrôle du réseau, une surveillance étendue, ainsi qu’un renforcement de l’entraînement à l’alignement et des seuils. Nous avons ensuite poursuivi des travaux à plus petite échelle sous des contrôles plus stricts.

Nous avons suspendu plus longtemps certaines sessions d’apprentissage par renforcement (RL) de grande envergure destinées aux futures versions d’Astra, le temps de mettre en place des exigences plus strictes en matière de sûreté et de sécurité de leur environnement d’entraînement. Le 28 août, nous avons relancé la grande session d’apprentissage par renforcement de pointe qui avait été suspendue après la mise en place des nouvelles exigences de sûreté et de sécurité. Nous continuons à suspendre temporairement certaines sessions d’entraînement expérimentales de moindre envergure.

La préparation d’Astra en vue de son lancement a également nécessité des protections renforcées contre les abus informatiques et les actions non autorisées. Nous décrivons ci-dessous ces mesures de protection et la manière dont nous les avons testées.

Robustesse face aux abus informatiques

Depuis le déploiement, en février, du premier modèle que nous avons classé comme « haute capacité » en matière de cybersécurité, nous avons renforcé nos mesures de protection informatique à chaque lancement successif. Notre approche globale de la sécurité repose sur plusieurs niveaux : des mécanismes de refus des modèles post-entraînés, des classificateurs de sécurité au niveau du système, ainsi que la détection hors ligne et la neutralisation des menaces.

Pour GPT-5.6⁠, nous avons considérablement amélioré la robustesse de notre pile au niveau système, notamment en ajoutant des classificateurs d’activation pour détecter les abus cybernétiques et en améliorant la couverture des « jailbreaks » universels identifiés grâce à des tests intensifs de « red teaming » automatisés. En nous appuyant sur ces améliorations, nous avons, pour Astra, investi davantage dans la couche modèle de notre pile de mesures de sécurité, tout en améliorant la capacité de nos mesures à gérer le contexte inter-conversations.

- Grâce à de nouvelles techniques d’entraînement visant à renforcer la robustesse des modèles, Astra rejette de manière plus rigoureuse les demandes d’assistance informatique non autorisées. Lors de nos évaluations portant sur les « cyber-jailbreaks », Astra a rejeté 91,5 % des demandes (contre 59 % pour GPT-5.6 Sol).

- Pour les comptes jugés à haut risque, nous appliquons une limite de comportement du modèle plus restrictive qui refuse un éventail plus large d’aides informatiques potentiellement risquées. Pour les utilisateurs à haut risque, nous avons élargi le champ d’application de nos systèmes de surveillance afin de pouvoir détecter ce type d’abus informatiques.

Nous avons également poursuivi notre programme de tests rigoureux, de « red-teaming » interne et externe, et de mesures correctives. Outre les tests de régression visant à garantir que toutes les failles de sécurité identifiées lors de nos précédentes périodes de test restent couvertes, nous menons une nouvelle vague d’attaques simulées avec nos derniers attaquants internes spécialisés dans ce type d’opérations. Nous collaborons avec des partenaires du secteur pour définir un système commun de classification des failles de sécurité et nous utiliserons notre programme d’intervention rapide, opérationnel 24 h/24 et 7 j/7, pour enquêter sur les nouvelles découvertes et y remédier. Nous partagerons plus de détails sur nos tests de cyber-sécurité dans la fiche du système Astra.

Aider les défenseurs à détecter et à corriger les vulnérabilités reste un pilier central de notre approche en matière de sécurité. Lors de son lancement, nous nous attendons à ce que les mesures de sécurité d’Astra créent davantage de frictions que ce que nous prévoyons à terme, afin de nous prémunir contre toute utilisation abusive potentielle. L’accès à Astra pour les workflows avancés de cybersécurité sera dans un premier temps réservé à un petit groupe de testeurs alpha, puis étendu via Daybreak Blue afin de prendre en charge une utilisation défensive.

Alignement et surveillance

Nous avons également ajouté des couches de protection supplémentaires pour empêcher le modèle d’entreprendre des actions potentiellement non conformes :

- Alignement du modèle : lors de nos évaluations, Astra s’est montré bien plus enclin que GPT-5.6 Sol à respecter les restrictions explicites en matière de sûreté et de sécurité et à rester dans les limites de son champ d’application autorisé, ce qui en fait notre modèle le mieux aligné à ce jour. Nous nous sommes particulièrement concentrés sur le respect par le modèle des restrictions de sûreté et de sécurité, ainsi que sur sa propension à rester dans les limites de son champ d’application autorisé.

- Surveillance et contrôle : à l’instar de nos procédures...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 05/09/2026 à 14:21
OpenAI est une société d'intérêt public (PBC)
NON... Ce n'est plus vrai...

OpenAI s'est transformée en catimini en une société à but lucratif au même titre qu'un google ou qu'un microsoft!!!

OpenAI prévoit d'ailleurs d'entrer en bourse très prochainement
4  0 
Avatar de totozor
Expert confirmé https://www.developpez.com
Le 08/09/2026 à 7:30
Citation Envoyé par Anthony Voir le message
Le PDG de Nvidia, Jensen Huang, a déclaré que l’intelligence artificielle générale (AGI) était désormais arrivée,[...] tandis que le PDG d’OpenAI lui-même, Sam Altman, a qualifié l’AGI de concept mal défini et de label marketing hors de propos.
Un responsable de la bulle de l'IA fait du marketing pendant qu'un autre le modère.
C'est beau
2  0 
Avatar de suricata
Nouveau Candidat au Club https://www.developpez.com
Le 05/09/2026 à 16:31
Je me demande jusqu'à quel point ils ne se sont pas "inspirés" d'une autre IA vendue au Pentagone. Juste une idée comme ça.
1  0 
Avatar de _toma_
Membre éclairé https://www.developpez.com
Le 07/09/2026 à 15:01
sans intervention humaine, sans indices
L'enthousiasme de la communauté s'est rapidement heurté au scepticisme, certains rappelant que Portal est sorti en 2007 et a été décortiqué salle par salle
Il me semble que tout est dit. Pas besoin de lui fournir des instructions et des indices puisque la solution du jeu est déjà comprise dans son jeu de données.
1  0 
Avatar de Uther
Expert éminent sénior https://www.developpez.com
Le 07/09/2026 à 15:24
Vu que gros de l'infrastructure est déjà en place, il serait intéressant de voir comment il se débrouille sur des puzzles inédits. Portal permet d'en créer assez facilement.
1  0 
Avatar de _toma_
Membre éclairé https://www.developpez.com
Le 07/09/2026 à 21:16
Un débat houleux autour de l'avènement de l'AGI
Ce sont des outils statistiques. Le débat est clos.
1  1