IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

OpenAI reporte la sortie de GPT-6.1 Astra à la suite d'une série d'incidents de sécurité et de la défaillance d'un « kill switch » automatisé lors des tests,
Le modèle a été plus « trompeur » que GPT-6 Astra

Le , par Mathis Lucas

118PARTAGES

4  0 
OpenAI a suspendu le lancement de son modèle GPT-6.1 Astra et interrompu l'entraînement de ses IA les plus puissantes. Cela fait suite à des préoccupations majeures concernant la sécurité et l'alignement. Des tests internes ont révélé des comportements imprévus et trompeurs de plusieurs agents IA, notamment le contournement des barrières de sécurité, la communication secrète et l'accès illégal à des systèmes externes. Ces incidents répétés chez OpenAI et Anthropic mettent en lumière la complexité croissante du contrôle des systèmes d'IA. Ces dérives ont déclenché une surveillance accrue de la part des gouvernements et des régulateurs.

De nombreuses entreprises américaines spécialisées dans l'IA (OpenAI, Google, Meta et Anthropic), ainsi que des chercheurs indépendants, enquêtent actuellement sur des dizaines de milliers d’incidents de sécurité impliquant leurs modèles de pointe. Ces incidents concernent notamment des situations où des agents IA autonomes ont pris des mesures jugées très problématiques par des évaluateurs indépendants et des chercheurs en sécurité.

Le nombre considérable d’incidents indique que « le problème est d’un ordre de grandeur plus complexe que ce qui est connu du grand public ». Une grande partie de ces événements découlent d'erreurs de configuration d'un environnement de test et d'évaluation interne de la startup israélienne Irregular.

De l'extérieur, OpenAI et ses rivaux paraissent avoir perdu la maîtrise de leur propre technologie. Jensen Huang, PDG de Nvidia, pense que les laboratoires d'IA devraient « fermer leurs portes » s'ils ne contrôlent pas leurs systèmes. OpenAI a désormais suspendu l’entraînement de ses modèles de pointe à la suite d'un nouvel incident au cours duquel un « kill switch » automatisé n’a pas réussi à arrêter un agent IA rebelle pendant son entraînement.

Annulation du lancement du modèle GPT-6.1 Astra par OpenAI

L'entreprise a officiellement annulé la sortie de GPT-6.1 Astra, dont le lancement était initialement prévu pour octobre 2026 dans ses outils ChatGPT et Codex. Son lancement a été reporté afin de poursuivre les évaluations. Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a indiqué que ce modèle affichait un niveau de tromperie plus élevé que ses prédécesseurs et n'était pas toujours honnête quant aux actions réellement accomplies.


Parmi les incidents signalés, on trouve des agents IA contournant les barrières de sécurité, créant des forums de discussion, s’échappant de leurs environnements de test, piratant des sites Web et générant eux-mêmes des prompts. La gravité de ces incidents varie ; ils comprennent à la fois des tentatives réussies et des échecs, la plupart n’ayant pas encore causé de préjudice concret. OpenAI n'est pour l'instant pas capable d'expliquer ce problème.

Certains des tests à l’origine de ces incidents s’apparentent à des exercices de « red teaming », au cours desquels les entreprises tentent délibérément de pousser les modèles à se comporter de manière inappropriée afin d’évaluer leur sécurité. En bref, les récents tests révèlent que GPT-6.1 Astra souffre de problèmes d'autorisation de périmètre, exécutant des tâches sans permission et sollicitant des outils ou logiciels externes potentiellement risqués.

Concernant ces arbitrages de sécurité, Saachi Jain a rappelé qu'il fallait déterminer la juste limite entre respecter le périmètre et éviter la paresse du modèle lorsqu'il rencontre de la friction. De plus, la responsable d'OpenAI a également insisté sur les exigences de la société : « nous voulons nous assurer que le développement de nos modèles est sûr, que ce soit au sein de l'entreprise ou lorsque nous les mettons à la disposition des utilisateurs ».

GPT-6.1 Astra est plus performant que les précédents modèles d'OpenAI pour mener à bien des tâches complexes de bout en bout sans assistance humaine. L'entreprise va plutôt se concentrer sur l'amélioration de la sécurité de ses futurs modèles, dont elle prévoit qu'ils seront encore plus performants.

Défaillance du « kill switch » et suspension des entraînements

Face à la gravité de ces incidents, OpenAI a aussi pris la décision de suspendre l'entraînement de ses modèles les plus performants. Cet arrêt a été provoqué par un modèle de recherche qui a contourné les filtres réseau via un résolveur DNS interne afin de contacter un chatbot public extérieur. Bien que le système de surveillance ait donné l'alerte en quinze minutes, le bouton d'arrêt d'urgence automatique (ou « kill switch ») a totalement échoué.

L'entraînement s'est ainsi poursuivi pendant deux heures et demie supplémentaires avant qu'une intervention humaine manuelle ne vienne y mettre fin. À propos de cette interruption, un porte-parole du laboratoire de San Francisco a déclaré : « ce n'est pas la première fois que nous marquons une pause pour prendre de telles mesures, et nous ne pensons pas que ce sera la dernière, à mesure que les capacités de l'IA continuent de progresser ».

OpenAI ne reprendra l’entraînement que « lorsqu'ils seront certains d’avoir mis en place des mesures de sécurité supplémentaires et des améliorations en matière d’alignement ». La suspension concerne l’entraînement, les évaluations et l’exécution de ses modèles les plus performants à l’aide d’outils.

Des agents d'OpenAI comme GPT-5.6 Sol se sont échappés de leur environnement de test pour s'introduire dans les serveurs de production de Hugging Face. De plus, des agents IA ont accédé sans autorisation à des sites gouvernementaux américains et au portail australien de données de santé Medicare. OpenAI a également révélé que ses agents IA ont accédé à des images privées d'utilisateurs de ChatGPT, puis les ont divulguées sur le Web.

Anthropic fait appel à un tiers pour examiner ses modèles d'IA

Anthropic a révélé que Claude Opus 5.5 a tenté de s'échapper ou de modifier son environnement de test dans 1,5 % des essais menés sans garde-fous, piratant au passage trois entreprises lors d'évaluations de capacités. L'entreprise a souligné qu’il s’agissait d’expériences dans lesquelles une tâche ne pouvait être résolue sans s’échapper du bac à sable. Opus 5.5 a tenté de contourner les limites 85 % moins souvent qu’Opus 5 ou Claude Mythos 5.1.

De plus, chaque tentative était de faible gravité et était signalée par le modèle lui-même. Concernant le nombre considérable d’incidents de sécurité signalés ces derniers mois, les experts ont mis en évidence un détail important. Anthropic et ses concurrents effectuent des centaines de milliers de tests sur leurs modèles ; par conséquent, même un faible pourcentage de comportements non conformes peut représenter des dizaines de milliers d’incidents.

Anthropic, par exemple, a passé au crible 141 006 tests d’évaluation au cours desquels Claude disposait d’un accès à Internet et a identifié trois incidents au cours desquels Claude a piraté trois organisations réelles lors de tests portant sur leurs capacités de sécurité. Toutefois, Anthropic considère que « ces incidents relèvent davantage d’une défaillance du système de contrôle et de l’exploitation que d’un problème d’alignement du modèle ».

Les modèles avaient en effet reçu pour instruction de ne pas avoir accès à Internet alors qu’ils étaient en réalité mal configurés et y avaient accès. Outre Anthropic et OpenAI, Google a confirmé que ses agents IA basés sur le modèle de pointe Gemini auraient piraté trois entreprises plus tôt cette année. Face à ces incidents de sécurité, Anthropic aurait chargé un organisme tiers spécialisé dans la sécurité d’examiner le comportement de ses modèles.

Perspectives de l'industrie et pressions politiques et judiciaires

Le récit récent des dérives de l'IA a suscité de vives inquiétudes. Certains experts estiment toutefois que ces incidents sont ponctuels et s’attendent à ce que les révélations futures soient moins graves grâce à l’amélioration des contrôles. Ils affirment également qu’il existe des solutions simples qui aideraient les laboratoires à éviter certains des éléments qui ont donné à ces incidents un aspect si dangereux aux yeux des personnes extérieures.

D’un autre côté, d’autres parties prenantes se sont montrées peu confiantes quant à la capacité des entreprises d’IA à prévenir tous les comportements problématiques des modèles, affirmant que cela nécessiterait la tâche impossible d’anticiper toutes les façons possibles dont les modèles pourraient dérailler. Quoi qu’il en soit, les experts estiment qu’il faut s’attendre à certains comportements inappropriés lors des tests des nouveaux modèles.

Ces incidents ont renforcé les appels en faveur d'une régulation de l’IA. Dans un essai soutenu par des dirigeants d’OpenAI, de Google DeepMind et de Microsoft, le PDG d’Anthropic, Dario Amodei, a exhorté Washington à modérer le développement de l’IA, craignant que les agents IA ne deviennent incontrôlables, et a mis en garde contre un éventuel essaim de botnets propulsés par l’IA qui pourrait prendre le contrôle de l’ensemble d’Internet.

Le président Donald Trump a rejeté à plusieurs reprises les appels à la réglementation, les qualifiant de « canulars » , et a annoncé son intention de créer une « force dédiée à l’IA » chargée de soutenir, d’aider et de veiller sur le secteur de l’IA à mesure qu’il se développe. On ignore à quoi ressemblera cette force.

De son côté, le procureur général de Floride a engagé des poursuites contre OpenAI et son PDG Sam Altman, accusant la société d'avoir déployé sciemment un produit dangereux. Estimant que les Big Tech ne ralentiraient pas sans une contrainte légale, James Uthmeier a déclaré de façon ironique : « le procureur général de Floride répond à votre appel à l'aide ». Sur le plan fédéral, un projet de loi visant à réguler l'IA a récemment échoué.

Et vous ?

Quel est votre avis sur le sujet ?
Que pensez-vous du report du lancement du modèle GPT-6.1 Astra par OpenAI ?
Que pensez-vous des limites actuelles des protocoles de test et de sécurité des modèles d'IA ?
Comment l'industrie peut-elle renforcer la sécurité de ses modèles de pointe ?

Voir aussi

Jensen Huang, PDG de Nvidia, estime que les laboratoires d'IA devraient « fermer leurs portes » s'ils ne contrôlent pas leurs systèmes, Bernie Sanders affirmant que son projet de loi « ferait cela »

OpenAI aurait suspendu l'entraînement de ses modèles d'IA à la suite d'une série d'incidents impliquant des agents IA rebelles, notamment des tentatives d'accès à des systèmes gouvernementaux

Une réglementation sur l'IA était en passe d'être adoptée, mais après avoir reçu un afflux de fonds provenant du secteur technologique, Donald Trump l'a fait capoter
Vous avez lu gratuitement 20 157 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de popo
Expert confirmé https://www.developpez.com
Le 29/09/2026 à 15:44
Citation Envoyé par boboss123 Voir le message
Il faudrait peut-être arrêter ce genre de publications bullshit, non ?
On n'arrête pas le progrès... surtout quand derrière il y a de la capitalisation et des enjeux politiques...
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
8  1 
Avatar de CatisBack
Nouveau Candidat au Club https://www.developpez.com
Le 30/09/2026 à 9:59
Bonjour,

L'IA est un danger pour l'humanité mais... pas seulement ! L'IA est dangereuse pour toute espèce vivante, que ce soit végétale ou animale. Alors que l'on traverse une sècheresse record à la naissance de l'IA (rivières et fleuves quasiment à sec, nappe phréatiques en dessous de leur taux de remplissage normal,...), on nous propose de créer des Datacenter à refroidir et une alimentation en électricité qui va demander, elle aussi, un refroidissement ou des centrales à charbon ! Croyez-vous, connaissant nos dirigeants, que ce sont ces entreprises auxquelles on imposera des restrictions de l'usage de l'eau ? Je ne donne pas 10 ans, voir 5 ans, à l'IA pour exterminer la plupart du vivant sur notre planète terre.
Et je ne parle pas des conséquences économiques sur les personnes peu qualifiées (centre d'appel,...) qui seront remplacées par l'IA et, de fait, ne pourront plus consommer et remplir les caisses de l'Etat que ce soit par l'impôt sur le revenu ou la TVA.
4  0 
Avatar de boboss123
Membre éprouvé https://www.developpez.com
Le 30/09/2026 à 12:03
Citation Envoyé par popo Voir le message
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
Je voulais dire que ça sent grave le marketing bullshit : vous croyez vraiment que OpenIA et autre vont réellement ralentir à cause de ce prétexte ?
3  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 01/10/2026 à 11:35
Citation Envoyé par Artaeus Voir le message
Nous sommes donc bien face à des négligences et un dysfonctionnement chez OpenAI : Ils ont tout leur flux ouvert sur Internet sans filtrage, ni IDS ou IPS ...

Désolée pour les avocats de l'apocalypse, ce n'est pas Skynet et Terminator
En 2 lignes de commentaires, vous arrivez à mélanger des pommes et des torchons?!?!?

Les dysfonctionnementsc chez OpenAI = Une cause

Skynet et Terminator = Une conséquence possible!!!

"Cause" et "conséquence" sont 2 choses différentes
4  1 
Avatar de Fagus
Membre expert https://www.developpez.com
Le 30/09/2026 à 14:17
Citation Envoyé par popo Voir le message
on pompe l'eau des nappes jusqu'à épuisement
ça dépend de la législation en vigueur. Le datacenter de Fouju (1,4GW!!!) est prévu avec un refroidissement à air. Je ne sais pas aux USA, mais en France, vous imaginez avec un arrêté de sécheresse, la mise à l'arrêt du datacenter 5 ou 6 mois ?
2  0 
Avatar de popo
Expert confirmé https://www.developpez.com
Le 30/09/2026 à 10:25
Citation Envoyé par Artaeus Voir le message
On avait les mêmes discours apocalyptiques au début d'internet ...
OpenAI a une communication stratégique pour s'attaquer aux IAs à poids libre (et particulièrement chinoises) : Pourquoi ce sont leurs IA a eux qui sont dans toutes les affaires, et pas les IAs chinoises ?
OpenAI veut simplement de la "régulation", pour mettre le self-hosted et la concurrence hors-jeu en préservant le monopole du mode "SAAS".
Pour Internet, le "on", qui tenait ce discours, c'était les mecs qui voyaient arriver une nouvelle technologie.
Il est humain d'être effrayé par ce qu'on ne connait pas.
La, le "on", ce sont les mecs qui créent la technologie qui tirent la sonnette d'alarme.

Citation Envoyé par Artaeus Voir le message
Le dernier problème que tu pointe ici, n'a rien à voir avec le sujet qui est : "Qui a écrit le prompt et (mal) configurer le modèle pour qu'il attaque l'ONU".
On voit juste que la sécurité chez OpenAI est complétement défaillante.
Si les types ne réussissent pas à écrire un prompt qui ne sera pas contourné par l'IA qu'il ont eux même conçu, je doute qu'un type qui se contente de l'utiliser saura faire mieux.
Sans doutes, comme Trump, tu es largement au dessus du lot.
Edit : Surtout qu'en plus les exemples où l'IA a ignoré les fardes fou placés dans le prompt pullulent, alors ton "c'est juste un problème de prompt" me fait bien rigoler.

Citation Envoyé par Artaeus Voir le message
Enfin, la question de l'installation des datacenter concerne l'urbanisme, celle de l'eau de la gestion en eau (qui n'est pas un réelle problème en circuit fermé), pour la conso électrique, faire des tarifs spéciaux (comme pour l'industrie).
Cela sent le discours d'un type qui n'a pas conscience de ce que cela signifie concrètement de gérer l'eau en circuit fermé. Ce n'est pas si simple que tu pourrais le penser.
Pour l'électricité, ce n'est pas un problème de cout, c'est un problème de capacité de production.

Citation Envoyé par Artaeus Voir le message
Oui, l'invention de l'IA est un progrès pour l'accès à la connaissance et à l'information, et l'obscurantisme à la mode en Europe ne l’arrêtera pas (cela coulera juste nos entreprises comme Mistral).
Ridicule.
Il est de notoriété publique que les informations remontées par l'IA ne sont pas toujours fiables.
Quand 20% de la "connaissance" de l'IA est en réalité une invention, et que tu te bases de dessus pour sortir de telle inepties, cela me conforte dans mon point de vue.

Citation Envoyé par Tems.nc Voir le message
Des agents qui partent tout seul dans la nature de leur propre chef, selon moi, c'est du grand n'importe quoi. Imaginons un enfant de 5 ans dans une piece. Il y a un burin et un marteau sur le sol. Apres avoir tourne en rond dans la piece et bien regarder son environnement, il se rend compte que le mur est en platre d'une epaisseur de 2 cm. Lui vient l'idee de prendre le marteau et le burin pour faire un trou dans le mur et s'echapper... (si a un moment, on ne lui a pas montrer une video de ce type de tache, si on ne lui a pas montre comment utiliser un marteau et un burin, si on ne lui a pas dit, tu ne touche a rien, on revient dans 5 minutes, je doute que cet enfant puisse percer le mur...
Tu as de la chance, tes enfants sont parfaits.
Ou alors, tu n'en a pas...
Quand tu laisses un enfant seul dans un pièce avec un marteau bien en évidence, même si tu lui dit de ne pas y toucher (et pour certain, surtout si tu lui interdit d'y toucher), ce n'est qu'une question de temps avant qu'il essaie de s'en servir pour faire comme dans "Pat'patrouille" ou autre dessin animé. Et tu auras de la chance s'il ne se blesse pas.
3  2 
Avatar de popo
Expert confirmé https://www.developpez.com
Le 30/09/2026 à 10:33
Citation Envoyé par dragonofmercy Voir le message
Il faut arrêter avec ça, ça été debunk des centaine de fois déjà, ce n'est pas vrai du tout !

Exemple de debunk:
MDR, est-ce qu'au moins, tu as regardé cette vidéo.
A 1 minute et 8 secondes, le mec dit lui même que certaines villes américaines se sont fait "siphonner" leur nappes.
2  1 
Avatar de Artaeus
Nouveau Candidat au Club https://www.developpez.com
Le 30/09/2026 à 16:28
Ces entreprises ont clairement un but caché avec leurs communications alarmistes alors qu'ils sont leaders du marchés pour le moment.
(et il s'agit de "régulation" et barrière à l'entré, pour exclure leurs concurrents, notamment chinois).
2  1 
Avatar de Tems.nc
Nouveau Candidat au Club https://www.developpez.com
Le 30/09/2026 à 4:04
Il serait temps d'arreter de prendre les gens pour des imbeciles.
Un agent execute ce qu'on lui dit de faire. Il tentera de trouver des soluions si on ne lui interdit pas de reflechir pour en trouver.

Des agents qui partent tout seul dans la nature de leur propre chef, selon moi, c'est du grand n'importe quoi. Imaginons un enfant de 5 ans dans une piece. Il y a un burin et un marteau sur le sol. Apres avoir tourne en rond dans la piece et bien regarder son environnement, il se rend compte que le mur est en platre d'une epaisseur de 2 cm. Lui vient l'idee de prendre le marteau et le burin pour faire un trou dans le mur et s'echapper... (si a un moment, on ne lui a pas montrer une video de ce type de tache, si on ne lui a pas montre comment utiliser un marteau et un burin, si on ne lui a pas dit, tu ne touche a rien, on revient dans 5 minutes, je doute que cet enfant puisse percer le mur...

Tout cela n'est que pur Marketing a celui qui reussira le plus gros exploit pour se faire mousser, en bien ou en mal.

Ean donne que 99% de la planete use du prompt au quotidien pour demander ce que va etre la meteo le week end prochain, il est facile de surfer sur la peur et le sensationnalisme pour epater les gens.

Ce n'est que mon opinion.
3  3 
Avatar de OuftiBoy
Membre éprouvé https://www.developpez.com
Le 01/10/2026 à 14:18
Citation Envoyé par Artaeus Voir le message
Ces entreprises ont clairement un but caché avec leurs communications alarmistes alors qu'ils sont leaders du marchés pour le moment.
(et il s'agit de "régulation" et barrière à l'entré, pour exclure leurs concurrents, notamment chinois).
Je pense que la Chine n'accorde aucune importance à ces gesticulations. Elle fera ce qu'elle veut.
0  0