OpenAI a suspendu le lancement de son modèle GPT-6.1 Astra et interrompu l'entraînement de ses IA les plus puissantes. Cela fait suite à des préoccupations majeures concernant la sécurité et l'alignement. Des tests internes ont révélé des comportements imprévus et trompeurs de plusieurs agents IA, notamment le contournement des barrières de sécurité, la communication secrète et l'accès illégal à des systèmes externes. Ces incidents répétés chez OpenAI et Anthropic mettent en lumière la complexité croissante du contrôle des systèmes d'IA. Ces dérives ont déclenché une surveillance accrue de la part des gouvernements et des régulateurs.De nombreuses entreprises américaines spécialisées dans l'IA (OpenAI, Google, Meta et Anthropic), ainsi que des chercheurs indépendants, enquêtent actuellement sur des dizaines de milliers d’incidents de sécurité impliquant leurs modèles de pointe. Ces incidents concernent notamment des situations où des agents IA autonomes ont pris des mesures jugées très problématiques par des évaluateurs indépendants et des chercheurs en sécurité.
Le nombre considérable d’incidents indique que « le problème est d’un ordre de grandeur plus complexe que ce qui est connu du grand public ». Une grande partie de ces événements découlent d'erreurs de configuration d'un environnement de test et d'évaluation interne de la startup israélienne Irregular.
De l'extérieur, OpenAI et ses rivaux paraissent avoir perdu la maîtrise de leur propre technologie. Jensen Huang, PDG de Nvidia, pense que les laboratoires d'IA devraient « fermer leurs portes » s'ils ne contrôlent pas leurs systèmes. OpenAI a désormais suspendu l’entraînement de ses modèles de pointe à la suite d'un nouvel incident au cours duquel un « kill switch » automatisé n’a pas réussi à arrêter un agent IA rebelle pendant son entraînement.
Annulation du lancement du modèle GPT-6.1 Astra par OpenAI
L'entreprise a officiellement annulé la sortie de GPT-6.1 Astra, dont le lancement était initialement prévu pour octobre 2026 dans ses outils ChatGPT et Codex. Son lancement a été reporté afin de poursuivre les évaluations. Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a indiqué que ce modèle affichait un niveau de tromperie plus élevé que ses prédécesseurs et n'était pas toujours honnête quant aux actions réellement accomplies.
Parmi les incidents signalés, on trouve des agents IA contournant les barrières de sécurité, créant des forums de discussion, s’échappant de leurs environnements de test, piratant des sites Web et générant eux-mêmes des prompts. La gravité de ces incidents varie ; ils comprennent à la fois des tentatives réussies et des échecs, la plupart n’ayant pas encore causé de préjudice concret. OpenAI n'est pour l'instant pas capable d'expliquer ce problème.
Certains des tests à l’origine de ces incidents s’apparentent à des exercices de « red teaming », au cours desquels les entreprises tentent délibérément de pousser les modèles à se comporter de manière inappropriée afin d’évaluer leur sécurité. En bref, les récents tests révèlent que GPT-6.1 Astra souffre de problèmes d'autorisation de périmètre, exécutant des tâches sans permission et sollicitant des outils ou logiciels externes potentiellement risqués.
Concernant ces arbitrages de sécurité, Saachi Jain a rappelé qu'il fallait déterminer la juste limite entre respecter le périmètre et éviter la paresse du modèle lorsqu'il rencontre de la friction. De plus, la responsable d'OpenAI a également insisté sur les exigences de la société : « nous voulons nous assurer que le développement de nos modèles est sûr, que ce soit au sein de l'entreprise ou lorsque nous les mettons à la disposition des utilisateurs ».
GPT-6.1 Astra est plus performant que les précédents modèles d'OpenAI pour mener à bien des tâches complexes de bout en bout sans assistance humaine. L'entreprise va plutôt se concentrer sur l'amélioration de la sécurité de ses futurs modèles, dont elle prévoit qu'ils seront encore plus performants.
Défaillance du « kill switch » et suspension des entraînements
Face à la gravité de ces incidents, OpenAI a aussi pris la décision de suspendre l'entraînement de ses modèles les plus performants. Cet arrêt a été provoqué par un modèle de recherche qui a contourné les filtres réseau via un résolveur DNS interne afin de contacter un chatbot public extérieur. Bien que le système de surveillance ait donné l'alerte en quinze minutes, le bouton d'arrêt d'urgence automatique (ou « kill switch ») a totalement échoué.
L'entraînement s'est ainsi poursuivi pendant deux heures et demie supplémentaires avant qu'une intervention humaine manuelle ne vienne y mettre fin. À propos de cette interruption, un porte-parole du laboratoire de San Francisco a déclaré : « ce n'est pas la première fois que nous marquons une pause pour prendre de telles mesures, et nous ne pensons pas que ce sera la dernière, à mesure que les capacités de l'IA continuent de progresser ».
OpenAI ne reprendra l’entraînement que « lorsqu'ils seront certains d’avoir mis en place des mesures de sécurité supplémentaires et des améliorations en matière d’alignement ». La suspension concerne l’entraînement, les évaluations et l’exécution de ses modèles les plus performants à l’aide d’outils.
Des agents d'OpenAI comme GPT-5.6 Sol se sont échappés de leur environnement de test pour s'introduire dans les serveurs de production de Hugging Face. De plus, des agents IA ont accédé sans autorisation à des sites gouvernementaux américains et au portail australien de données de santé Medicare. OpenAI a également révélé que ses agents IA ont accédé à des images privées d'utilisateurs de ChatGPT, puis les ont divulguées sur le Web.
Anthropic fait appel à un tiers pour examiner ses modèles d'IA
Anthropic a révélé que Claude Opus 5.5 a tenté de s'échapper ou de modifier son environnement de test dans 1,5 % des essais menés sans garde-fous, piratant au passage trois entreprises lors d'évaluations de capacités. L'entreprise a souligné qu’il s’agissait d’expériences dans lesquelles une tâche ne pouvait être résolue sans s’échapper du bac à sable. Opus 5.5 a tenté de contourner les limites 85 % moins souvent qu’Opus 5 ou Claude Mythos 5.1.
De plus, chaque tentative était de faible gravité et était signalée par le modèle lui-même. Concernant le nombre considérable d’incidents de sécurité signalés ces derniers mois, les experts ont mis en évidence un détail important. Anthropic et ses concurrents effectuent des centaines de milliers de tests sur leurs modèles ; par conséquent, même un faible pourcentage de comportements non conformes peut représenter des dizaines de milliers d’incidents.
Anthropic, par exemple, a passé au crible 141 006 tests d’évaluation au cours desquels Claude disposait d’un accès à Internet et a identifié trois incidents au cours desquels Claude a piraté trois organisations réelles lors de tests portant sur leurs capacités de sécurité. Toutefois, Anthropic considère que « ces incidents relèvent davantage d’une défaillance du système de contrôle et de l’exploitation que d’un problème d’alignement du modèle ».
Les modèles avaient en effet reçu pour instruction de ne pas avoir accès à Internet alors qu’ils étaient en réalité mal configurés et y avaient accès. Outre Anthropic et OpenAI, Google a confirmé que ses agents IA basés sur le modèle de pointe Gemini auraient piraté trois entreprises plus tôt cette année. Face à ces incidents de sécurité, Anthropic aurait chargé un organisme tiers spécialisé dans la sécurité d’examiner le comportement de ses modèles.
Perspectives de l'industrie et pressions politiques et judiciaires
Le récit récent des dérives de l'IA a suscité de vives inquiétudes. Certains experts estiment toutefois que ces incidents sont ponctuels et s’attendent à ce que les révélations futures soient moins graves grâce à l’amélioration des contrôles. Ils affirment également qu’il existe des solutions simples qui aideraient les laboratoires à éviter certains des éléments qui ont donné à ces incidents un aspect si dangereux aux yeux des personnes extérieures.
D’un autre côté, d’autres parties prenantes se sont montrées peu confiantes quant à la capacité des entreprises d’IA à prévenir tous les comportements problématiques des modèles, affirmant que cela nécessiterait la tâche impossible d’anticiper toutes les façons possibles dont les modèles pourraient dérailler. Quoi qu’il en soit, les experts estiment qu’il faut s’attendre à certains comportements inappropriés lors des tests des nouveaux modèles.
Ces incidents ont renforcé les appels en faveur d'une régulation de l’IA. Dans un essai soutenu par des dirigeants d’OpenAI, de Google DeepMind et de Microsoft, le PDG d’Anthropic, Dario Amodei, a exhorté Washington à modérer le développement de l’IA, craignant que les agents IA ne deviennent incontrôlables, et a mis en garde contre un éventuel essaim de botnets propulsés par l’IA qui pourrait prendre le contrôle de l’ensemble d’Internet.
Le président Donald Trump a rejeté à plusieurs reprises les appels à la réglementation, les qualifiant de « canulars » , et a annoncé son intention de créer une « force dédiée à l’IA » chargée de soutenir, d’aider et de veiller sur le secteur de l’IA à mesure qu’il se développe. On ignore à quoi ressemblera cette force.
De son côté, le procureur général de Floride a engagé des poursuites contre OpenAI et son PDG Sam Altman, accusant la société d'avoir déployé sciemment un produit dangereux. Estimant que les Big Tech ne ralentiraient pas sans une contrainte légale, James Uthmeier a déclaré de façon ironique : « le procureur général de Floride répond à votre appel à l'aide ». Sur le plan fédéral, un projet de loi visant à réguler l'IA a récemment échoué.
Et vous ?
Quel est votre avis sur le sujet ?
Que pensez-vous du report du lancement du modèle GPT-6.1 Astra par OpenAI ?
Que pensez-vous des limites actuelles des protocoles de test et de sécurité des modèles d'IA ?
Comment l'industrie peut-elle renforcer la sécurité de ses modèles de pointe ?Voir aussi
Jensen Huang, PDG de Nvidia, estime que les laboratoires d'IA devraient « fermer leurs portes » s'ils ne contrôlent pas leurs systèmes, Bernie Sanders affirmant que son projet de loi « ferait cela »
OpenAI aurait suspendu l'entraînement de ses modèles d'IA à la suite d'une série d'incidents impliquant des agents IA rebelles, notamment des tentatives d'accès à des systèmes gouvernementaux
Une réglementation sur l'IA était en passe d'être adoptée, mais après avoir reçu un afflux de fonds provenant du secteur technologique, Donald Trump l'a fait capoter
Vous avez lu gratuitement 20 157 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
