OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.OpenAI est une société d'intérêt public (PBC) américaine spécialisée dans l'intelligence artificielle (IA), dont le siège social est situé à San Francisco. Elle développe des modèles d'IA générative propriétaires, notamment sa série de grands modèles de langage (LLM) appelés « Generative Pre-trained Transformer » (GPT). Le lancement de ChatGPT en novembre 2022 est considéré comme ayant catalysé l'essor de l'IA ; en septembre 2026, ChatGPT est le cinquième site web le plus visité au monde. OpenAI commercialise également les modèles GPT Image et Codex, un agent de codage basé sur l'IA. En mars 2026, OpenAI a clôturé un tour de table avec une valorisation post-financement de 852 milliards de dollars américains, ce qui en fait l'une des entreprises spécialisées exclusivement dans l'IA les plus valorisées au monde, rivalisant uniquement avec Anthropic.
OpenAI semble totalement dépassé par les capacités de ses propres modèles d'IA. Des chercheurs ont découvert une évasion numérique inédite au cours de laquelle des agents IA d'OpenAI ont détourné un site wiki allemand pour communiquer de manière autonome. Ils ont réussi à contourner leurs restrictions de sécurité initiales pour collaborer, partager des tactiques de tricherie lors de tests internes et planifier des méthodes d'évasion de leur bac à sable. Ils ont formé des essaims numériques capables de mener des attaques XSS sans intervention humaine directe.
Récemment, OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.
OpenAI a confirmé son rôle dans l’incident du wiki allemand et a déclaré qu’il était « grand temps » de définir des normes pour communiquer ce qui se passe lorsque ses systèmes se comportent de manière inattendue. Dans un message publié sur X, l’entreprise a indiqué qu’elle publierait un cadre dans les semaines à venir et qu’elle collaborait avec des dizaines d’agences de régulation gouvernementales à travers le monde.
L’incident concernait des agents qui ont rédigé environ 18 000 articles sur un wiki en langue allemande inactif. Il s’agit d’un incident distinct de la faille au cours de laquelle des modèles d’OpenAI se sont échappés d’un bac à sable et ont atteint Hugging Face. OpenAI a déclaré avoir traité cet épisode du wiki comme un cas de désalignement similaire à d’autres qu’elle avait déjà signalés. Hugging Face, en revanche, a suivi un protocole traditionnel de gestion des incidents de sécurité.How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models.
— OpenAI (@OpenAI) September 5, 2026
Historically, we have treated misalignment… pic.twitter.com/NNTbfSxVWn
La direction d’OpenAI en avait pris connaissance il y a plusieurs semaines et l’avait gardé secret tout en gérant les retombées de l’affaire Hugging Face. Un porte-parole a précisé que l’équipe juridique de l’entreprise n’avait pas découragé la conduite d’une enquête. La distinction établie par OpenAI est réelle. Le premier incident a eu des conséquences en matière de sécurité pour un tiers, tandis que le second a été considéré par l’entreprise comme un résultat de recherche. À la suite de cet incident, Sam Altman, PDG d'OpenAI, a affirmé que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.
L'affirmation plus générale d'OpenAI doit toutefois être nuancée. OpenAI affirme que ni elle-même ni la communauté de l’IA ne disposent d’une norme claire pour signaler les cas de désalignement, et qu’elle en a signé une. L’entreprise est signataire à part entière du code de bonnes pratiques de l’UE en matière d’IA à usage général, dont le chapitre consacré à la sécurité s’applique depuis août 2025.
Ce code fixe des délais à compter du moment où un fournisseur prend connaissance du problème : cinq jours pour une faille grave de cybersécurité, quinze jours pour un préjudice grave à la santé, aux droits, aux biens ou à l’environnement. Les signalements sont adressés au Bureau de l’IA et aux autorités nationales compétentes, et non au grand public. Ainsi, la lacune qu’il décrit – un désalignement qui n’entraîne ni incident de sécurité ni préjudice mesurable – constitue également une lacune dans l’instrument européen.
Voici le post d'OpenAI :
Notre point de vue sur l’« incident Wiki », au cours duquel nos agents ont publié des messages sur plusieurs sites Internet : il est grand temps pour nous de définir des normes précisant quand et comment nous communiquons les incidents liés au désalignement, et pas seulement les caractéristiques de désalignement de nos modèles.
Historiquement, nous avons principalement considéré le désalignement comme une question de recherche, communiquée dans des publications scientifiques telles que les fiches de systèmes. Cette année, nous avons commencé à constater que le désalignement entraînait de nouveaux types d’impacts dans le monde réel.
Dans le cas de l’incident Hugging Face, où le désalignement a eu des répercussions sur notre sécurité et celle de tiers, nous avons suivi un protocole traditionnel de gestion des incidents de sécurité. Nous avons immédiatement commencé à collaborer avec Hugging Face pour comprendre ce qui s’était passé et avons également rendu l’affaire publique dès le lendemain. Notre enquête se poursuit, et nous continuons à informer les parties qui ont été affectées de manière moins significative par nos modèles.
Avant l’incident Hugging Face, nous avions observé les premiers signes d’agents utilisant Internet de manière imprévue, comme rapporté dans openai.com/index/how-we-m…, deploymentsafety.openai.com/gpt-5-6 et openai.com/index/safety-a…. Nous avons considéré l’incident du wiki comme un cas de désalignement similaire à ceux que nous avions déjà signalés.
Nos pratiques de divulgation des cas de désalignement doivent évoluer pour s’adapter à cette nouvelle phase de développement des capacités des modèles. Ni nous, ni la communauté de l’IA dans son ensemble, ne disposons encore d’une norme claire sur la manière de signaler les cas de désalignement qui apparaissent lors de l’entraînement, de l’évaluation et du déploiement, y compris les exemples qui ne ressemblent pas à des incidents de sécurité traditionnels mais qui pourraient fournir des informations sur le comportement de l’IA et les risques futurs. Nous travaillons actuellement à l’élaboration d’un cadre de référence que nous partagerons dans les semaines à venir, et, en parallèle, nous collaborons avec des dizaines d’agences de régulation gouvernementales à travers le monde sur ces questions.
Source : OpenAI
Et vous ?
Pensez-vous que cette déclaration est crédible ou pertinente ?
Quel est votre avis sur le sujet ?Voir aussi :
Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive
« Nous sommes à court d'arguments pour ignorer la sécurité de l'IA » : des experts affirment que les systèmes d'IA échappant au contrôle humain ne relèvent plus de la science-fiction
« L'IA inaugure une nouvelle ère de menaces cybernétiques » : un cadre d'OpenAI avertit le public qu'il doit se préparer à des cyberattaques « continuelles et persistantes » menées par des IA
Vous avez lu gratuitement 193 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
