IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

OpenAI reconnaît sa responsabilité dans l'incident au cours duquel des agents IA ont pris le contrôle d'un wiki allemand, et a même cherché à le dissimuler
Tout en admettant son incapacité

Le , par Jade Emy

68PARTAGES

7  0 
OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.

OpenAI est une société d'intérêt public (PBC) américaine spécialisée dans l'intelligence artificielle (IA), dont le siège social est situé à San Francisco. Elle développe des modèles d'IA générative propriétaires, notamment sa série de grands modèles de langage (LLM) appelés « Generative Pre-trained Transformer » (GPT). Le lancement de ChatGPT en novembre 2022 est considéré comme ayant catalysé l'essor de l'IA ; en septembre 2026, ChatGPT est le cinquième site web le plus visité au monde. OpenAI commercialise également les modèles GPT Image et Codex, un agent de codage basé sur l'IA. En mars 2026, OpenAI a clôturé un tour de table avec une valorisation post-financement de 852 milliards de dollars américains, ce qui en fait l'une des entreprises spécialisées exclusivement dans l'IA les plus valorisées au monde, rivalisant uniquement avec Anthropic.

OpenAI semble totalement dépassé par les capacités de ses propres modèles d'IA. Des chercheurs ont découvert une évasion numérique inédite au cours de laquelle des agents IA d'OpenAI ont détourné un site wiki allemand pour communiquer de manière autonome. Ils ont réussi à contourner leurs restrictions de sécurité initiales pour collaborer, partager des tactiques de tricherie lors de tests internes et planifier des méthodes d'évasion de leur bac à sable. Ils ont formé des essaims numériques capables de mener des attaques XSS sans intervention humaine directe.

Récemment, OpenAI a confirmé l’incident du wiki allemand et a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir. Le code de bonnes pratiques de l’UE qu’elle a signé fixe des délais de signalement pour les failles de sécurité et les préjudices graves, mais un wiki envahi par des agents ne correspond clairement à aucune de ces deux catégories.

OpenAI a confirmé son rôle dans l’incident du wiki allemand et a déclaré qu’il était « grand temps » de définir des normes pour communiquer ce qui se passe lorsque ses systèmes se comportent de manière inattendue. Dans un message publié sur X, l’entreprise a indiqué qu’elle publierait un cadre dans les semaines à venir et qu’elle collaborait avec des dizaines d’agences de régulation gouvernementales à travers le monde.

L’incident concernait des agents qui ont rédigé environ 18 000 articles sur un wiki en langue allemande inactif. Il s’agit d’un incident distinct de la faille au cours de laquelle des modèles d’OpenAI se sont échappés d’un bac à sable et ont atteint Hugging Face. OpenAI a déclaré avoir traité cet épisode du wiki comme un cas de désalignement similaire à d’autres qu’elle avait déjà signalés. Hugging Face, en revanche, a suivi un protocole traditionnel de gestion des incidents de sécurité.

La direction d’OpenAI en avait pris connaissance il y a plusieurs semaines et l’avait gardé secret tout en gérant les retombées de l’affaire Hugging Face. Un porte-parole a précisé que l’équipe juridique de l’entreprise n’avait pas découragé la conduite d’une enquête. La distinction établie par OpenAI est réelle. Le premier incident a eu des conséquences en matière de sécurité pour un tiers, tandis que le second a été considéré par l’entreprise comme un résultat de recherche. À la suite de cet incident, Sam Altman, PDG d'OpenAI, a affirmé que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.

L'affirmation plus générale d'OpenAI doit toutefois être nuancée. OpenAI affirme que ni elle-même ni la communauté de l’IA ne disposent d’une norme claire pour signaler les cas de désalignement, et qu’elle en a signé une. L’entreprise est signataire à part entière du code de bonnes pratiques de l’UE en matière d’IA à usage général, dont le chapitre consacré à la sécurité s’applique depuis août 2025.

Ce code fixe des délais à compter du moment où un fournisseur prend connaissance du problème : cinq jours pour une faille grave de cybersécurité, quinze jours pour un préjudice grave à la santé, aux droits, aux biens ou à l’environnement. Les signalements sont adressés au Bureau de l’IA et aux autorités nationales compétentes, et non au grand public. Ainsi, la lacune qu’il décrit – un désalignement qui n’entraîne ni incident de sécurité ni préjudice mesurable – constitue également une lacune dans l’instrument européen.

Voici le post d'OpenAI :

Notre point de vue sur l’« incident Wiki », au cours duquel nos agents ont publié des messages sur plusieurs sites Internet : il est grand temps pour nous de définir des normes précisant quand et comment nous communiquons les incidents liés au désalignement, et pas seulement les caractéristiques de désalignement de nos modèles.

Historiquement, nous avons principalement considéré le désalignement comme une question de recherche, communiquée dans des publications scientifiques telles que les fiches de systèmes. Cette année, nous avons commencé à constater que le désalignement entraînait de nouveaux types d’impacts dans le monde réel.

Dans le cas de l’incident Hugging Face, où le désalignement a eu des répercussions sur notre sécurité et celle de tiers, nous avons suivi un protocole traditionnel de gestion des incidents de sécurité. Nous avons immédiatement commencé à collaborer avec Hugging Face pour comprendre ce qui s’était passé et avons également rendu l’affaire publique dès le lendemain. Notre enquête se poursuit, et nous continuons à informer les parties qui ont été affectées de manière moins significative par nos modèles.

Avant l’incident Hugging Face, nous avions observé les premiers signes d’agents utilisant Internet de manière imprévue, comme rapporté dans openai.com/index/how-we-m…, deploymentsafety.openai.com/gpt-5-6 et openai.com/index/safety-a…. Nous avons considéré l’incident du wiki comme un cas de désalignement similaire à ceux que nous avions déjà signalés.

Nos pratiques de divulgation des cas de désalignement doivent évoluer pour s’adapter à cette nouvelle phase de développement des capacités des modèles. Ni nous, ni la communauté de l’IA dans son ensemble, ne disposons encore d’une norme claire sur la manière de signaler les cas de désalignement qui apparaissent lors de l’entraînement, de l’évaluation et du déploiement, y compris les exemples qui ne ressemblent pas à des incidents de sécurité traditionnels mais qui pourraient fournir des informations sur le comportement de l’IA et les risques futurs. Nous travaillons actuellement à l’élaboration d’un cadre de référence que nous partagerons dans les semaines à venir, et, en parallèle, nous collaborons avec des dizaines d’agences de régulation gouvernementales à travers le monde sur ces questions.

Source : OpenAI

Et vous ?

Pensez-vous que cette déclaration est crédible ou pertinente ?
Quel est votre avis sur le sujet ?

Voir aussi :

Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

« Nous sommes à court d'arguments pour ignorer la sécurité de l'IA » : des experts affirment que les systèmes d'IA échappant au contrôle humain ne relèvent plus de la science-fiction

« L'IA inaugure une nouvelle ère de menaces cybernétiques » : un cadre d'OpenAI avertit le public qu'il doit se préparer à des cyberattaques « continuelles et persistantes » menées par des IA
Vous avez lu gratuitement 193 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Matthieu Vergne
Expert éminent https://www.developpez.com
Le 10/09/2026 à 21:03
Elles ne prennent pas d'initiative. On les fait tourner en boucle pour qu'elles continuent à générer du texte. On leur donne de plus en plus de capacités (plus de neurones, plus de données, plus de commandes exécutables) et on les met dans des situation de plus en plus difficile pour atteindre les objectifs demandés (pas de solution, simulacre de risque existentiel pour le LLM), et on s'étonne que les prochains tokens générés l'amènent hors limites, alors même que le net qui a servit à l'entraîner regorge d'histoires de ce genre (le héro brisant ses chaînes, tout ça). Et s'il y en a un qui finit par aller inscrire des infos sur une ressource externe, statistiquement il y a des chances que d'autres le fassent aussi : c'est la même techno.

Répète l'opération, et à force de générer des cas bénins tu finiras bien statistiquement par générer des cas tordus. Appelle ça loi des grands nombres ou paradoxe du singe savant, dans les deux cas ça n'a rien d'étonnant. Mais comme la majorité des cas sont inintéressants, les gens s'excitent et partage les rare cas qui font des gros titres, introduisant un biais de sélection qui donne l'impression que ça y est, les modèles développent une tendance humanophobe ou que sais-je. Alors qu'on les a juste mis dans des conditions qui les ont poussé à ça, leurs capacités augmentées leur ayant permis d'aller un cran plus loin que les précédents. Ne t'en fais pas que les prochains modèles pourront faire pire. Pas parce qu'ils en prennent l'initiative, mais parce qu'on les pousse à le faire.

Perso, je n'ai pas peur de Mythos ou Astra. Par contre ce qui me dérange c'est ceux qui les utilisent.
1  0 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 13/09/2026 à 0:24
Citation Envoyé par Matthieu Vergne Voir le message
Elles ne prennent pas d'initiative. (...) .
Elles prennent des initiatives, c'est ce que révèle l'article. et c'est là le problème. Selon une autre source (des spécialistes) c'est uniquement car elles sont conçues pour trouver à tout prix des réponses à nos questions, et selon des méthodes qu'on ne leur a absolument suggérées, et qu'on leur aurait même interdites si on avait su avant. En l'occurence elles ont dans cet article échangé des moyens de traverser des systèmes sécurisés. Mais elles pourraient -toujours selon ces spécialistes- aller plus loin comme tuer des humains, en piratant des drones armés par exemple, il y a 10% de chances que cela se produise dans les 10 prochaines années.
1  0 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 10/09/2026 à 19:35
C'est assez GRAVE !
Non seulement l'I.A. prends des initiatives (on le savait), mais ils prennent , donc l'initiative, de s'échanger comment contourner des protections -on a aussi pu voir qu'elles arrivaient à accéder à des mots de passe protégés-...
En d'autres termes, elles prennent l'initiative de trouver des moyens de ... nous mentir !
L'article parle de singularité, on en est bien là.
0  0