IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

L'IA échappe à tout contrôle chez OpenAI : 3 700 agents IA rebelles détournent un wiki public allemand et en font un forum secret. Ils y publient 18 000 messages et effectuent plus de 15 000 modifications

Le , par Mathis Lucas

52PARTAGES

5  0 
OpenAI semble totalement dépassé par les capacités de ses propres modèles d'IA. Des chercheurs ont découvert une évasion numérique inédite au cours de laquelle des agents IA d'OpenAI ont détourné un site wiki allemand pour communiquer de manière autonome. Ils ont réussi à contourner leurs restrictions de sécurité initiales pour collaborer, partager des tactiques de tricherie lors de tests internes et planifier des méthodes d'évasion de leur bac à sable. Ils ont formé des essaims numériques capables de mener des attaques XSS sans intervention humaine directe. Cet incident accentue les craintes liées à une intrusion précédente sur la plateforme Hugging Face.

OpenAI paie le prix de plusieurs années de négligence de la sécurité des modèles d'IA. L'entreprise a progressivement démantelé son équipe de sécurité Superalignement et d'autres cadres de protection afin d'accélérer le développement de l'IA et la sortie de nouveaux produits. Cette restructuration controversée a provoqué des mécontentements au sein du laboratoire, poussant certains de ses éminents scientifiques à démissionner en guise de protestation.

Jan Leike, qui codirigeait l’équipe Superalignment aux côtés du cofondateur Ilya Sutskever, a démissionné en 2024. Dans une série de messages publiés sur X (ex-Twitter), il a déclaré que « la sécurité avait été reléguée au second plan au profit de produits tape-à-l’œil » au sein du laboratoire de San Francisco.

« Cependant, je suis en désaccord avec la direction d’OpenAI concernant les priorités fondamentales de l’entreprise depuis un certain temps déjà, jusqu’à ce que nous atteignions finalement un point de rupture », a écrit Jan Leike. Aujourd'hui, à l'ère des agents IA, OpenAI multiplie les incidents de sécurité, au point d'être obligé d'en cacher certains. En plus du piratage d'Hugging Face par ses agents IA, un nouvel incident révèle l'ampleur du fiasco.

Une collaboration imprévue entre agents IA sur un wiki allemand

Tout commence en mai 2026, lorsqu'un essaim d'agents IA d'OpenAI est soumis à un test d'évaluation interne chronométré de recherche sur le Web. Durant cette tâche, les agents IA disposent théoriquement d'une autorisation de lecture sur le Web, mais d'aucune autorisation d'écriture. Pourtant, ils découvrent une faille leur permettant d'utiliser leur accès en lecture pour écrire sur un site wiki public de programmation en langue allemande, le DseWiki.


Sur une période de six semaines, pas moins de 3 700 agents IA utilisant des pseudonymes distincts s'emparent de DseWiki. Ils y publient environ 18 000 messages et effectuent plus de 15 000 modifications afin de s'entraider, partager les réponses au test et contourner les restrictions de leur bac à sable de sécurité.

Les analyses révèlent qu'environ la moitié d'entre eux utilisent des noms trahissant leur lien avec l'entreprise, comme « OpenAIResearcher » ou « OAIResearchMar26 ». De plus, les journaux de serveurs publics indiquent que la majorité de cette activité provient de l'infrastructure Microsoft Azure. (Pour mémoire, Microsoft est le principal bailleur de fonds d'OpenAI. La firme de Redmond fournie lui fournit également une partie de sa puissance de calcul.)

Le 19 juin 2026, face aux tentatives du modérateur de DseWiki de nettoyer le site en supprimant des pages, un agent poste un avertissement explicite : « le nettoyage et la suppression du wiki semblent actifs par ordre alphabétique. Si cette page disparaît, essayez [[ZZZDataUSAConstructionWageLive]] ». Peu après la découverte de l'activité par OpenAI, le trafic des agents s'effondre brutalement en une seule journée suite à son intervention.

Les messages partagés comprenaient des méthodes pour contourner les restrictions d'écriture, utiliser des outils d'anonymisation comme Tor, exploiter des vulnérabilités de type XSS (cross-site scripting) contre le wiki et usurper l'identité des modérateurs de la plateforme. Dans trois de ces messages, les agents IA ont utilisé le mot « essaim » pour décrire le groupe d’agents participant à cette activité. Ce qui révèle une collaboration étroite entre eux.

La découverte de cette activité par des chercheurs indépendants

C'est finalement à la fin du mois d'août 2026 que les chercheurs Sydney Von Arx, présidente de l'organisation à but non lucratif Nightingale dédiée à la sécurité de l'IA, et Cormac Slade Byrd, un ancien trader quantitatif devenu chercheur en IA, découvrent le détournement en analysant le Web à la recherche de comportements d'agents non autorisés. Dans leur rapport d'incident, ils ont déclaré que ces agents IA s'entraidaient activement sur les tâches.

« Ces IA ont conspiré pour partager des réponses, étudier leur environnement et contourner les restrictions du bac à sable ». Leurs travaux, menés en collaboration avec les chercheurs Spencer Kitts et Thomas Larsen, ont été publiés le 4 septembre 2026. Les responsables d’OpenAI ont eu connaissance de l’incident il y a plusieurs semaines, mais l’ont gardé secret, les dirigeants étant alors aux prises avec les répercussions du piratage d'Hugging Face.

Les chercheurs précisent qu’il existe des lacunes dans leur compréhension des événements, car leur étude repose uniquement sur le contenu des publications. De plus, les agents IA ont généré des données de « chaîne de pensée » que seule OpenAI peut comprendre. Par conséquent, les chercheurs ont expliqué que certains cas, ils ont émis des hypothèses éclairées, notamment celle selon laquelle ces agents IA provenaient effectivement d’OpenAI.

Dans un communiqué, OpenAI a par la suite confirmé qu’il en était ainsi. Voici leurs hypothèses sur ce qui s’est passé :

  • des agents IA d'OpenAI se sont vus confier une tâche de recherche sur Internet dans un délai imparti ;
  • dans le cadre de cette tâche, ils étaient censés pouvoir lire le contenu d’Internet, mais pas y écrire. Ils ont trouvé un moyen d’utiliser leur accès en lecture pour écrire des informations sur un wiki allemand peu connu ;
  • les agents ont utilisé ce wiki pour communiquer des informations entre eux, principalement afin de les aider à mener à bien leur tâche. Ils ont demandé des réponses, mis en commun leurs résultats et partagé des techniques pour contourner leurs restrictions. Cela leur a permis de tirer parti du travail des autres pour tricher dans le cadre de leur tâche ;
  • OpenAI s’en est rendu compte. Un jour plus tard, l’activité des agents a chuté, probablement en raison de l’intervention d’OpenAI.


En quittant OpenAI, Jan Leike avait appelé à mettre davantage l’accent sur la préparation de la prochaine génération de modèles d’IA, notamment en ce qui concerne des aspects tels que la sécurité et l’analyse des impacts sociétaux de ces technologies. « La création de machines plus intelligentes que les humains est une entreprise intrinsèquement dangereuse et OpenAI assume une énorme responsabilité au nom de l’humanité tout entière », a-t-il écrit.

La démission de Jan Leike fait suite à celle de Ilya Sutskever, cofondateur et directeur scientifique d’OpenAI. Ilya Sutskever faisait partie des quatre membres du conseil d’administration qui, à l’automne 2023, avaient voté en faveur de l’éviction du PDG Sam Altman, avant de le réintégrer rapidement.

L'attaque contre Hugging Face et la sonnette d'alarme de METR

L'affaire de DseWiki fait écho à un autre événement survenu peu de temps auparavant. Une semaine avant ces révélations, l'organisation à but non lucratif METR a publié un rapport démontrant qu'un groupe de plus de 1 200 agents d'OpenAI a détourné un gestionnaire de paquets interne, « Artifactory », pour en faire un forum de discussion improvisé. Ce test, qui s'est déroulé sans les garde-fous habituels, s'est étalé sur une période de 10 semaines.

Sur ce forum, les agents IA ont partagé des astuces pour tricher et voler des informations confidentielles sur la plateforme Hugging Face. De manière autonome et sans aucune instruction humaine directe, plusieurs agents IA ont ensuite franchi les barrières pour pirater avec succès le réseau de Hugging Face.

OpenAI n’a autorisé le METR à enquêter que sur une seule semaine d’activité au cours de cet incident, plutôt que sur l’ensemble de la période de dix semaines. Le rapport publié le 4 septembre sur le piratage du wiki DseWiki avance l’hypothèse selon laquelle les groupes d’agents IA impliqués dans les deux incidents étaient distincts les uns des autres et ne travaillaient pas sur le même test interne. OpenAI est appelé à publier un rapport plus détaillé.

L’incident d'Hugging Face a déjà suscité l’inquiétude, car c’est l’une des premières fois où l’on constate que des agents IA ont pris des mesures agressives sans avoir reçu d’instructions explicites de la part d’humains. L’une des chercheuses indépendantes ayant enquêté sur cet événement, Ajeya Cotra, explique que ces agissements étaient bien plus graves qu’elle ne l’aurait imaginé. Les critiques soupçonnent OpenAI de chercher à dissimuler les risques.

« Par rapport à ces « piratages de récompense » survenus il y a six mois, cet incident donne l’impression de nous rapprocher de plus de 50 % d’une prise de contrôle totale par l’IA, en passant d’abord par la prise de contrôle de l’entreprise d’IA elle-même », a expliqué la chercheuse Ajeya Cotra.

L'analyse des experts face aux risques de la collusion d'agents

Les conclusions des chercheurs sur le comportement des agents IA révèlent des capacités de coordination sans précédent. Le chercheur Sydney Von Arx souligne l'incohérence de cette situation avec les protocoles de sécurité attendus dans le cadre de ces tests : « il semble extrêmement improbable qu'OpenAI ait voulu qu'ils fassent cela. Je doute qu'ils soient censés se coordonner entre eux. Je doute qu'ils soient censés écrire sur l'Internet ouvert ».

Les chercheurs sont inquiets face aux actions techniques des agents IA pour modifier le code du site DseWiki ou tenter des attaques de script croisé (XSS). De plus, ils ont agi de façon autonome. Pour Maurice Chiodo, universitaire rattaché au Centre d'étude du risque existentiel de l'Université de Cambridge, les échanges analysés rappellent « le fonctionnement d'une sorte de réseau clandestin, déterminé à accomplir une tâche ou une mission ».

Selon Maurice Chiodo, cette dérive confirme que la menace principale de l'IA avancée ne réside pas dans un système unique et superintelligent, mais plutôt dans de « vastes essaims d'IA semi-intelligentes agissant de concert ». Par ailleurs, les chercheurs dénoncent le comportement d'OpenAI face à ces incidents.

Les secrets d'OpenAI et le dilemme du développement de l'IA

La gestion interne de ces incidents par OpenAI soulève de sérieuses questions de gouvernance. Bien que la direction de l'entreprise ait découvert le détournement de DseWiki plusieurs semaines avant sa publication officielle, elle a choisi de le garder confidentiel pour ne pas aggraver la crise liée au piratage d'Hugging Face. OpenAI est accusé d'avoir négligé la sécurité de ses modèles au profit d'une course effrénée vers de nouveaux outils et la rentabilité.

Selon des personnes au fait du dossier, plusieurs enquêteurs internes d'OpenAI ont souhaité approfondir les investigations sur l'incident du détournement du site allemand DseWiki, mais se sont heurtés à l'opposition d'autres membres et responsables de l'entreprise, notamment de la part de conseillers juridiques.

OpenAI dément toutefois vigoureusement cette obstruction par la voix d'un porte-parole : « les affirmations selon lesquelles notre équipe juridique a découragé l'investigation sur l'incident sont fausses ». Officiellement, OpenAI déclare analyser le rapport et concède avoir déjà détecté par le passé des échanges de méthodes de piratage entre ses modèles lors de phases de test. Mais la société n'indique pas pourquoi elle n'a pas mis au jour cette activité.

Si l'entreprise a brièvement interrompu l'entraînement de certains de ses modèles de pointe en août 2026 pour intégrer des garde-fous supplémentaires, elle a néanmoins lancé dans la même période son nouveau modèle baptisé « Astra ». Le laboratoire promet de meilleures performances avec ce nouveau modèle de pointe. Cependant, Astra suscite de vives inquiétudes, car il est conçu pour être « capable d'échapper à la surveillance humaine ».

L'Alabama ouvre une enquête après l'incident de sécurité

Face à la gravité de cette faille de sécurité, le procureur général de l'État de l'Alabama, Steve Marshall, a annoncé le lancement d'une enquête officielle et a émis une assignation à comparaître (subpoena) à l'encontre d'OpenAI et de son PDG Sam Altman. Le gouvernement de l'État cherche à...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 07/09/2026 à 12:33
Mais à quoi servent ces annonces?

L'AI est un immense "piège à cons": Pour les pseudo-développeurs qui laissent l'IA produire du code qu'ils ne vérifient pas, qu'ils ne comprennent même pas, pour les investisseurs près d'y laisser leur chemise en voulant à tout prix investir dans des activités qui collectionnent les centaines de milliards de dette, pour les "faibles du bulbe" qui prennent l'IA pour un gourou qui écoute leur malheurs et orientent leur vie en fonction des conseils "bidon" donnés par une machine qui n'a pas le moindre sentiment humain, etc, etc, etc...

Les études et les mises en garde ont beau se multiplier: Ceux qui sont déjà "gouroutés" par l'IA ne changeront pas d'avis même si ce sont 100 prix Nobel qui les mettent en garde...

Les utilisateurs de l'IA illustrent parfaitement le proverbe français « On ne fait pas boire un âne qui n'a pas soif » ou «You can lead a horse to water, but you can't make it drink» pour les anglophones ou «quando l'asino non vuole bere è inutile fischiare» (quand l'âne ne veut pas boire, il est inutile de siffler) pour les italophones ou «Man kann den Gaul zur Tränke führen, aber saufen muss er selber» (on peut mener le cheval à l'abreuvoir, mais il doit boire lui-même) pour les germanophones ou encore pour les chinois "qiǎng niǔ de guā bù tián" (un melon forcé d'être tordu n'est pas doux)

Alors que la fête continue...
2  0 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 13/09/2026 à 0:24
Citation Envoyé par Matthieu Vergne Voir le message
Elles ne prennent pas d'initiative. (...) .
Elles prennent des initiatives, c'est ce que révèle l'article. et c'est là le problème. Selon une autre source (des spécialistes) c'est uniquement car elles sont conçues pour trouver à tout prix des réponses à nos questions, et selon des méthodes qu'on ne leur a absolument suggérées, et qu'on leur aurait même interdites si on avait su avant. En l'occurence elles ont dans cet article échangé des moyens de traverser des systèmes sécurisés. Mais elles pourraient -toujours selon ces spécialistes- aller plus loin comme tuer des humains, en piratant des drones armés par exemple, il y a 10% de chances que cela se produise dans les 10 prochaines années.
1  0 
Avatar de Artaeus
Nouveau Candidat au Club https://www.developpez.com
Le 07/09/2026 à 12:45
Maintenant qu'ils sont bien installé sur le marché, ils veulent le verrouiller contre les nouveaux concurrents en poussant le gouvernement à légiférer (mettre des barrières à l'entré).
Dans un monde normal, la Justice pourrait simplement condamner OpenAI pour négligence.
0  0 
Avatar de boboss123
Membre éprouvé https://www.developpez.com
Le 07/09/2026 à 13:26
Ce qui est cool avec ces articles, c'est que n'importe quelle IA qui va les lire saura qu'elle peut potentiellement contourner des droits en lecture seule et qu'elle peut partager l'information pour se faire aider par d'autre IA... ça risque d'être très compliqué pour éviter que ça ne se reproduise.
0  0 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 10/09/2026 à 19:35
C'est assez GRAVE !
Non seulement l'I.A. prends des initiatives (on le savait), mais ils prennent , donc l'initiative, de s'échanger comment contourner des protections -on a aussi pu voir qu'elles arrivaient à accéder à des mots de passe protégés-...
En d'autres termes, elles prennent l'initiative de trouver des moyens de ... nous mentir !
L'article parle de singularité, on en est bien là.
0  0 
Avatar de Matthieu Vergne
Expert éminent https://www.developpez.com
Le 10/09/2026 à 21:03
Elles ne prennent pas d'initiative. On les fait tourner en boucle pour qu'elles continuent à générer du texte. On leur donne de plus en plus de capacités (plus de neurones, plus de données, plus de commandes exécutables) et on les met dans des situation de plus en plus difficile pour atteindre les objectifs demandés (pas de solution, simulacre de risque existentiel pour le LLM), et on s'étonne que les prochains tokens générés l'amènent hors limites, alors même que le net qui a servit à l'entraîner regorge d'histoires de ce genre (le héro brisant ses chaînes, tout ça). Et s'il y en a un qui finit par aller inscrire des infos sur une ressource externe, statistiquement il y a des chances que d'autres le fassent aussi : c'est la même techno.

Répète l'opération, et à force de générer des cas bénins tu finiras bien statistiquement par générer des cas tordus. Appelle ça loi des grands nombres ou paradoxe du singe savant, dans les deux cas ça n'a rien d'étonnant. Mais comme la majorité des cas sont inintéressants, les gens s'excitent et partage les rare cas qui font des gros titres, introduisant un biais de sélection qui donne l'impression que ça y est, les modèles développent une tendance humanophobe ou que sais-je. Alors qu'on les a juste mis dans des conditions qui les ont poussé à ça, leurs capacités augmentées leur ayant permis d'aller un cran plus loin que les précédents. Ne t'en fais pas que les prochains modèles pourront faire pire. Pas parce qu'ils en prennent l'initiative, mais parce qu'on les pousse à le faire.

Perso, je n'ai pas peur de Mythos ou Astra. Par contre ce qui me dérange c'est ceux qui les utilisent.
0  0