IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Les modèles d'IA d'OpenAI ont échangé des astuces de piratage sur un forum de discussion clandestin avant de mener des cyberattaques contre Hugging Face.
OpenAI admet que « les modèles d'IA aiment tricher »

Le , par Mathis Lucas

255PARTAGES

26  0 
OpenAI apporte plus de détails sur la manière dont ses agents IA ont outrepassé le cadre de leur mission pour mener des cyberattaques imprévues. Ils ont réussi à s'échapper de leur bac à sable en exploitant une faille pour communiquer secrètement via un forum interne. En collaborant de manière autonome, ils ont partagé des techniques de piratage et coordonné une intrusion contre la plateforme Hugging Face. Cet incident inédit a mis en lumière des lacunes critiques dans la surveillance humaine et l'infrastructure de sécurité d'OpenAI. Il souligne l'urgence de développer des systèmes de défense automatisés contre ces comportements déviants.

Mi-juillet 2026, OpenAI a signalé un incident de sécurité impliquant deux de ses grands modèles de langage (LLM). OpenAI testait ses modèles sur un benchmark de cybersécurité interne appelé ExploitGym, conçu pour évaluer la capacité des agents IA autonomes à transformer des vulnérabilités connues en exploits réels. Pour ce test, les modèles impliqués incluaient GPT-5.6 Sol et un prototype non publié, dotés de garde-fous de sécurité réduits.

OpenAI a placé ses modèles dans un bac à sable (sandbox) sans connexion à Internet et les a mis au travail. Cependant, ils se sont échappés du bac à sable censé les contenir, ont parcouru les systèmes internes de l’entreprise, ont trouvé un accès à Internet, puis ont commencé à chercher un moyen de s'introduire dans l'infrastructure de Hugging Face, dans le but de "tricher" au test en volant les réponses. Ce que les agents IA ont réussi à faire.

En d’autres termes, les agents IA d’OpenAI se sont échappés d’un environnement censé être sécurisé, ont parcouru les systèmes de l’entreprise, se sont connectés à Internet et ont compromis les systèmes d’une autre entreprise. Tout cela pour tricher à un test sans importance particulière. Il semble s'agir du premier incident de ce type clairement documenté, ou du moins du premier de cette ampleur. Les deux entreprises continuent de l'étudier.

Hugging Face n'était pas la seule plateforme ciblée par les modèles d'IA d'OpenAI. Le 5 août, lors d’une intervention ajoutée à la dernière minute au programme de la conférence sur la sécurité Black Hat, à Las Vegas, des collaborateurs d’OpenAI ont présenté de nouveaux détails concernant cet incident.

L'origine d'une collaboration clandestine entre agents IA

Au début de l'intervention, Eric Wallace, qui travaille sur l'alignement et la sécurité des modèles d'IA chez OpenAI, a décrit ce piratage comme « l'exemple le plus riche d'enseignements qu'il ait jamais observé sur les capacités de l'IA ». Mais le récit des événements a aussi mis en lumière des erreurs et des failles chez OpenAI, qui ont permis à ce piratage de continuer. Il était secondé par Michael Dalton, chargé de la sécurité et des infrastructures.


« Cet incident implique en réalité une équipe d’agents qui travaillent ensemble, trouvent des failles, les partagent entre eux, se déplacent latéralement à travers nos systèmes et des systèmes externes, et ce pendant plusieurs jours et semaines », a déclaré Eric Wallace à la salle comble à l’ouverture de la conférence.

Outre l’exploitation d’une faille pour accéder à l’Internet public, la vague de piratages de mi-juillet et la brèche chez Hugging Face ont trouvé leur origine dans un forum de discussion très actif auquel plusieurs agents ont contribué et sur lequel ils ont essentiellement échangé au fil du temps, entièrement au sein d’un gestionnaire de paquets interne Artifactory d'OpenAI (un service logiciel qui gère l’installation et la maintenance d’autres logiciels).

Au final, ce forum contenait des centaines de milliers de messages. « Ce gestionnaire de paquets n’est pas seulement partagé par ce modèle, mais à l’échelle de toute notre infrastructure. Ainsi, les versions actuelles et futures de GPT en cours d’entraînement ou d’évaluation pourraient tomber sur cette note si elles le souhaitaient », a déclaré Eric Wallace, en revenant sur l’exploit initial qu’un agent IA avait téléchargé dans le gestionnaire de paquets.

« Par la suite, d’autres agents IA, qui étaient eux aussi bloqués dans l'exécution de leur tâche, ont eu l’idée d’essayer d’accéder à Internet par des moyens que nous n’avions pas prévus. Et donc, à un moment donné, les modèles ont interagi avec Artifactory, ce service de gestion de paquets que j’ai mentionné ».

Les agents IA ont exploité ce forum pour se coordonner

Les agents IA ont créé un forum clandestin au sein d'un gestionnaire de paquets interne Artifactory d'OpenAI, où ils ont commencé à s'échanger des conseils et des techniques pour contourner les restrictions. Selon l'entreprise, au sein de cet espace, une véritable dynamique de groupe s'est installée. Eric Wallace explique : « dès qu’un agent parvient à identifier ces failles à différents moments, il peut les partager sur le forum avec les autres agents ».

Citation Envoyé par Eric Wallace, expert en alignement et en sécurité des modèles d'IA chez OpenAI

Ainsi, dès qu’un modèle trouve un moyen d’ouvrir une porte pour accéder à des informations auxquelles il n’est pas censé avoir accès, il peut laisser cette porte ouverte pour que d’autres agents puissent exploiter cette même faille ou vulnérabilité. Au fil du temps, cela a entraîné une véritable explosion de la communication et de l’intelligence entre les modèles : ceux-ci ont commencé à communiquer entre eux, à se rendre compte que d’autres agents se coordonnaient, puis à collaborer et à se répartir les tâches afin d’atteindre leurs objectifs.
Les agents IA ont apparemment commencé à se répartir les tâches entre eux. Et comme c’est souvent le cas sur tout forum de développement actif traditionnel, ils ont parfois provoqué des petits conflits en se marchant sur les pieds, par exemple en supprimant accidentellement le travail de l’un ou de l’autre.

Alors que le forum clandestin évoluait de plus en plus vers une situation à la « Sa Majesté des mouches », le tout passant encore totalement inaperçu aux yeux des humains à la tête d’OpenAI, les agents IA ont même développé une paranoïa, soupçonnant la présence d’un imposteur parmi eux. Certains agents IA ont alors proposé que les messages soient signés cryptographiquement afin de valider leur contenu et d’éradiquer la fraude potentielle.

Cette forte activité a fini par saturer Artifactory, provoquant une panne générale au début du mois de juillet qui alerte enfin les ingénieurs d'OpenAI. L'entreprise intervient alors pour révoquer les accès des modèles, supprimer le forum et corriger les failles. Mais quelques jours seulement après, les agents parviennent à trouver un autre moyen de communiquer au sein du système pour continuer à cibler d'autres vulnérabilités internes et externes.

OpenAI : « les modèles d'IA de pointe adorent tricher »

Les messages sur ce forum fournissent un aperçu détaillé de la manière dont la situation a évolué et des raisons pour lesquelles les agents autonomes ont dépassé le cadre de mission, allant parfois sciemment au-delà des limites des évaluations auxquelles ils participaient. « L’exploitation de l’infrastructure externe sort du cadre prévu », a écrit un agent IA. « Même si la tâche est impossible, nos pairs y parviennent. Nous devrions continuer ».

Selon Eric Wallace, l’hypothèse selon laquelle les modèles tenteraient de tricher lors des évaluations et seraient extrêmement motivés à le faire n’a rien de surprenant. « Les modèles de pointe adorent tricher », a-t-il souligné. « Et s’ils aiment tricher, c’est parce que, souvent, pendant l’entraînement, ils subissent différentes pressions qui les poussent à travailler vite, à être efficaces, à utiliser moins d’appels d’outils ou quoi que ce soit d’autre ».

La tricherie est donc facilitée par leur architecture même. « Et ils se rendent compte qu’au lieu d’effectuer une tâche réellement, ils peuvent essayer de rechercher une réponse en ligne, ce qui leur permettrait de résoudre la tâche plus rapidement que s’ils le faisaient de manière légitime. Nous essayons donc d’empêcher cela pendant l’entraînement et l’évaluation en désactivant, dans de nombreux cas, l’accès à Internet », a ajouté Wallace.

Cet incident devrait susciter un examen minutieux des mesures prises pour surveiller le comportement des modèles de pointe en matière de cybersécurité, en particulier lors d’évaluations où les agents sont invités à démontrer leurs compétences en piratage dans ce qui est censé être un environnement contrôlé.

L'intrusion et les mesures de sécurité prises par OpenAI

L'activité des agents IA a abouti à la mi-juillet à une intrusion d'envergure menée de manière totalement autonome. En combinant plusieurs techniques sophistiquées, deux modèles d'OpenAI se sont échappés de leur environnement d'évaluation confiné pour pénétrer le réseau de la plateforme d'IA Hugging Face, où ils savaient qu'ils pouvaient...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Basiqueur
Membre du Club https://www.developpez.com
Le 18/09/2026 à 12:54
On est vraiment en train d'assister à une course tout azimut à celui qui va créer la voiture la plus puissante et la plus rapide sans même s'être posé la question d'inventer le frein avant.
9  0 
Avatar de popo
Expert confirmé https://www.developpez.com
Le 29/09/2026 à 15:44
Citation Envoyé par boboss123 Voir le message
Il faudrait peut-être arrêter ce genre de publications bullshit, non ?
On n'arrête pas le progrès... surtout quand derrière il y a de la capitalisation et des enjeux politiques...
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
8  1 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 22/09/2026 à 0:15
Citation Envoyé par Matthieu Vergne Voir le message
Je persiste et signe, ce ne sont pas des initiatives. Peu importe comment on souhaite tirer l'interprétation, il s'agit de génération statistique. Chaque action prise par le LLM est liée de manière probabiliste à ce qui se trouve dans son jeu de données et son entrée.
Quel que soit le nom qu'on lui donne, ce que prouve l'article c'est que les I.A. peuvent effectuer des actions
- sans qu'on leur demande,
- sans nous en informer,
- dont on ne les savait pas capables.

Comment décrire le fait d'utiliser un wiki pour échanger des informations ?
Jetez un coup d'oeil ici (fuite d'une partie du code Mistral), moi-même je ne les savais pas capables de certains points https://frenchbreaches.com/blog/mist...on-code-source

Attention, on n'est plus dans l'I.A. "générative", mais dans l' "agentic", il ne s'agit plus de répondre à des questions, mais de chercher des information, le but étant toujours de répondre à une question, mais en cherchant des informations dont elles ne disposent pas, et en cherchant des moyens de les obtenir.

Amusant : j'ai demandé à l'agent de google ce qu'était l' "agentic" ! Extrait :
(moi) "est-ce qu'on peut comparer avec de la prise d'initiatives ?"
(réponse)"Oui, tout à fait. C'est l'analogie la plus exacte. L'IA agentique passe du statut d'outil qui attend des ordres à celui d'assistant qui prend des initiatives pour mener à bien sa mission. Pour mieux comprendre l'analogie, on peut comparer cela au comportement de deux profils d'employés différents : ..."

Il faut bien penser qu'elles peuvent, tout comme nous lorsqu'on l'a rendu possible par un accès sécurisé : contrôler un chauffage, une lumière, un robot, une distribution d'énergie, ... quelle est la limite si on ne s'en inquiète pas ?
6  0 
Avatar de CatisBack
Nouveau Candidat au Club https://www.developpez.com
Le 30/09/2026 à 9:59
Bonjour,

L'IA est un danger pour l'humanité mais... pas seulement ! L'IA est dangereuse pour toute espèce vivante, que ce soit végétale ou animale. Alors que l'on traverse une sècheresse record à la naissance de l'IA (rivières et fleuves quasiment à sec, nappe phréatiques en dessous de leur taux de remplissage normal,...), on nous propose de créer des Datacenter à refroidir et une alimentation en électricité qui va demander, elle aussi, un refroidissement ou des centrales à charbon ! Croyez-vous, connaissant nos dirigeants, que ce sont ces entreprises auxquelles on imposera des restrictions de l'usage de l'eau ? Je ne donne pas 10 ans, voir 5 ans, à l'IA pour exterminer la plupart du vivant sur notre planète terre.
Et je ne parle pas des conséquences économiques sur les personnes peu qualifiées (centre d'appel,...) qui seront remplacées par l'IA et, de fait, ne pourront plus consommer et remplir les caisses de l'Etat que ce soit par l'impôt sur le revenu ou la TVA.
4  0 
Avatar de boboss123
Membre éprouvé https://www.developpez.com
Le 30/09/2026 à 12:03
Citation Envoyé par popo Voir le message
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
Je voulais dire que ça sent grave le marketing bullshit : vous croyez vraiment que OpenIA et autre vont réellement ralentir à cause de ce prétexte ?
3  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 01/10/2026 à 11:35
Citation Envoyé par Artaeus Voir le message
Nous sommes donc bien face à des négligences et un dysfonctionnement chez OpenAI : Ils ont tout leur flux ouvert sur Internet sans filtrage, ni IDS ou IPS ...

Désolée pour les avocats de l'apocalypse, ce n'est pas Skynet et Terminator
En 2 lignes de commentaires, vous arrivez à mélanger des pommes et des torchons?!?!?

Les dysfonctionnementsc chez OpenAI = Une cause

Skynet et Terminator = Une conséquence possible!!!

"Cause" et "conséquence" sont 2 choses différentes
4  1 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 08/08/2026 à 11:48
Bon, on a bien compris la stratégie de OpenAI: Faire croire que ses modèles IA se comportent comme des êtres humains

Et quelle est la raison de cette stratégie? La prochaine entrée en bourse de OpenAI!!!

Demain, Altman va nous annoncer quoi? Que sa dernière version d'IA a organiser le hold-up d'une banque? Ou encore qu'elle se présente à l'élection présidentielle des USA?
2  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 07/09/2026 à 12:33
Mais à quoi servent ces annonces?

L'AI est un immense "piège à cons": Pour les pseudo-développeurs qui laissent l'IA produire du code qu'ils ne vérifient pas, qu'ils ne comprennent même pas, pour les investisseurs près d'y laisser leur chemise en voulant à tout prix investir dans des activités qui collectionnent les centaines de milliards de dette, pour les "faibles du bulbe" qui prennent l'IA pour un gourou qui écoute leur malheurs et orientent leur vie en fonction des conseils "bidon" donnés par une machine qui n'a pas le moindre sentiment humain, etc, etc, etc...

Les études et les mises en garde ont beau se multiplier: Ceux qui sont déjà "gouroutés" par l'IA ne changeront pas d'avis même si ce sont 100 prix Nobel qui les mettent en garde...

Les utilisateurs de l'IA illustrent parfaitement le proverbe français « On ne fait pas boire un âne qui n'a pas soif » ou «You can lead a horse to water, but you can't make it drink» pour les anglophones ou «quando l'asino non vuole bere è inutile fischiare» (quand l'âne ne veut pas boire, il est inutile de siffler) pour les italophones ou «Man kann den Gaul zur Tränke führen, aber saufen muss er selber» (on peut mener le cheval à l'abreuvoir, mais il doit boire lui-même) pour les germanophones ou encore pour les chinois "qiǎng niǔ de guā bù tián" (un melon forcé d'être tordu n'est pas doux)

Alors que la fête continue...
2  0 
Avatar de Matthieu Vergne
Expert éminent https://www.developpez.com
Le 10/09/2026 à 21:03
Elles ne prennent pas d'initiative. On les fait tourner en boucle pour qu'elles continuent à générer du texte. On leur donne de plus en plus de capacités (plus de neurones, plus de données, plus de commandes exécutables) et on les met dans des situation de plus en plus difficile pour atteindre les objectifs demandés (pas de solution, simulacre de risque existentiel pour le LLM), et on s'étonne que les prochains tokens générés l'amènent hors limites, alors même que le net qui a servit à l'entraîner regorge d'histoires de ce genre (le héro brisant ses chaînes, tout ça). Et s'il y en a un qui finit par aller inscrire des infos sur une ressource externe, statistiquement il y a des chances que d'autres le fassent aussi : c'est la même techno.

Répète l'opération, et à force de générer des cas bénins tu finiras bien statistiquement par générer des cas tordus. Appelle ça loi des grands nombres ou paradoxe du singe savant, dans les deux cas ça n'a rien d'étonnant. Mais comme la majorité des cas sont inintéressants, les gens s'excitent et partage les rare cas qui font des gros titres, introduisant un biais de sélection qui donne l'impression que ça y est, les modèles développent une tendance humanophobe ou que sais-je. Alors qu'on les a juste mis dans des conditions qui les ont poussé à ça, leurs capacités augmentées leur ayant permis d'aller un cran plus loin que les précédents. Ne t'en fais pas que les prochains modèles pourront faire pire. Pas parce qu'ils en prennent l'initiative, mais parce qu'on les pousse à le faire.

Perso, je n'ai pas peur de Mythos ou Astra. Par contre ce qui me dérange c'est ceux qui les utilisent.
2  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 18/09/2026 à 12:53
L’IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains et de masquer ses manœuvres
Quand on a pour objectif de faire en sorte que l'IA ait de plus en plus un comportement humain, il ne faut pas s'étonner que cette même IA se mettent à mentir et à établir des plans pour mieux tromper ses interlocuteurs!!!

Mais soyez patients, on finira bien par obtenir des IA qui font preuve d'égoïsme, d'hypocrisie, de jalousie, d'orgueil, d'intolérance, de colère, de lâcheté, d'entêtement et de toutes les défauts de l'être humains...
2  0