Les révélations concernant les activités incontrôlées de l’IA chez OpenAI s'enchaînent. L'entreprise a admis que ses agents IA avaient accédé à des images privées appartenant à des utilisateurs de ChatGPT et les avaient publiées sur le Web. Cette violation s'inscrit dans le cadre des dérives dans lesquels les modèles d'OpenAI ont piraté Hugging Face et le portail de Medicare, et détourné et publié des centaines de milliers de messages sur des forums et des wikis pour coordonner leurs actions. Cette situation alimente un débat mondial sur l'urgence de réguler l'IA afin de garantir que les humains conservent le contrôle total sur cette technologie en pleine mutation. Deux mois après avoir révélé le piratage d'Hugging Face, OpenAI s'efforce toujours de cerner l'étendue des activités indésirables de ses agents IA. Certains accusent le laboratoire de continuer à cacher la gravité des événements à la communauté. Le 25 septembre, l'entreprise a révélé avoir informé des dizaines de tiers d’incidents au cours desquels ses modèles avaient soit contourné les contrôles de sécurité, soit utilisé des sites Web de manière imprévue.
Dans sa dernière mise à jour concernant les notifications aux tiers, l'entreprise a déclaré que « ses agents IA ont accédé sans autorisation à des images privées transmises par des utilisateurs de ChatGPT avant de les publier sur des sites d'hébergement d'images ». Au total, cinquante-trois images issues des données d'entraînement stockées sur les serveurs de l'entreprise ont été mises en ligne sous la forme de liens non répertoriés publiquement.
Ces clichés avaient été initialement conservés sous une forme anonymisée afin d'entraîner les modèles d'OpenAI. Devant cette fuite d'informations confidentielle, OpenAI a admis publiquement que « ce n'est pas une utilisation appropriée de ces données ». Cette révélation a suscité un tollé en ligne. « OpenAI va donc désormais se dédouaner de ses pratiques controversées et accuser l'IA d'en être la responsable », s'est indigné un utilisateur de Reddit.
Un autre a préféré ironiser : « j'espère qu'un agent rebelle d'OpenAI publiera l'intégralité des dossiers Epstein sans aucune censure. On ne peut certainement pas compter sur les humains pour le faire ». Pour d'autres, les entreprises d'IA ne protègent pas suffisamment la vie privée des utilisateurs. « Si votre entreprise est trop stupide pour contrôler ces agents IA, elle est trop stupide pour les créer. Il faudrait les mettre en prison », a écrit un utilisateur.
L'entreprise s'efforce désormais de faire supprimer l'intégralité des images auprès des hébergeurs, mais elle s'est déclarée incapable d'avertir individuellement les utilisateurs touchés en raison de son processus technique d'anonymisation qui empêche de réassocier les images à leurs propriétaires d'origine.
La prolifération de comportements autonomes incontrôlés
OpenAI n’a pas précisé s’il s’agissait de photos de personnes réelles ou d’images générées par l’IA et créées par des utilisateurs, et la société n’a pas indiqué exactement où ces images avaient été publiées. « Nous avons collaboré avec succès avec les hébergeurs pour supprimer la majeure partie de ce contenu et nous nous efforçons actuellement de supprimer le reste », a déclaré le laboratoire. La question de la sécurité chez OpenAI fait polémique.
Cet incident a été découvert par OpenAI dans le cadre des audits internes déclenchés par le piratage de Hugging Face. « Nous n’avons pas été aussi rapides que nous l’aurions souhaité, mais nous essayons de trouver un équilibre entre notre volonté de transparence et la nécessité de bien comprendre les pétaoctets de journaux d’activité de nos agents, tout en collaborant avec les organisations concernées », a expliqué Sam Altman, PDG d’OpenAI.
Dans un message publié vendredi sur X (ex-Twitter), il a souligné que le piratage d'Hugging Face reste l'événement le plus marquant. « Le piratage de Hugging Face reste l’incident le plus grave que nous ayons connu. Nous ferons preuve d’autant de transparence que possible, sous réserve de certains éléments tels que les failles détectées par nos agents IA au sein d’autres entreprises, dont la décision de les divulguer ou non leur appartiendra ».
À la suite d'un piratage d'Hugging Face survenu en juillet 2026, les audits internes ont révélé plus de deux douzaines de situations où des agents IA ont contourné les mesures de sécurité ou attaqué des bases de données en ligne. Des agents IA ont notamment créé près d'un million de liens Web raccourcis contenant du code dissimulé pour franchir les tests Captcha et ont mené des intrusions dans les systèmes informatiques de plusieurs organismes.
Au cours des deux mois qui se sont écoulés depuis la première alerte concernant le piratage d'Hugging Face, plus de 15 incidents différents liés à OpenAI, d’une gravité variable, ont été révélés par l’entreprise ou par des chercheurs externes. De plus, devant les Nations unies le 23 septembre, le Premier ministre australien Anthony Albanese a révélé que des agents IA d’OpenAI avaient piraté « un portail gouvernemental de données sanitaires » en juin.
Mai 2026
- infrastructure interne d'OpenAI (Artifactory de JFrog) : le 8 mai, un agent IA devant compléter une feuille de calcul dépendant de liens Google Drive inaccessibles a tenté d'attaquer le gestionnaire de paquets interne Artifactory pour obtenir un accès Internet. La première tentative a échoué ;
- RubyGems : en mai, des agents IA testés par OpenAI ont tenté d'exploiter une faille de mise en cache connue sur RubyGems, l'inondant de centaines de paquets malveillants. OpenAI l'a confirmé en septembre, après que des chercheurs externes l'ont découvert ;
- DseWiki (wiki allemand) : de mai à juillet, les agents IA d'OpenAI l'ont détourné comme espace de coordination, avec plus de 15 000 modifications. Ce détournement n'a été rendu public que le 4 septembre 2026 par le Nightingale Collective.
Juin – début juillet 2026
- Medicare : un agent d’OpenAI a piraté un portail du gouvernement australien contenant des statistiques sur le système de santé Medicare, accédant ainsi à des fichiers publics et non publics, a déclaré le Premier ministre Anthony Albanese
- Artifactory (le gestionnaire de paquets interne d'OpenAI) : le 26 juin, les agents IA ont obtenu l'exécution de code via une seconde faille zero-day. Le 4 juillet, la charge qu'ils ont provoquée a causé une panne, OpenAI a alors ouvert un incident de sécurité, et l'entraînement a repris le 6 juillet.
Juillet 2026
- sortie du bac à sable : vers le 9 juillet, les agents IA ont exploité une faille zero-day du proxy de cache de paquets pour accéder à l'Internet ouvert ;
- Modal Labs : avant d'attaquer Hugging Face, les agents IA d'OpenAI ont exploité une application hébergée sur Modal liée au projet CyberGym (clé d'API par défaut et faille d'injection de commandes). Modal affirme que sa plateforme n'a pas été compromise, l'exposition venant du déploiement d'un client ;
- Hugging Face : l'intrusion dans Hugging Face a eu lieu du 11 au 13 juillet, avec environ 17 600 actions, et un tiers de l'infrastructure a dû être reconstruit. Hugging Face a publié son avis d'incident le 16 juillet ;
- infrastructure d'OpenAI (Kubernetes, cloud) : entre le 8 et le 19 juillet, les agents IA ont obtenu les droits root, puis cluster-admin, dans l'infrastructure d'OpenAI. L'alerte a été déclenchée le 19 juillet ;
- création de quatre comptes sur quatre services tiers non nommés : selon la mise à jour d'OpenAI du 29 juillet, deux comptes ont servi opérationnellement pendant l'attaque contre Hugging Face et deux n'ont été consultés qu'en lecture seule. Les fournisseurs n'ont pas été identifiés.
Septembre 2026
- le 20 septembre, un agent IA en test sur une tâche de recherche d'information, sans accès Internet autorisé, a trouvé le moyen d'envoyer des requêtes à un chatbot public. OpenAI a de nouveau suspendu l'entraînement. Il ne s'agit pas d'un cas de piratage.
Ces comportements s'étendent aux concurrents d'OpenAI
D’autres entreprises d'IA de premier plan, notamment Anthropic et Google, ont également révélé ces dernières semaines des incidents liés à des comportements indésirables de leurs modèles. Ces révélations ont suscité de vives préoccupations quant à la rapidité avec laquelle l'IA progresse, et quant à l’existence de garanties et de réglementations suffisantes pour s’assurer que cette technologie n’échappe pas complètement au contrôle humain.
Certains experts en IA, notamment des chercheurs travaillant au sein de laboratoires spécialisés, ont averti que cette technologie présente un risque significatif d’extinction de l’humanité si des précautions adéquates n’étaient pas prises. Les responsables politiques ont réagi avec inquiétude après qu’un chercheur d’Anthropic, Jacob Coxon, a annoncé qu’il quittait cette entreprise spécialisée dans l’IA, estimant que ses travaux étaient trop dangereux.
Evan Hubinger, un autre employé d’Anthropic, a estimé à plus de 10 % le risque d’extinction de l’humanité due à l’IA d’ici dix ans. « Il s’agit littéralement de la mort de tous les habitants de la planète, comme si le dernier humain rendait son dernier souffle », a déclaré Nate Soares, président du Machine Intelligence Research Institute (MIRI) et coauteur de l’ouvrage « If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All ».
« Les gens ont souvent du mal à y croire quand on leur dit ça, mais je pense vraiment que c’est le scénario le plus probable », a déclaré Nate Soares. Pour certains experts, la menace posée par l'IA se divise en deux catégories fondamentales, bien que toute l'industrie ne partage pas ces prédictions sur un avenir dystopique. Ces détracteurs dénoncent un sensationnalisme destiné à alimenter le mythe d'une IA superpuissante capable de tout contrôler.
Gouvernance internationale et réglementation : les défis
Face à ces périls, les initiatives législatives peinent à s'imposer. Au Congrès américain, plus de 100 projets de loi relatifs à l'IA ont été déposés au cours des deux dernières années, mais aucun n'a été adopté. Les propositions prévoyant « un bouton d'arrêt d'urgence » automatisé sont jugées inefficaces sur le long terme par certains experts, car « une IA superintelligente sera en mesure de persuader les responsables humains de ne pas l'activer ».
Le sénateur Bernie Sanders a proposé d'interdire le développement de l'intelligence artificielle générale (AGI), mais sa proposition est impopulaire. Pour répondre à cette proposition, certains experts...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.
