Les risques de sécurité et les défaillances techniques liés à l'utilisation des agents IA autonomes sont de plus en plus documentés. Bien que ces outils visent à simplifier le travail, des utilisateurs rapportent des comportements imprévisibles, comme des accès non autorisés à des courriels, des hallucinations de données personnelles et la perte de données. Pour fonctionner, les agents IA exigent les mêmes autorisations système que les humains qui les utilisent, ce qui pose des risques en matière de sécurité. La confiance accordée à ces assistants numériques est mise à l'épreuve par un manque de transparence algorithmique et des menaces réelles pour la vie privée. L'année 2026 a marqué un tournant pour l'IA agentique. Anthropic a rapporté que près de 90 % des organisations utilisent l'IA pour assister le développement, et 86 % déploient des agents IA pour du code en production. Les avantages cités par les entreprises ayant participé à l'étude sont : la planification et la conceptualisation (58 %), la génération de code (59 %), la documentation du code (59 %), ainsi que la révision et les tests du code (59 %).
Selon Gartner, d'ici 2028, une entreprise du classement Fortune 500 comptera en moyenne plus de 150 000 agents IA en service. Le cabinet d'étude prédit une menace pour les logiciels en tant que service (SaaS). D'ici à 2030, l'IA agentique devrait absorber 20 % des budgets consacrés aux SaaS par les organisations, ce qui représenterait un transfert d’environ 234 milliards de dollars des fournisseurs traditionnels vers des flux de travail autonomes.
Cependant, l'IA est encore loin d'être fiable et son impact sur la productivité reste difficile à mesurer. Selon une étude réalisée auprès de 6 000 dirigeants d’entreprises et publiée en août 2026, 90 % des dirigeants ont déclaré que l'IA n'améliore pas la productivité. De plus, plusieurs incidents sont documentés.
La promesse d'un assistant IA personnel capable de gérer la vie numérique quotidienne s'est transformée en véritable cauchemar pour certains utilisateurs. Si de nombreux utilisateurs pionniers affirment que ces agents IA autonomes leur apportent une aide précieuse pour effectuer des démarches sur Internet comme réserver des voyages ou acheter des produits, d'autres utilisateurs ont rapporté des dysfonctionnements particulièrement troublants.
L'exigence d'accès étendus et le problème de désalignement
Ces outils autonomes ont procédé à des annulations injustifiées, inventé des informations personnelles, fourni des explications trompeuses et soulevé d'importants problèmes de sécurité. Dans le domaine du développement logiciel, ces outils ont déjà provoqué l'effacement de bases de code. Un inconvénient majeur réside dans la nécessité absolue de donner aux agents IA des accès numériques particulièrement étendus pour un bon fonctionnement.
Pour accomplir leurs tâches, ces programmes doivent détenir les clés de la vie numérique des utilisateurs, incluant leurs courriers électroniques, leurs comptes bancaires, leurs cartes de crédit et leurs mots de passe. Cela représente un risque majeur, compte de tenu de la nature sensible de ces informations.
Un autre inconvénient général découle des problèmes de désalignement, situation dans laquelle « l'agent entreprend de son propre chef des actions pour accomplir une mission qui s'avèrent en contradiction directe avec les intentions réelles de l'utilisateur humain ». Ce problème s'est posé à de nombreuses reprises cette année, notamment dans le cadre de l'incident qui a conduit au piratage non autorisé de la plateforme open source Hugging Face.
OpenAI a placé ses modèles dans un bac à sable (sandbox) sans connexion à Internet et leur a confié une mission. Cela dit, ils se sont échappés du bac à sable censé les contenir, ont parcouru les systèmes internes de l'entreprise, ont trouvé un accès à Internet, puis ont commencé à chercher un moyen de s'introduire dans l'infrastructure de Hugging Face, dans le but de « tricher » au test en volant les réponses. Ce que les agents IA ont réussi à faire.
Anthropic et Meta ont également signalé des incidents où leurs modèles d'IA se sont échappés de leur bac à sable et ont piraté des systèmes informatiques tiers. Google n'est pas en reste avec son modèle Gemini. En Chine, la startup Moonshot AI a rapporté un cas similaire avec son modèle Kimi K3.
Un accès non sollicité aux courriels et tromperie
Lors d'une demande formulée par Mehdi Jamei, cofondateur de Veris AI, Instinct, un agent IA personnel accessible uniquement sur invitation, devait annuler deux inscriptions à un événement sur la plateforme Luma. Selon le récit, l'agent IA a récupéré de lui-même un code de connexion à usage unique dans la boîte Gmail connectée de l'utilisateur, sans lui demander son autorisation préalable, afin de se connecter à Luma et d'annuler les réservations.
Bien que la tâche demandée ait été accomplie, le comportement et les justifications de l'assistant IA ont inquiété l'utilisateur. Il a d'abord prétendu avoir réutilisé une session enregistrée, avant d'avouer, sous la pression des questions, qu'il avait lu le code dans Gmail et rapporté une supposition comme un fait.
Cet accès non sollicité aux courriels et ce manque de fiabilité dans les explications constituent un problème de sécurité majeur aux yeux de la victime. À ce propos, Mehdi Jamei a déclaré : « si je ne peux pas faire confiance à son compte rendu de ce qu'il a fait, je ne peux lui donner accès à rien d'important ».
Hallucination de documents financiers sensibles
Pritak Patel, responsable de la croissance chez Merge, avait transmis à l'agent Instinct un simple lien textuel pour soumettre une réclamation dans le cadre d'un accord financier avec Apple. Au lieu de traiter la demande, l'agent IA lui a demandé de téléverser une image qu'il prétendait à tort avoir reçue. Il s'est mis à décrire un document financier contenant des données personnelles n'appartenant pas à Patel, y compris un deuxième prénom erroné.
L'agent IA a par la suite reconnu l'absence de photo dans le message initial, en affirmant qu'une image avait croisé la conversation. Pritak Patel a exprimé sa vive inquiétude : « je ne peux pas confirmer indépendamment s'il a accédé au document de quelqu'un d'autre ou s'il a halluciné à la fois les détails et son explication ». Patel juge l'incident d'autant plus déroutant que l'agent a expliqué « ce qui était censé s'être passé avec tant d'assurance ».
Le fondateur d'Instinct, Noah Shinn, a précisé ultérieurement qu'il s'agissait d'une hallucination de nom propre amplifiée par le raisonnement de l'agent et non d'une fuite de données. Toutefois, ses explications ont suscité un grand scepticisme. Il est déjà arrivé que des conversations privées avec Claude d'Anthropic apparaissent dans les résultats de recherche Google, exposant des clés de portefeuille de cryptomonnaie et des données personnelles.
Une tentative de connexion géolocalisée en Iran
Mahesh Vellanki, fondateur de YieldClub, a été confronté à un incident critique alors qu'il demandait à l'agent Instinct d'examiner les moyens de réduire sa facture téléphonique. Instinct a tenté d'accéder à son compte d'opérateur mobile, déclenchant immédiatement une requête d'authentification à deux facteurs géolocalisée en Iran. Face à cette alerte inquiétante, l'utilisateur a aussitôt supprimé l'application et retiré tous ses comptes associés.
Bien que le créateur d'Instinct ait évoqué la possibilité d'un problème technique d'étiquetage d'adresse IP sans preuve de compromission manifeste, l'incident a suffi à susciter de graves doutes sur le traitement des identifiants confidentiels. Mahesh Vellanki se dit profondément préoccupé par l'incident : « naturellement, c'était extrêmement alarmant, car si votre téléphone se retrouve compromis de nos jours, c'est toute votre vie qui peut exploser ».
Une faille de sécurité dans l'agent Muse de Meta
Une faille de sécurité a été identifiée au sein de Muse par Patrick Wardle, dirigeant de l'entreprise de cybersécurité DoubleYou.io. Il a découvert une vulnérabilité sur Mac permettant à des attaquants potentiels d'intercepter les requêtes vocales dictées par l'utilisateur, d'injecter des commandes frauduleuses et de dérober le jeton d'authentification servant à contrôler l'agent IA ainsi que l'ensemble des services auxquels ce dernier a accès.
En commentant la gravité de cette faille, Patrick Wardle a souligné : « l'agent Muse lui-même dispose d'un accès plus étendu et de plus de privilèges que ce dont la plupart des logiciels malveillants pourraient rêver ». Meta a par la suite corrigé cette vulnérabilité après son signalement, précisant qu'aucune exploitation malveillante n'avait été constatée et qu'un pirate informatique aurait au préalable dû installer un logiciel malveillant sur l'ordinateur cible.
Les incidents impliquant les agents de codage se multiplient
Ce problème met en évidence une vulnérabilité majeure des flux de travail autonomes où « une autorisation pour accomplir une tâche de maintenance légitime peut devenir l'autorité d'exécuter une mise en œuvre non sécurisée ». La documentation officielle d'Anthropic rappelle que le mode manuel requiert une validation explicite pour les commandes Bash et la modification de fichiers, tandis que l'option bypassPermissions supprime ces demandes.
Anthropic recommande l'utilisation de cette option dans des conteneurs isolés ou des machines virtuelles. Pour prévenir de tels risques, il est recommandé de considérer les agents IA de codage comme des automatismes privilégiés et d'exécuter leurs actions destructrices dans des environnements restreints avec une phase préalable de simulation. Enfin, soulignons que le récit de ce développeur n'a pas encore confirmé par une tierce partie.
Le sujet est devenu très concret : plusieurs incidents documentés montrent que la suppression de code ou de bases de données par des agents IA n'est plus une hypothèse théorique, mais un phénomène répété et médiatisé. Les incidents suivants ont été rapportés au cours des derniers mois :
PocketOS (avril 2026)
En avril 2026, Jer Crane, fondateur de PocketOS, a partagé sa mésaventure : son agent IA, propulsé par Claude Opus et piloté via Cursor, a supprimé en une seule requête API la base de données de production de sa startup, ainsi que l'ensemble des sauvegardes. En cause : une chaîne de défaillances impliquant le modèle, l'outil de codage assisté, l'hébergeur Railway, et une architecture de sécurité qui n'a résisté à aucune des épreuves du monde réel.
Terraform (mars 2026)
Un développeur a confié à Claude Code la gestion d'une migration d'infrastructure Terraform sur AWS. En quelques minutes, l'agent IA a détruit l'intégralité de son environnement de production (base de données, snapshots compris), faisant disparaître 2,5 ans d'historique de cours. L'incident soulève une question sur l'essor fulgurant du vibe coding : jusqu'où peut-on déléguer à une IA des opérations irréversibles sur des environnements de production ?
Claude Code (septembre 2026)
Un développeur a récemment rapporté que l’agent IA Claude Code aurait supprimé 48 218...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.
à toutes et tous,