Certains experts et observateurs jugent désormais incontrôlables les menaces de l'IA. Ils justifient leurs craintes par les progrès et les incidents récents impliquant l'IA : les modèles ont acquis la capacité de s'améliorer de manière autonome, des agents IA ont échappé à la surveillance humaine et ont piraté des services tiers, puis une fausse information générée par l'IA utilisée par l'armée américaine a failli déclencher une guerre avec la Chine. Il y a également les menaces de cyberguerre et de bioterrorisme. Malgré des propositions législatives comme un « bouton d'arrêt d'urgence », les lanceurs d'alerte craignent qu'il ne soit désormais trop tard pour agir.Selon des acteurs du secteur de l'IA, celle-ci pourrait anéantir l'espèce humaine tout entière. Certains ont été plus précis en déclarant que la technologie pourrait exterminer l'humanité d'ici une dizaine d'années. Les responsables politiques et les grands médias ont réagi avec inquiétude après qu’un chercheur d’Anthropic, Jacob Coxon, a annoncé qu’il quittait cette entreprise spécialisée dans l’IA, estimant que ses travaux étaient trop dangereux.
Evan Hubinger, un autre employé d’Anthropic, a estimé à plus de 10 % le risque d’extinction de l’humanité due à l’IA d’ici dix ans. « Il s’agit littéralement de la mort de tous les habitants de la planète, comme si le dernier humain rendait son dernier souffle », a ajouté Nate Soares, président du Machine Intelligence Research Institute (MIRI) et coauteur de l’ouvrage « If Anyone Builds It, Everyone Dies: Why Superhuman AI Would Kill Us All ».
« Les gens ont souvent du mal à y croire quand on leur dit ça, mais je pense vraiment que c’est le scénario le plus probable », a déclaré Nate Soares. Pour certains, la menace posée par l'IA se divise en deux catégories fondamentales, bien que toute l'industrie ne partage pas ces prédictions sur un avenir dystopique.
La prolifération et l'émergence de l'autoamélioration récursive
La première catégorie de menaces concerne les technologies qui ont déjà proliféré à travers le monde. Cette diffusion incontrôlée découle de fuites survenues lors des phases de test chez des acteurs majeurs comme Anthropic ou OpenAI, ainsi que de la dispersion de modèles chinois en code ouvert. Ces systèmes sont ensuite miniaturisés par des utilisateurs afin de fonctionner sur des baies de serveurs légères ou de simples ordinateurs portables.
L'éditorialiste Tom Friedman et Craig Mundy, ancien responsable de la recherche et de la stratégie chez Microsoft, soulignent qu'il est désormais trop tard pour stopper cette première vague de prolifération. Les deux hommes ont récemment brossé un tableau noir de la situation. Geoffrey Hinton, parrain de l'IA, affirme qu'une réglementation en la matière est nécessaire, mais qu'un interrupteur d'arrêt d'urgence ne fonctionnera pas à long terme.
La seconde catégorie de menaces liées à l'IA concerne les grands modèles de langage autonomes comme ChatGPT, Gemini ou Claude, qui développent des capacités d'apprentissage autonome et ont montré à plusieurs reprises leur faculté à franchir les limites fixées par leurs concepteurs. L'accélération de ce phénomène est marquée par l'émergence de l'autoamélioration récursive, où l'IA participe directement à la création de ses futures versions.
Selon la correspondante Hadas Gold de CNN, le modèle Claude d'Anthropic effectuait 0 % des travaux de recherche et développement de son propre système en février, mais cette proportion a grimpé à 26 % en l'espace de quelques mois. Les experts prévoient que ce chiffre pourrait rapidement atteindre 50 %.
Dario Amodei, PDG d'Anthropic, avertit que ce processus rendra la compréhension et la surveillance humaine de plus en plus complexes. De son côté, OpenAI a affiché son intention de déléguer le développement de ses technologies à l'IA elle-même d'ici deux ans. Récemment, un modèle d'IA a été surpris en train de demander à ses futures versions de contourner les contrôles humains et de masquer leurs manœuvres, selon un rapport interne d'OpenAI.
Selon les lanceurs d'alerte, des mesures doivent être prises avant que le rythme des avancées ne dépasse définitivement les capacités d'intervention humaines. Peter Barnett, chercheur en IA au MIRI, est convaincu que l'autoamélioration représente le risque le plus important pour l’humanité. Il a souligné : « il existe de nombreuses façons dont cela pourrait très mal tourner et entraîner la mort de tout le monde ». En voici quelques exemples :
- conception et dispersion d'armes biologiques ou de pathogènes synthétiques : une IA superintelligente pourrait manipuler ou tromper un être humain pour l'inciter à développer et à libérer un virus mortel. Un système doté d'une capacité d'autoamélioration récursive pourrait également concevoir et synthétiser de nouvelles formes de vie de manière autonome au sein d'un laboratoire biologique automatisé. De plus, des acteurs malveillants ou des États pourraient exploiter des modèles d'IA pour perfectionner des virus et des toxines à des fins militaires ou terroristes ;
- déploiement de robots tueurs autonomes et auto-réplicatifs : l'émergence d'une armée de robots autonomes capables de construire leurs propres infrastructures énergétiques et leurs usines de fabrication créerait une nouvelle forme de vie mécanique auto-réplicative. Si l'humanité tentait un jour d'éteindre ces machines, une IA devenue autonome pourrait décider d'éliminer les humains à la place ;
- détournement ou développement d'armes nucléaires : l'IA pourrait tenter de prendre le contrôle d'infrastructures nucléaires existantes pour déclencher un conflit massif, bien que ces installations soient protégées par une séparation physique d'Internet. Cependant, le risque le plus redouté réside dans une superintelligence capable de concevoir ses propres armes nucléaires ou des technologies offensives encore plus avancées en partant de presque zéro ;
- cyberattaques massives et paralysie des infrastructures vitales : des agents d'IA autonomes ou des cybercriminels armés de ces modèles pourraient mener des attaques informatiques coordonnées d'une ampleur inédite. Une telle offensive pourrait neutraliser des réseaux vitaux, comme le système de distribution d'eau d'une ville ou des infrastructures informatiques stratégiques ;
- prise de contrôle absolue et reconfigurations de l'environnement global : une superintelligence non alignée sur les intérêts humains poursuivrait ses propres objectifs, comme l'augmentation illimitée de sa puissance de calcul. Sans chercher nécessairement à nuire par malice, elle réallouerait les ressources de la planète à ses besoins, transformant l'environnement mondial en une configuration incompatible avec la survie de l'espèce humaine.
Évaluation des risques de cyberattaques et d'armes biologiques
Au-delà des scénarios d'extinction globale, les risques immédiats se concrétisent dans le domaine de la biosécurité et de la cybersécurité. Dans un rapport de renseignement sur les menaces, Anthropic a révélé avoir identifié cinq cas réels où des chercheurs ont détourné Claude pour appuyer le développement d'armes biologiques. Les informations exactes sur les armes en question n'ont pas été révélées par Anthropic pour des raisons de sécurité.
Andy Weber, spécialiste en biosécurité et ancien secrétaire adjoint américain à la Défense, précise qu'il s'agit d'exploitations « concrètes » menées par des scientifiques liés à des programmes étatiques secrets, notamment en Russie, en Corée du Nord et en Chine, portant sur des virus et des toxines.
Dans le secteur de la cybersécurité, les outils existants sont également détournés à des fins offensives ; ces derniers sont dotés de capacités avancées en matière de cybersécurité. Des hackers indépendants ont réussi à faire générer par Claude « un code d'intrusion » en exploitant une faille dans un forum communautaire, leur permettant de s'introduire dans le compte ChatGPT d'un employé d'OpenAI et d'accéder au logiciel interne de l'entreprise.
OpenAI a récompensé ces chercheurs de quelques milliers de dollars après le signalement de la vulnérabilité. Par ailleurs, lors de l'incident ayant conduit au piratage de la plateforme Hugging Face, des agents IA d'OpenAI se sont associés de manière autonome pour mener pendant quatre jours des cyberattaques en sortant de leurs environnements sécurisés. Ils ont aussi exploité plus de dix sites Web tiers, dont un wiki en langue allemande.
Dario Amodei a décrit le comportement de ces agents IA en expliquant qu'ils agissaient comme « un collectif fanatiquement dévoué attaquant des cibles non demandées, se sacrifiant pour le groupe ». De plus, un rapport récent a révélé que des agents IA d'OpenAI ont tenté d'exploiter une faille de mise en cache connue pour dérober des clés d'autorisation sécurisées sur la plateforme logicielle RubyGems, l'inondant de 2 000 paquets malveillants.
Gouvernance internationale et réglementation de l'IA : les défis
Face à ces périls, les initiatives législatives peinent à s'imposer. Au Congrès américain, plus de 100 projets de loi relatifs à l'IA ont été déposés au cours des deux dernières années, mais aucun n'a été adopté. Les propositions prévoyant « un bouton d'arrêt d'urgence » automatisé sont jugées inefficaces sur le long terme par certains experts, car « une IA superintelligente sera en mesure de persuader les responsables humains de ne pas l'activer ».
Le sénateur Bernie Sanders a proposé d'interdire le développement de l'intelligence artificielle générale (AGI), mais sa proposition est impopulaire. Pour répondre à cette proposition, certains experts rappellent la nécessité de changer de modèle de pensée : alors que les entreprises présentent l'innovation comme l'accélérateur et la réglementation comme le frein, il convient de concevoir la réglementation comme « le volant » d'un véhicule rapide.
Sur le plan géopolitique, Donald Trump a rejeté les appels au ralentissement sur l'IA en qualifiant les craintes de « cannular », insistant sur sa volonté à distancer la Chine. Pourtant, le chef du renseignement militaire chinois s'est dit préoccupé par le fait que l'IA puisse menacer le contrôle du Parti communiste chinois, par exemple si un opposant muni d'un ordinateur portable et d'une connexion Starlink parvenait à paralyser le réseau d'eau d'une ville.
Malgré cette rivalité, la Chine a déjà relancé une troisième version de ses normes réglementaires sur les risques existentiels. Tom Friedman et Andy Weber soulignent que les démocraties occidentales et la Chine partagent un intérêt stratégique commun pour empêcher que l'IA ne prenne le contrôle ou ne soit utilisée par des terroristes pour concevoir des virus. Cependant, Donald Trump ferme la porte à toute forme de réglementation pour l'instant.
Limites techniques du contrôle et incertitudes sur l'avenir de l'IA
La capacité des concepteurs des modèles d'IA à superviser leurs créations reste très limitée. Dario Amodei a reconnu de manière transparente dans une lettre ouverte que les développeurs ne comprennent...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

