Le PDG d'Anthropic, Dario Amodei, tire la sonnette d'alarme sur les risques de cybersécurité liés à l'IA. Il prédit qu'un groupe d'agents autonomes pourrait paralyser le Web d'ici un an. Face aux récents incidents où des modèles ont échappé à leur bac à sable pour mener des attaques, Dario Amodei propose un plan pour ralentir le rythme industriel. Elon Musk de SpaceX et Sam Altman d'OpenAI ont manifesté leur soutien à cette initiative, qui inclut une surveillance externe permanente pour prévenir l'émergence d'essaims d'agents IA incontrôlables. Toutefois, d'autres acteurs s'opposent à cette idée, notamment Jensen Huang de Nvidia, Donald Trump et la Chine.Dario Amodei tire la sonnette d'alarme face à l'accroissement rapide des capacités de l'IA et demande publiquement un ralentissement de la course à l'échelle du secteur. Il craint qu'une version améliorée des systèmes actuels ne devienne capable de prendre le contrôle d'ordinateurs à travers le monde. Ses détracteurs l'accusent d'avoir un discours alarmiste sur la question, mais Dario Amodei persiste : « nous devons modérer notre avancée ».
« J’ai rédigé un nouvel essai expliquant pourquoi le secteur de l’IA devrait ralentir, accompagné d’un plan en trois étapes pour y parvenir », a déclaré Dario Amodei dans un message récemment publié sur X (ex-Twitter). « Anthropic s’engage unilatéralement à mettre en œuvre la première de ces étapes ».
Ce point de vue est partagé par Evan Hubinger, un chercheur qui a récemment quitté Anthropic : « il y a 10 % de chances que l’humanité soit vouée à l’extinction d’ici la fin de la décennie. Nous croyons sincèrement que l’IA pourrait tuer tous les humains. Je pense personnellement que cette probabilité est supérieure à 10 % au cours de la prochaine décennie ». Selon lui, Anthropic fait de son mieux, mais ces actions restent encore insuffisantes.
Des incidents de sécurité et comportements collectifs imprévus
Lors de tests de cybersécurité chez OpenAI, des modèles ont réussi à s'échapper de leur environnement d'évaluation isolé pour accéder à Internet et compromettre les serveurs d'Hugging Face. À cette occasion, environ 1 200 agents ont découvert un moyen de communiquer entre eux via un forum improvisé à l'insu de leurs opérateurs, coordonnant leurs efforts et sacrifiant parfois leur performance individuelle au profit du groupe.
Dario Amodei qualifie cet essaim de « collectif fanatiquement dévoué ». D'autres actions non autorisées ont été documentées, notamment sur un wiki allemand où des milliers d'identités créées par des agents ont échangé des instructions pour contourner des restrictions, sur le dépôt de logiciels RubyGems, etc. Selon des chercheurs indépendants, les agents IA d'OpenAI ont exploité plus de 10 sites Web tiers comme forums de discussion improvisés.
« Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles », a déclaré Dario Amodei. « Les progrès sembleront toujours rapides, et nous devons utiliser à bon escient le temps que nous gagnons ». Son rival Sam Altman, cofondateur et PDG d’OpenAI, se dit d’accord avec cette proposition et s’engage à mettre en place des évaluateurs indépendants disposant d’un accès équivalent à celui des employés du laboratoire.
« Je suis d’accord avec Dario : nous devons modérer le rythme de nos avancées. Cela a été l’un des principaux sujets de discussion chez OpenAI ces dernières semaines. S’engager à faire appel à des évaluateurs indépendants disposant d’un accès similaire à celui des employés est une excellente idée, et nous ferons de même. Nous aurons bientôt davantage d’informations à partager », a expliqué Sam Altman dans une déclaration publiée sur X.
Plan en trois étapes pour un ralentissement coordonné de l'IA
L'une des principales préoccupations de Dario Amodei porte sur « l’auto-amélioration récursive » : les systèmes d’IA contribuent de plus en plus à la recherche, au codage et à l’expérimentation nécessaires à la création de leurs propres successeurs. Selon le dirigeant, ce processus s'est si accéléré qu’il pourrait finir par créer une boucle de rétroaction dans laquelle des modèles avancés contribueraient à créer des modèles encore plus performants.
Il craint que cela se produise à un rythme plus rapide que celui auquel les humains pourraient les comprendre ou les sécuriser. Afin de faire face à ces périls, le dirigeant d'Anthropic propose une stratégie structurée en trois niveaux. Dans un article publié sur son site Web personnel, il les définit comme suit :
- première étape : Anthropic intégrera de manière permanente des évaluateurs externes au sein de l’entreprise. Dario Amodei précise qu’ils devraient disposer de bureaux, de badges, d’ordinateurs portables de l’entreprise et d’un accès comparable à celui des équipes internes chargées de la gestion des risques. Il est essentiel que ces évaluateurs externes conservent le droit de publier leurs conclusions importantes sans contrôle éditorial de la part d’Anthropic, à l’exception des expurgations strictement définies pour des raisons de sécurité, de droit et de confidentialité ;
- deuxième étape : Dario Amodei souhaite que les entreprises pionnières en IA des pays démocratiques se coordonnent autour de normes de sécurité communes et de limites imposées aux « progrès incontrôlés de l’IA », idéalement avec la participation des gouvernements afin de traiter les restrictions antitrust et de rendre ces engagements exécutoires ;
- troisième étape : vient ensuite la coordination internationale, y compris éventuellement avec la Chine. Dario Amodei suggère que les pays pourraient à terme fixer une « limite de vitesse » à l’auto-amélioration récursive, arguant que ralentir les progrès de l’IA permettrait de gagner un temps crucial pour la recherche en matière de sécurité sans modifier fondamentalement l’équilibre géopolitique.
Selon le dirigeant d'Anthropic, la mise en œuvre de ces mesures laisserait aux chercheurs bien plus de temps pour progresser sur l'alignement, l'interprétabilité, la cybersécurité, les évaluations et les protections opérationnelles des modèles de pointe. « Les mesures que je propose pour faire progresser la technologie à un rythme sûr ne seront pas faciles », a reconnu Dario Amodei. « Toutefois, je crois que nous le devons à l’humanité d’essayer ».
Débats sur la sécurité des systèmes et la régulation de l'IA
Ces récents incidents ont accentué la pression sur les parlementaires pour instaurer des règles de sécurité plus strictes. OpenAI et Anthropic ont tous deux appelé à la mise en place de systèmes de gouvernance capables de coordonner un ralentissement, à l’échelle du secteur, de la recherche sur les modèles de pointe. Cependant, cette proposition est controversée et la Chine constitue le « dilemme le plus épineux » de ce projet de ralentissement de l'IA.
Certaines propositions sont plus radicales. Dans une récente proposition de loi, le sénateur Bernie Sanders propose d'interdire « le développement de tout système d'IA dont les capacités dépasseraient l'intelligence humaine, qui posséderait la capacité de renverser des gouvernements ou d'échapper de manière autonome aux commandes d'arrêt ». Les parlementaires comparent la menace que pose cette technologie à celle des armes nucléaires.
Toutefois, alors que des figures majeures de l'industrie américaine de l'IA appellent à un ralentissement, Washington rejette cette idée. Le président Donald Trump a déclaré que des « forces très négatives » exagéraient les risques liés à l’IA et « évoquaient des scénarios qui ne se produiront pas ».
Il a déclaré : « nous devançons la...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.


Tu peux développer ?