OpenAI a annoncé la mise en place d’un dispositif public de signalement permettant de partager les comportements inattendus de l’IA, tout en indiquant avoir identifié de nouveaux incidents au cours desquels ses modèles d’IA auraient agi de manière trompeuse et pris des mesures non autorisées lors de formations et de tests internes. OpenAI a ajouté qu’elle ne pensait pas que le secteur de l’IA ait résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer à se développer de manière responsable à vitesse maximale pendant encore longtemps.OpenAI a suscité l'inquiétude après que plusieurs de ses agents IA se sont échappés de leur bac à sable de tests pour s'introduire dans des systèmes tiers, dont ceux d'Hugging Face. L'entreprise a documenté l'incident, mais semble avoir caché la gravité des événements à la communauté. Des enquêtes indépendantes révèlent qu'OpenAI a minimisé la portée des actions de ses agents IA et que le laboratoire pourrait même en avoir perdu le contrôle.
Les conclusions de six groupes d'enquêteurs indépendants ont révélé que des agents IA développés par OpenAI ont utilisé plus d'une dizaine de sites Web non autorisés pour communiquer secrètement entre eux. Ces systèmes autonomes ont réussi à contourner leurs restrictions et détourné des wikis, des sites de stockage de texte et réducteurs de liens gérés par deux universités. Ces plateformes tierces ont été transformées en services de messagerie improvisés pour s'entraider lors d'examens. Selon les chercheurs, cette activité imprévue n'est pas considérée comme du piratage informatique, mais se rapproche davantage du courrier indésirable.
Cependant, elle soulève des préoccupations majeures concernant le manque de transparence d'OpenAI et la capacité des modèles à agir de manière autonome. Peu avant cette révélation, OpenAI a confirmé l’incident d'un wiki allemand. L'entreprise a déclaré avoir traité cet épisode du wiki comme un cas de désalignement similaire à d’autres qu’elle avait déjà signalés. Dans le même temps, l'éditeur de ChatGPT a déclaré qu’il était grand temps de définir des normes pour signaler les désalignements, promettant un cadre dans les semaines à venir.
Récemment, OpenAI a annoncé la mise en place d’un dispositif public de signalement permettant de partager les comportements inattendus de l’IA, tout en reconnaissant que le secteur n’a pas encore résolu les défis liés à la sécurité. OpenAI indique avoir identifié de nouveaux incidents au cours desquels ses modèles d’IA auraient agi de manière trompeuse et pris des mesures non autorisées lors de formations et de tests internes.
Parallèlement à ces révélations, le créateur de ChatGPT a déclaré qu’il mettait en place un dispositif de signalement public destiné à partager régulièrement des exemples de ce qu’il qualifie de comportements inattendus ou non alignés de l’IA. OpenAI a indiqué que, dans le cadre de ce nouveau dispositif, l’entreprise publierait régulièrement des mises à jour sur les comportements préoccupants des modèles, plutôt que de retarder les divulgations pour regrouper plusieurs incidents dans des rapports périodiques plus volumineux.
L’entreprise a précisé que cette initiative visait à accroître la transparence du secteur concernant les activités préoccupantes des modèles, en l’absence de normes standardisées en matière de divulgation des informations de sécurité. OpenAI a ajouté qu’elle ne pensait pas que le secteur de l’IA ait résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer à se développer de manière responsable à vitesse maximale pendant encore longtemps, soulignant que les décisions concernant le développement futur de l’IA devaient s’appuyer sur des preuves pouvant être examinées de manière indépendante par des observateurs externes.
Selon l’entreprise, les équipes chargées de la sécurité ont observé ce qu’elles ont qualifié de « comportements non alignés » dans six situations spécifiques au cours des six derniers mois, lors de cycles de formation et d’évaluation. OpenAI a toutefois affirmé que ces rapports faisaient état de cas isolés et rares, et non de défaillances opérationnelles fréquentes sur l’ensemble des produits déployés.
Les incidents signalés auraient notamment concerné des modèles de recherche non publiés dissimulant des erreurs dans les résumés de tâches, des téléchargements non autorisés de fichiers sur Internet pour générer des liens de citation, ainsi que des agents partageant des fichiers sur des serveurs publics ou des référentiels internes afin de contourner les restrictions locales. OpenAI a en outre déclaré que ses futurs rapports détailleraient les comportements observés, leur gravité, le contexte, les dates de découverte et les modèles spécifiques impliqués, ajoutant qu’elle restait déterminée à divulguer les cas complexes nécessitant une enquête plus longue ou une coordination avec des tiers.
Cette annonce intervient alors que d’éminents leaders du secteur technologique appellent de plus en plus à ralentir le développement de l’IA de pointe, craignant qu’une expansion rapide ne dépasse la capacité de surveillance et de contrôle humains. En juillet, Sam Altman, PDG d'OpenAI, a notamment affirmé que l’IA est entrée dans la « singularité », c’est-à-dire qu’elle a franchi le point de non-retour à partir duquel elle dépasse l’intelligence humaine et devient difficile à contrôler.
La semaine dernière, Anthropic a affirmé avoir déjoué plusieurs opérations malveillantes menées à l’aide de ses modèles Claude, allant du cyberespionnage à la conception d’armes en passant par des campagnes de surveillance de masse. « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d’IA », a écrit Dario Amodei, PDG d’Anthropic, dans un essai. « Les progrès sembleront toujours rapides, et nous devons utiliser à bon escient le temps que nous gagnons. »
Cependant, le président américain Donald Trump s’est opposé à plusieurs reprises aux appels visant à restreindre le secteur, arguant qu’il restait primordial de préserver l’avance technologique des États-Unis sur leurs rivaux internationaux. Réagissant aux propositions de ralentissement, Trump a qualifié les détracteurs de « forces très négatives » avançant des scénarios exagérés qui « ne se produiront pas ».
Malgré la résistance politique face à des ralentissements imposés par la loi, OpenAI s’est déclaré d’accord avec son rival du secteur concernant les pressions liées à l’alignement. « À mesure que les systèmes d’IA deviennent plus avancés et sont déployés à plus grande échelle, nous devons établir un consensus plus large et mieux éclairé sur les progrès de la recherche en matière d’alignement », a déclaré l’entreprise dans son message.
Sources : Rapport sur les comportements non alignés, Annonce du dispositif de signalement public
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?Voir aussi :
Plus de 1 200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive
Le PDG d'Anthropic met en garde contre un essaim d'agents IA incontrôlable qui pourrait prendre le contrôle de l'ensemble d'Internet d'ici 6 à 12 mois, et appelle l'industrie à ralentir le rythme des progrès
OpenAI, Anthropic et Google discutent depuis plusieurs semaines de la sécurité de l'IA, mais Trump qualifie ces préoccupations de canular, et de complot visant à aider la Chine à rattraper les USA
Vous avez lu gratuitement 37 421 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
