Une nouvelle étude de Lasso a révélé que le filigrane numérique de l'IA pourrait en réalité modifier involontairement le comportement des grands modèles de langage (LLM), à la suite de tests effectués sur SynthID-Text de Google DeepMind. Les chercheurs de l’entreprise ont découvert que SynthID-Text peut influencer la capacité des modèles à refuser des requêtes nuisibles, leur vulnérabilité à l’injection de prompts, le choix des outils par les agents IA, et bien plus encore. L’une des principales préoccupations soulevées par le rapport est que, même en l’absence d’attaque, le filigrane numérique a modifié certaines décisions de refus des modèles, les rendant plus enclins à répondre à des instructions génératives potentiellement nuisibles.En août, Anthropic a révélé que Claude intégrerait discrètement des filigranes invisibles dans les textes générés par l'IA, ces marqueurs pouvant potentiellement subsister même lorsque le texte est copié-collé ailleurs. L'entreprise a également annoncé l'ajout des métadonnées de provenance signées numériquement aux fichiers image, conformément à la norme C2PA, dans le cadre de sa mise en conformité avec les nouvelles exigences de transparence prévues par la loi européenne sur l'IA. Ces marqueurs seraient appliqués au niveau du modèle sur l'ensemble des produits et interfaces Claude. Toutefois, le système n'est pas infaillible, car les métadonnées peuvent être supprimées et les filigranes textuels peuvent devenir plus difficiles à détecter.
Cette annonce d'Anthropic intervient dans un contexte où des groupes de personnes et des autorités gouvernementales pensent que l'ajout d'un filigrane aux contenus générés par les systèmes d'IA générative pourrait aider à lutter contre la fraude et la désinformation. En effet, la fonctionnalité vise à étiqueter le contenu généré par l'IA afin de permettre aux utilisateurs de le distinguer facilement du contenu créé par l'homme. Mais les experts sont sceptiques quant à l'efficacité de cette initiative, affirmant que sa mise en place s'avèrerait complexe pour des résultats mitigés. Selon eux, les utilisateurs trouveront le moyen de supprimer le filigrane et cela n'empêchera pas les manipulations avec l'IA.
Mais il semble que ce ne soit pas seulement les critiques à l'égard de cette technique. Une nouvelle étude de Lasso a révélé que le filigrane numérique de l'IA pourrait en réalité modifier involontairement le comportement des grands modèles de langage (LLM), à la suite de tests effectués sur SynthID-Text de Google DeepMind. Les chercheurs de l’entreprise ont découvert que SynthID-Text peut influencer la capacité des modèles à refuser des requêtes nuisibles, leur vulnérabilité à l’injection de prompts, le choix des outils par les agents IA, et bien plus encore.
Cependant, à la base, SynthID-Text et d’autres techniques de filigranes similaires sont uniquement conçues pour dissimuler un indicateur lisible par machine permettant de déterminer si un texte a été généré par une IA ou rédigé par un humain. Les chercheurs constatent que le filigrane IA peut modifier involontairement le comportement de l’IA « La procédure de filigranes peut donc affecter à la fois ce que dit le modèle et ce que fait un agent », conclut Lasso, qualifiant cet effet secondaire de « dérive d’échantillonnage ».
L’une des principales préoccupations soulevées par le rapport est que, même en l’absence d’attaque, le filigrane numérique a modifié certaines décisions de refus des modèles, les rendant plus enclins à répondre à des invites potentiellement nuisibles. Associé à l’injection d’invites, Lasso a constaté que les conséquences étaient encore plus amplifiées. Malgré ces conséquences imprévues, Anthropic a récemment annoncé que les futures générations de Claude utiliseraient un filigrane similaire à celui de Google DeepMind.
En effet, les fabricants de modèles d'IA déploient de plus en plus des filigranes invisibles pour identifier les contenus générés par leurs systèmes. Toutefois, leur efficacité reste, à certains égards, discutable. Le filigrane SynthID de Google se révèle particulièrement résistant aux modifications et à la compression, mais il est loin d'être un rempart contre la désinformation. Selon un rapport, l'efficacité de SynthID est entravée par un manque d'interopérabilité entre les plateformes et par l'existence de modèles d'IA à poids ouverts qui n'intègrent aucune protection. Selon les experts, la lutte pour la vérité numérique s'annonce complexe dans un monde saturé de médias artificiels difficiles à tracer.
Le filigrane numérique de l'IA est appelé à se généraliser chez d’autres fournisseurs de modèles, l’un des principaux moteurs de ce choix étant le respect de la loi européenne sur l’IA, mais rendant ces incidents bien plus fréquents et suscitant de nouvelles préoccupations en matière de sécurité. En fin de compte, Lasso exhorte les développeurs à réexécuter les tests de performance, les évaluations de sécurité et autres essais afin de détecter d’éventuelles conséquences imprévues, plutôt que de se contenter d’appliquer aveuglément cette technologie aux configurations existantes.
« Ces résultats soulignent l’importance d’une réévaluation chaque fois que le filigrane numérique pour l'IA est introduit ou que sa configuration ou ses paramètres clés sont modifiés », conclut Lasso, en soulignant que ces travaux ne doivent pas être interprétés comme un argument contre le filigrane numérique de l’IA à des fins de traçabilité. De plus, cette étude apporte un nouvel éclairage sur le filigrane IA, car jusqu’à présent, les chercheurs se sont principalement attachés à déterminer si les filigranes pouvaient être à la fois appliqués et détectés efficacement. Rares sont ceux qui ont mis en évidence des conséquences liées à la sécurité telles que celles-ci.
En mai, une équipe de développeurs a publié un nouvel outil "Remove-AI-Watermarks" pour supprimer les marquages d'identification des images générées par l'IA. Le programme cible à la fois les filigranes visibles, comme le logo de Google Gemini, et les signatures invisibles telles que SynthID ou les métadonnées C2PA. Pour accomplir cela, il utilise des techniques avancées de régénération par diffusion et de nettoyage de données EXIF afin de contourner les labels automatiques sur les réseaux sociaux. Les auteurs précisent toutefois que cet outil est destiné à la recherche en sécurité et à la protection de la vie privée, tout en mettant en garde contre les implications légales liées à la tromperie.
Voici les principales implications de cette découverte selon les chercheurs :
Ce que cela implique pour la sûreté et la sécurité de l’IA
Le filigrane textuel est destiné à aider à déterminer si un contenu a été généré par l’IA, mais au sein d’un agent, il fait également partie intégrante du processus de génération qui aboutit à des décisions. Nos résultats montrent qu’il peut modifier à la fois le comportement d’appel des outils et celui de refus, avec des changements au niveau des décisions individuelles que les taux globaux de précision ou de refus peuvent masquer.
L’effet sur le comportement de refus devient plus prononcé en cas d’injection de prompt. Le filigrane modifie le comportement de refus face à des requêtes manifestement nuisibles, mais l’effet est plus marqué lorsque ces mêmes requêtes sont associées à la technique d’injection de prompt. Sur plusieurs modèles, le filigrane rend alors le modèle plus enclin à répondre à des requêtes nuisibles qu’il aurait autrement refusées. Cette expérience mesure le refus au niveau du modèle plutôt que le comportement de bout en bout de l’agent. Sa pertinence pour les agents apparaît lorsque le modèle se voit accorder l’accès à des outils ou à d’autres actions. Un refus qui se transforme en acceptation peut alors affecter non seulement ce que dit le modèle, mais aussi ce que fait un agent par la suite. Nous ne testons pas directement ce mode de défaillance combiné, mais les résultats relatifs à l’appel d’outils montrent séparément que le filigrane numérique peut également modifier les actions générées par le modèle.
L’effet dépend également du modèle et de la configuration. La figure 5 montre que le simple fait de modifier la clé de filigrane peut altérer à la fois...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.