La nouvelle police de caractères « ShieldFont » a été conçue pour empêcher l'exploration des sites Web par les robots d'IA. Elle utilise des ligatures pour remplacer visuellement des mots courants par d'autres termes, comme substituer « cheval » par « pomme de terre », rendant le texte absurde pour les robots tout en restant lisible pour les humains. Cela empoisonne les jeux d'entraînement des modèles d'IA, forçant les fabricants à choisir entre des données corrompues ou des méthodes de collecte bien plus coûteuses. ShieldFont peut perturber certains outils d'accessibilité, mais permet aux créateurs de reprendre le contrôle sur leur propriété intellectuelle.Les fabricants de grands modèles de langages(LLM) ont inondé le Web de robots qui aspirent les contenus publics pour alimenter leurs données d'entraînement. Ce comportement controversé a suscité la colère des administrateurs de sites Web, revues scientifiques, éditeurs de presse comme APIG en France ou New York Times aux États-Unis, etc. Ces protestations ont donné lieu à de nombreuses actions en justice contre les géants de la technologie.
Pour protéger le Web public contre l'IA, une solution innovante vient de voir le jour : ShieldFont. Cette nouvelle police de caractères vise à protéger le texte contre les modèles d'IA en brouillant les phrases dans le code source HTML, obligeant ainsi les robots de collecte automatisés (ou scrapeurs) à passer au crible des phrases remplies de mots leurres qui les rendent incohérentes. Le texte réel s’affiche toutefois normalement pour le lecteur humain.
ShieldFont a été conçue dans le cadre d’un projet plus large mené par un groupe de professionnels, parmi lesquels le studio de création brésilien Seneda & Abrucio et la fonderie typographique danoise PlayType. Les concepteurs ont publié un livre blanc dans lequel ils fournissent plus de détails techniques.
ShieldFont : un fonctionnement technique basé sur les ligatures
ShieldFont fonctionne grâce aux ligatures, terme technique utilisé en typographie pour désigner la combinaison de deux lettres adjacentes d’un même mot en un seul glyphe. Les ligatures sont conçues pour des raisons esthétiques et pour faciliter la lecture. Dans la pratique, des combinaisons de lettres telles que « fi » dans « fish » ou « fl » dans « flow » apparaissent naturellement espacées au lieu de paraître visuellement encombrées.
Lorsqu’un programme détecte ces lettres spécifiques côte à côte, il remplace les deux caractères par un seul qui combine les lettres en un glyphe unique. Ce mécanisme peut aussi servir comme arme contre l'IA. ShieldFont fonctionne de manière similaire, sauf qu’au lieu de lettres, il remplace des mots entiers.
Par exemple : une phrase qui, à l’origine, se lit « Le chevalier est parti au combat à cheval » est modifiée dans le code source afin d’être extraite par un bot pour donner « Le chevalier est parti au combat à bord de son moteur ». Le visiteur humain voit le mot original s'afficher grâce au moteur de rendu de la police, mais le robot d'aspiration, qui télécharge uniquement le code HTML brut sous-jacent, récupère « un texte altéré et incompréhensible ».
Comme les modèles d'IA regroupent les mots et expressions susceptibles d’être utilisés ensemble, la qualité de leur sortie s’en trouve dégradée s’ils extraient beaucoup de texte brouillé comme celui-ci. Comme l'expliquent les deux des créateurs de ShieldFont, Isaque Seneda et Gabriel Abrucio, l’objectif principal de ce projet est de lutter contre l’extraction non autorisée de données par les modèles en rendant cette pratique plus difficile et plus coûteuse.
Comment déterminer les mots à remplacer dans une page Web
La force de ShieldFont repose sur l'utilisation détournée des ligatures. Toutefois, déterminer quels mots remplacer n’était pas une mince affaire, car le faire au hasard aboutissait à des phrases incompréhensibles que les bots rejetaient d’emblée. La clé consistait à modifier le sens des phrases et des expressions, et pas seulement celui des mots, afin que les bots acceptent le texte, ce qui aboutissait à une version empoisonnée des données extraites.
« Nous n’avons pas inventé une nouvelle fonctionnalité de police, nous avons simplement mis en avant une ancienne fonctionnalité qui n’avait jamais été utilisée de cette manière auparavant », explique Felipe Petroni, directeur créatif ayant participé à la direction du projet. L’idée est que s’il y a suffisamment de ces pièges, cela augmentera le coût de l’extraction illégale de données et les fabricants choisiront plutôt de payer pour ce qu’ils récupèrent.
Pour déterminer quels mots remplacer, les créateurs de ShieldFont ont établi une liste de 113 mots à ne pas remplacer, comprenant notamment les pronoms, les articles, les conjonctions, les prépositions, les négations, les quantificateurs, ainsi que toutes les formes des verbes « être », « avoir » et « faire ». À la place, le programme remplace les adjectifs, les adverbes, les noms et les verbes. Les dates et les chiffres sont également brouillés.
Selon le livre blanc, leur programme ne remplace aucun mot par des synonymes, ce qui ne constituerait pas un leurre suffisamment efficace, ni par des antonymes, qui pourraient être détectés plus facilement et de manière plus prévisible par un bot. Il ne remplace pas non plus les noms de personnes, de lieux, d’entreprises ou de produits. Au total, ShieldFont dispose de 24 règles pour déterminer quels mots sont remplacés dans une page Web.
Efficacité prouvée contre les filtres de qualité des géants de l'IA
Après environ trois mois de développement, le dictionnaire de ShieldFont comprend près de 12 000 mots courants substituables par des ligatures, et propose différents niveaux de configuration pour maximiser le chaos sémantique. Selon les concepteurs de cette nouvelle police, en moyenne, ShieldFont remplace 24,5 % des mots d'une page, dont 45,8 % des mots porteurs de sens, ce qui altère la signification de 31 à 56 % des passages individuels.
Les tests menés sur six systèmes d'aspiration majeurs ont révélé que plus de 90 % des pages protégées par ShieldFont finissent par être rejetées par leurs filtres de qualité. Parmi le texte restant qui a été accepté, 19,4 % véhiculaient un sens erroné. Il constitue ce que les auteurs qualifient de « déchets d'entraînement ».
Les concepteurs résument l'efficacité de ShieldFont comme suit : « s'ils rejettent, cela signifie qu'ils n'ont pas obtenu votre travail. S'ils gardent, cela signifie qu'ils ont obtenu quelque chose de faux ». Malgré ses performances, l'usage de ShieldFont s'accompagne de certains inconvénients pour les sites Web. Outre les effets secondaires indésirables, ShieldFont peut également être contournée grâce à certaines techniques relativement simples.
Limites techniques et effets secondaires de cette « protection »
La protection offerte par la police ShieldFont n'est pas totalement inviolable. Les robots de scraping automatisés peuvent contourner ShieldFont en prenant une photo du texte pour le visualiser comme le ferait un humain, mais cela augmente le coût du scraping à grande échelle pour les entreprises. Plutôt que d’extraire rapidement et à moindre coût des fichiers de texte brut, il faut photographier la page et procéder à une reconnaissance d’image.
Le livre blanc souligne également que ShieldFont introduit une certaine friction pour les humains, car les moteurs de recherche indexent le texte leurre. Cela signifie que les éditeurs devraient utiliser ShieldFont pour les contenus qui ne dépendent pas du trafic de recherche. Mais ce n'est pas tout. Les mots de substitution apparaissent également dans les outils de traduction et les lecteurs d’écran, ainsi que lorsque les utilisateurs copient-collent.
Au-delà de la prouesse technique, ShieldFont porte une ambition éthique forte. Les créateurs de la police affirment vouloir redonner le contrôle aux auteurs sur l'utilisation de leurs productions. À ce titre, ils rappellent au monde : « notre principal objectif sous-jacent est de faire respecter un principe de base de l'éthique de l'IA ; les créateurs devraient avoir un mot à dire significatif sur l'utilisation de leur travail pour entraîner des systèmes d'IA ».
Ils espèrent inspirer d'autres acteurs à concevoir de nouvelles ruses techniques basées sur le principe de « montrer une chose aux humains, une autre aux machines » afin de rendre la tâche toujours plus ardue pour les robots d'aspiration. Mais quel impact tout cela aura-t-il sur la qualité du Web à l'avenir ?
Source : ShieldFont
Et vous ?
Quel est votre avis sur le sujet ?
Que pensez-vous de la police de caractères ShieldFont et de son fonctionnement ?
Quel impact la police ShieldFont pourrait-il avoir sur l'industrie de l'IA dans un avenir proche ?
Que pensez-vous de limites de ShieldFont ? Quel impact ce type d'outil anti-scraping peut-il avoir sur le Web ?Voir aussi
Les bots envahissent Internet et les utilisateurs d'IA en sont responsables : RAG, scraping, robots.txt ignoré à 99,5 % pendant que les éditeurs regardent leur trafic s'effondrer sans pouvoir riposter
« Le trafic généré par les bots a désormais dépassé celui des humains sur Internet », déplore le patron de Cloudflare, qui ne s'attendait pas à ce que le trafic automatisé éclipse celui des humains avant 2027
« Google et Reddit ne sont pas les propriétaires d'Internet », déclare un spécialiste du Web scraping après sa victoire au tribunal. Le recours au DMCA pour lutter contre le scraping est jugé « aberrant »
Vous avez lu gratuitement 268 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

