Une récente étude du Pew Research Center a révélé que les textes générés par l'intelligence artificielle (IA) représentent désormais une part importante du Web anglophone : une page Web sur dix présente des signes évidents de rédaction par l'IA, et ce chiffre monte à 35 % pour les pages publiées après le lancement de ChatGPT en novembre 2022. Les chercheurs sont parvenus à cette conclusion après avoir analysé environ 490 000 pages issues des archives de Common Crawl à l’aide du modèle de détection IA Open Pangram, en exploitant des données recueillies entre janvier 2021 et juillet 2026. La répartition de l'empreinte de l'IA est frappante selon les domaines : les sites .com présentent des signes de création par l’IA à un rythme environ dix fois supérieur à celui des domaines .edu et .gov, et deux fois supérieur à celui des domaines .org, un écart qui s'est fortement creusé depuis 2021.Cette progression s'inscrit dans un contexte de transformation plus large du Web par l’automatisation. Selon un rapport récent de Graphite, les articles générés par des humains sont désormais minoritaires sur Internet par rapport à ceux produits par l'IA. Parallèlement, plus de la moitié du trafic Web serait générée par des systèmes automatisés, dont la majorité serait mise en place par des acteurs malveillants, d'après une étude d'Imperva. Ces évolutions alimentent une inquiétude croissante : à mesure que les machines occupent davantage l’espace informationnel, il devient de plus en plus difficile d'établir une distinction entre contenu humain, contenu automatisé et désinformation due à l'IA.
Les contenus rédigés par l'IA sont partout, littéralement. Selon une étude du Pew Research Center publiée le jeudi 20 août 2026, une page web en anglais sur dix présente désormais des signes évidents de rédaction par l'IA. Si l'on limite cet échantillon aux seules pages publiées depuis le lancement de ChatGPT en novembre 2022, cette proportion grimpe à 35 %.
Ces conclusions font suite à une analyse menée par des chercheurs qui ont extrait environ 490 000 pages des archives web de Common Crawl, couvrant la période de janvier 2021 à juillet 2026, puis ont soumis ces textes à Open Pangram, un modèle de détection IA.
L'empreinte de l'IA n'est pas répartie de manière homogène. Les pages des domaines .com présentent des signes de rédaction par l'IA à un taux environ 10 fois supérieur à celui des domaines .edu ou .gov, qui avoisinent chacun 1 %, et environ deux fois supérieur au taux de 4,6 % observé sur les sites .org. En 2021, ces quatre types de domaines se ressemblaient presque tous.
Quelle part d'Internet est écrite avec l'IA ?
En novembre 2022, OpenAI a rendu ChatGPT accessible au grand public pour la première fois. Moins de quatre ans plus tard, environ la moitié des adultes américains ont déclaré utiliser des chatbots IA, dont 24 % qui affirment les utiliser quotidiennement. La capacité de ces outils à générer des textes qui semblent avoir été rédigés par des humains a soulevé une question fondamentale concernant le Web moderne : quelle part du contenu en ligne est désormais rédigée par l'IA plutôt que par d'autres personnes ?
Pour approfondir cette question, les chercheurs du Pew Research Center ont utilisé les archives Web de Common Crawl afin de collecter près d’un demi-million de pages Web en anglais datant des cinq dernières années – à compter de quelques années avant la sortie de ChatGPT. Ils ont ensuite soumis le texte de ces pages à un outil de détection IA appelé Open Pangram afin de déterminer combien d’entre elles étaient susceptibles d’avoir été rédigées ou considérablement modifiées par l’IA.
Ces points représentent un échantillon aléatoire de 10 000 pages web collectées en juillet 2026. Ensemble, ils constituent un instantané de ce à quoi ressemblait l'Internet anglophone à ce moment-là.
À l'aide d'un modèle d'apprentissage automatique, Pew Research a analysé le texte de chaque page web à la recherche d'indices laissant supposer qu'elle avait été rédigée par une IA. Le modèle examine les schémas linguistiques, en identifiant les mots, les expressions et les particularités linguistiques plus couramment utilisés par les IA que par les auteurs humains.
Parmi toutes les pages de cet échantillon, 10 % présentent des signes significatifs d'une rédaction par l'IA. une IA
Cela s'inscrit dans une tendance à la hausse qui a débuté fin 2022, lors du lancement de ChatGPT, et s'est poursuivie avec l'arrivée d'autres chatbots IA, tels que Claude et Gemini. Au fil du temps, la proportion de pages web présentant des signes d'une rédaction par l'IA n'a cessé d'augmenter.
Un site web sur dix en juillet 2026 peut sembler un chiffre modeste. Mais Internet regroupe à la fois des contenus récents et anciens. Bon nombre de pages figurant dans ces échantillons aléatoires n’ont pas pu être rédigées par l'IA.
Si l’on exclut les anciennes pages web des échantillons et que l’on ne considère que celles publiées après le lancement de ChatGPT, la tendance est encore plus marquée.
Dans l'analyse de juillet 2026, les chercheurs ont observé des signes indiquant une rédaction par l'IA dans plus d'un tiers des pages publiées après le lancement de ChatGPT. Ce constat va dans le sens d'autres études qui ont montré qu'une grande partie des pages récemment publiées sur Internet avaient probablement été rédigées ou largement révisées par l'IA.
Où trouve-t-on le plus souvent des textes rédigés par l'IA sur Internet ?
Les textes rédigés par l'IA ne sont pas répartis de manière homogène sur le Web. Lors du lancement de ChatGPT, les types de schémas linguistiques pouvant indiquer une rédaction par l'IA apparaissaient à des fréquences similaires sur les principaux domaines de premier niveau (.com, .org, .edu et .gov).
Mais dans les échantillons datant de 2026, environ une page sur dix hébergée sur un domaine .com présente des signes indiquant qu'elle a été rédigée par l'IA – soit environ le double de la proportion observée sur les domaines .org (4,6 %) et dix fois celle des domaines .edu ou .gov (environ 1 % dans les deux cas).
Quelles sont les caractéristiques communes des textes rédigés par l’IA ?
Les modèles de détection IA ne sont pas parfaits : ils classent parfois à tort des documents individuels rédigés par des humains comme présentant des signes de rédaction par l’IA, et inversement. Mais en examinant ensemble de très vastes collections de textes, les chercheurs du Pew Research Center ont constaté que certains types de ponctuation, de mots et d’expressions apparaissent beaucoup plus fréquemment dans les contenus générés par l’IA que dans les textes rédigés par des humains.
Les modèles d'IA sont entraînés à partir de vastes ensembles de données issus d'écrits humains, et ils apprennent à imiter les schémas et les styles de ces écrits. Il arrive parfois que certains types d'écrits soient surreprésentés dans ce processus d'entraînement. Par conséquent, les modèles entraînés sur ces données peuvent finir par utiliser certains mots, certaines expressions ou certaines particularités linguistiques plus souvent que ne le font généralement les humains.
Les chercheurs indiquent que de nombreux textes journalistiques et universitaires utilisent le tiret long (—), un signe de ponctuation servant à marquer une coupure dans le fil de la pensée ou à mettre en exergue une remarque entre parenthèses. Selon eux, les modèles d’IA ont tendance à utiliser ces tirets beaucoup plus souvent que ne le font généralement les humains. Ces modèles ont également davantage tendance que les auteurs humains à énumérer des éléments par groupes de trois et à utiliser la virgule d’Oxford dans les listes.
Et à mesure que le contenu généré par l'IA se multiplie en ligne, ces indices, parmi d'autres, sont devenus plus courants sur les pages web. L'étude de Pew Research révèle que si l'on compare l'Internet d'aujourd'hui à un instantané de 2023 :
- Les tirets longs apparaissent environ deux fois plus souvent.
- L’utilisation des virgules d’Oxford a augmenté de 63 %.
- Certains mots que les modèles d’IA aiment utiliser (tels que « delve », « interplay » ou « testament ») ont plus que doublé en fréquence d’utilisation.
- Le recours au « parallélisme négatif » pour structurer une comparaison (« ce n’est pas seulement X, c’est aussi Y ») a presque triplé – même si cela reste globalement assez rare.
Bien sûr, les tirets longs ou les virgules d’Oxford ne signifient pas nécessairement, à eux seuls, qu’un texte a été rédigé à l’aide de l’IA. Les humains les utilisent eux aussi dans leurs écrits. Mais en examinant un grand nombre de documents, Pew Research a commencé à observer des tendances quant à la fréquence moyenne à laquelle les auteurs humains et les modèles d’IA ont recours à ces éléments.
Par ailleurs, l'étude indique que les modèles de...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

