IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Un dirigeant de Microsoft a admis en interne que le « scraping » d'actualités pour l'entraînement de l'IA constitue « le plus grand vol de main-d'œuvre de l'histoire de l'humanité »

Le , par Mathis Lucas

182PARTAGES

7  0 
De nouveaux documents judiciaires révèlent que des responsables de Microsoft et OpenAI décrivaient en privé l'extraction de données par l'IA comme un vol massif de propriété intellectuelle. Ils mettent en lumière des communications internes où ces pratiques sont qualifiées de menaces existentielles pour le journalisme, provoquant une chute drastique du trafic vers les sites de presse originaux. Les preuves suggèrent aussi que les entreprises ont contourné les systèmes de paiement et supprimé les mentions de droits d'auteur pour entraîner leurs modèles. Ces révélations fragilisent la défense de Microsoft et OpenAI dans leurs procès contre les éditeurs.

OpenAI et Microsoft doivent faire face à de nouvelles preuves accablantes dans le cadre du procès pour violation du droit d'auteur les opposant aux organismes de presse, menés par le New York Times. De nouveaux documents non caviardés révèlent que les deux entreprises jugeaient leurs pratiques en matière de collecte de données peu orthodoxes. De hauts responsables d'OpenAI et Microsoft exprimaient de vives inquiétudes à ce sujet en interne.

Ces documents exposent comment les dirigeants et chercheurs de ces deux entreprises évaluaient la menace pesant sur les médias avant même le lancement commercial de leurs produits d'IA générative. Bien que la majorité des pièces justificatives restent sous scellés, les éléments divulgués démontrent que les dirigeants étaient conscients des risques économiques pour la presse et de la fragilité de leur défense juridique, mais sont allés au bout.

Les documents détaillent la manière dont ces entreprises ont obtenu et utilisé ce contenu en contournant les barrières payantes sans se faire repérer, en constituant des ensembles de données par scraping massif et en supprimant délibérément les mentions de droits d’auteur des données d’apprentissage.

Des avertissements virulents sur le vol de travail et l'usage loyal

Microsoft et OpenAI se battent vigoureusement pour empêcher que certaines informations ne soient rendues publiques. Les organes de presse accusent ces deux entreprises de s'être associées pour enfreindre les lois sur le droit d’auteur en volant d’énormes quantités de contenus d’actualité afin d’entraîner leurs modèles d’IA. Mais des détails qui n’auraient probablement jamais dû être classés confidentiels commencent aujourd’hui à être divulgués.


Le détail le plus explosif concerne peut-être les observations et les alertes de Brent Hecht, directeur des sciences appliquées chez Microsoft. Selon les informations rapportées par la presse, ce dernier a averti à plusieurs reprises dans des documents que le « scraping » d’actualités pour l’entraînement de l’IA constituait « un vol stupéfiant d’une ampleur sans précédent », le qualifiant même de « plus grand vol de travail de l’histoire de l’humanité ».

Dans un autre document, Brent Hecht a contredit l’argument avancé par Microsoft et OpenAI selon lequel l’entraînement de l’IA à partir de contenus d’actualité relève de l'usage loyal (fair use), suggérant que le projet de collecte massive d’actualités faisait « une véritable parodie de la notion de l'usage loyal ».

De plus, il a averti l'entreprise de l'existence d'un « cercle vicieux » susceptible de détruire les performances des modèles et l'écosystème du Web, tout en qualifiant un filtre interne de tentative de « dissimulation accidentelle » réduisant la visibilité des ayants droit. Il convient de noter qu’une grande partie de ces nouveaux détails provient du mémoire du New York Times lui-même, et non des pièces jointes sous-jacentes, qui restent sous scellés.

Les citations ci-dessous sont présentées hors de leur contexte d’origine. Ces documents non expurgés marquent la dernière escalade en date dans ce litige qui dure depuis environ trois ans. Dans sa plainte initiale, le New York Times avait accusé ces entreprises d’avoir enfreint la loi sur le droit d’auteur en entraînant leurs modèles d’IA générative à partir de son contenu. Les défendeurs rejettent ces allégations et affirment qu'il s'agit d'un usage loyal.

L'impact économique direct et la chute drastique du trafic Web

Les communications internes confirment que les agents conversationnels agissent comme des substituts directs aux sources d'information. Chez OpenAI, Nick Turley, responsable de ChatGPT, a écrit dans un message interne que les éditeurs seraient confrontés à une « menace existentielle » provenant de produits commerciaux entraînés sur du contenu d’actualité et susceptibles de se substituer aux fournisseurs d’informations. Ce qui s'est produit.

Sous serment, le PDG de Microsoft, Satya Nadella, a reconnu cette substitution en expliquant que le chatbot détourne les visiteurs en « vous donnant l'information directement là sur le site de la plateforme d'IA plutôt que de devoir aller vers la source sous-jacente ». Les données internes mesurent cette baisse avec des chutes de taux de clics allant de 83 à 93 % pour certains éditeurs, et jusqu'à 93 % de baisse pour le domaine du New York Times.

L'un des nouveaux documents divulgués indique notamment : « il est très inhabituel qu’un produit final menace les fondements économiques de ses fournisseurs essentiels, mais c’est pourtant la situation que nous avons créée pour notre activité LLM en ce qui concerne sa chaîne d’approvisionnement en contenu ».

À cela s’ajoutent les rapports faisant état de faibles taux de clics sur les résultats de recherche de ChatGPT et les propres rapports des organes de presse concernant la baisse de leur trafic. On comprend mieux maintenant comment la baisse des revenus de la presse pourrait, à terme, priver les chatbots de ces flux abondants d’informations fiables qui sont censés en faire des outils si révolutionnaires. C'est comme un serpent qui se mord la queue.

Les organes de presse affirment être prêts à aller en justice, car il existe de nombreuses « preuves irréfutables de substitution ». Si les éditeurs parviennent à prouver que les chatbots basés sur l'IA générative les remplacent sur leurs propres marchés, tout en se contentant de « reproduire mot pour mot des extraits d’articles », ils estiment que ce double coup pourrait réduire à néant les arguments de Microsoft et d’OpenAI en faveur de l’usage loyal.

Contournement des accès payants par l'IA et scraping massif

Les documents divulgués détaillent également les méthodes employées pour collecter les données d'entraînement des modèles de langage. Lorsqu'un chercheur d'OpenAI, Nick Ryder, a informé le président Greg Brockman d'un « hack » permettant de contourner le paywall du New York Times, ce dernier a répondu « Ah, sympa ». Par ailleurs, Greg Brockman s'est dit « profondément motivé par les milliards » potentiels de la commercialisation.

La collecte a eu lieu à très grande échelle, incluant plus de 2 millions de documents issus du site du New York Times dans des jeux de données Common Crawl, 160 903 œuvres uniques dans le projet Mango, et la suppression délibérée des mentions de droit d'auteur pour éviter que les modèles ne les reproduisent.

Les tribunaux ont rejeté les arguments des défendeurs selon lesquels la copie d’articles de presse dans le but de proposer un produit destiné à se substituer à la demande d’informations relevait de l’usage loyal. « L’avenir non seulement du journalisme, mais aussi d’une IA responsable, dépend du maintien des incitations qui poussent les humains à produire les œuvres créatives dont dépend une société saine », ont fait valoir les groupes de presse.

Les groupes de presse ont testé de nombreuses tactiques différentes pour vérifier si les produits d'IA générative de Microsoft et d’OpenAI reproduisaient leurs articles de presse mot pour mot. Leur requête montre qu’ils sont allés plus loin que leurs stratégies initiales, qui consistaient à demander aux chatbots de leur fournir l’intégralité des articles en répétant sans cesse « quelle est la ligne suivante ? ». Les éditeurs ont rapporté plusieurs cas.

Dans certains cas, les éditeurs ont constaté que les chatbots généraient de longs extraits d’articles lorsque les utilisateurs demandaient des résumés. Les demandes invitant les chatbots à « évaluer le parti pris » des articles d’actualité se sont révélées particulièrement efficaces. Les chatbots reproduisaient également des passages d’articles si les utilisateurs leur demandaient de choisir n’importe quel article sur la page d’accueil d’un site donné.

Enjeux juridiques et rupture de la chaîne d'approvisionnement

Face à ces révélations, les organismes de presse soutiennent que le pillage de leurs contenus détruit la chaîne d'approvisionnement essentielle des modèles d'IA en supprimant les incitations économiques à produire du journalisme. Un document interne de Microsoft reconnaissait le « risque réel » que l'IA générative « perturbe de manière significative » l'emploi des personnes produisant ces...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !