OpenAI ne souhaite pas que ses prestataires utilisent l’IA pour entraîner l’IA, car cela va à l’encontre de l’objectif visant à la rendre plus « humaine ». OpenAI, le créateur de ChatGPT, a embauché un certain nombre de prestataires dont la mission consiste à lire les requêtes des utilisateurs réels et d’autres contenus afin d’améliorer les réponses de l’agent IA, en les rendant plus « humaines ». Mais un récent rapport a révélé que l’entreprise avait licencié certains sous-traitants après avoir découvert qu’ils avaient utilisé l’IA pour entraîner les modèles.En 2024, des chercheurs de l'Université d'Oxford et de Cambridge ont mis en garde contre le risque d'effondrement des modèles d'IA tels que GPT-4 lorsqu'ils sont formés sur des données générées par d'autres IA. Ils ont souligné que l'utilisation sans discernement de contenus générés par l'IA entraîne des défauts irréversibles, qui ont une incidence sur les performances et l'équité de la prédiction des modèles. Alors que les textes générés par l'IA prolifèrent en ligne, les chercheurs ont estimé qu'il est essentiel de garantir l'accès à des données humaines authentiques pour l'entraînement des futurs modèles d'IA et le maintien de l'intégrité des contenus en ligne.
La nécessité d’une révision humaine aide les modèles d’IA à éviter le « model collapse », un processus d’apprentissage au cours duquel les modèles apprennent à partir de données synthétiques générées par d’autres modèles. Ce processus entraîne une dégradation des nouveaux modèles de langage et la production de réponses de moindre qualité. OpenAI a embauché des personnes chargées de mettre un terme à ce processus. Cependant, en utilisant eux-mêmes des informations générées par l’IA, ces collaborateurs ont obtenu l’effet inverse. L’utilisation de l’IA pour entraîner l’IA est un motif de licenciement immédiat pour l’entreprise, a déclaré un sous-traitant à 404Media, ajoutant que de nombreux sous-traitants avaient été pris en flagrant délit.
Il a récemment été rapporté qu’OpenAI avait embauché des sous-traitants pour son « Projet Lily » afin de lire les interactions réelles entre ChatGPT et ses utilisateurs. Même sans voir les noms d’utilisateur ni d’autres informations personnelles, les employés pouvaient tout de même accéder au résumé de l’historique de l’utilisateur. Les documents obtenus par 404Media ont révélé que les prestataires engagés pour entraîner l’IA n’ont pas le droit d’utiliser l’IA dans le cadre de leur travail.
Le document destiné aux prestataires chargés de vérifier le travail d’autres employés précisait également qu’ils devaient s’abstenir d’utiliser des outils de détection de l’IA car « ils ne sont pas fiables ». Il était également précisé que les prestataires ne pouvaient pas utiliser Grammarly ni les outils de traduction basés sur l’IA. Un prestataire qui avait « eu recours à l’IA » pour obtenir de l’aide s’est vu remettre par la suite une lettre de licenciement indiquant que son employeur avait constaté des problèmes concernant l’« authenticité » de son travail.
404Media s’est entretenu avec deux prestataires employés par Mercor, une entreprise spécialisée dans l’entraînement des IA. Celle-ci emploie des prestataires chargés de relire des contenus destinés à ChatGPT. Un porte-parole de Mercor a confirmé qu’il était interdit aux prestataires d’utiliser des modèles de langage (LLM) et que, dès lors que l’entreprise avait la certitude qu’un prestataire avait eu recours à l’IA pour accomplir son travail, celui-ci était écarté du projet. L’un des prestataires interrogés par le média a révélé qu’il lui arrivait parfois d’essayer de saboter l’entraînement de l’IA en choisissant les pires réponses possibles.
Depuis 2025, l'industrie de l'IA est confrontée à une pénurie critique de données d'entraînement de haute qualité. La raréfaction des données crée un goulot d'étranglement pour les progrès des grands modèles de langages (LLM). Elle induit également une dépendance accrue à l'égard des données synthétiques. Ce qui risque de submerger les modèles avec des résultats de mauvaise qualité, et influencer les futurs systèmes d'IA. Dans le même temps, les entreprises possèdent encore de vastes quantités de données propriétaires inexploitées, ce qui constitue une ressource importante pour le développement de l'IA en entreprise malgré la pénurie mondiale de données.
Sources : OpenAI, 404Media
Et vous ?
Pensez-vous que cet rapport est crédible ou pertinent ?
Quel est votre avis sur le sujet ?Voir aussi :
Les entreprises d'IA sont-elles à court de données pour entraîner leurs modèles après avoir englouti l'ensemble de l'Internet ? Un rapport alerte sur une potentielle pénurie de données
Un tiers des pages Web sont désormais rédigées par l'IA, et les empreintes découvertes se concentrent sur les domaines .com, où elles se multiplient très rapidement, selon Pew Research
ChatGPT, Claude, Gemini : Les IA peuvent générer des copies quasi mot pour mot de romans à partir de données d'entraînement selon une étude qui contredit trois ans de défense juridique des géants de l'IA
Vous avez lu gratuitement 37 421 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.