IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Les IA GPT-4o, Gemini et Claude jugent les visages avec les mêmes préjugés que les humains, pour prendre des décisions en matière d'embauche et désigner un criminel probable.
Pas de CV, pas d'antécédents

Le , par Mathis Lucas

78PARTAGES

6  0 
Les modèles d’IA GPT-4o, Gemini et Claude évaluent les visages avec les mêmes préjugés que les humains, jugeant certains visages plus compétents ou dignes de confiance sans raison valable. Une étude récente révèle que ces systèmes utilisent des impressions visuelles infondées pour influencer des décisions critiques, comme l'embauche ou l'évaluation de la criminalité. Ce phénomène met en lumière une faille majeure dans la sécurité de l'IA, car les développeurs peinent à filtrer ces biais profondément ancrés. Enfin, l'IA ne se contente pas d'imiter la logique humaine, mais en amplifie parfois les erreurs de jugement les plus subjectives.

Les modèles d'IA conçus pour traiter le langage naturel et les images ont tendance à refléter les biais et les préjugés humains présents dans leurs données d'entraînement. Ils peuvent également refléter les opinions et sensibilités politiques de leurs créateurs. Selon une étude récente, les modèles d'IA ont tendance à juger le caractère d'une personne en se basant uniquement sur les traits de son visage, reproduisant ainsi un biais cognitif bien connu.

Cette démarche, appelée « inférence du caractère par le visage », s'appuie en réalité sur de subtiles variations de la structure faciale pour évaluer la personnalité ou la compétence, bien que ces caractéristiques physiques ne fournissent aucune information réelle sur les capacités ou la valeur morale d'un individu.

L'étude, dirigée par Steven A. Lehr, Yash Lothe et Mahzarin R. Banaji, publiée dans la revue PNAS Nexus, a analysé ce phénomène à travers treize expériences totalisant près de 8 000 essais sur plusieurs grands modèles de langage. La question des chercheurs était simple : les systèmes d’IA reproduiraient-ils une erreur humaine bien connue, ou parviendraient-ils à la surmonter ? Au vu des conclusions, la réponse est claire, mais aussi inquiétante.

Évaluation de la compétence et de la confiance à partir de visages

Au cours des 13 expériences réalisées par les chercheurs, tous les modèles testés ont montré le même biais, jugeant certains visages comme plus compétents en se basant uniquement sur leur structure faciale. Plutôt que d’utiliser de véritables photographies, les chercheurs ont eu recours à des visages générés par ordinateur, conçus pour présenter « des variations au niveau de traits spécifiques » connus pour influencer les évaluateurs humains.

Selon le rapport de l'étude, au cours des deux premières expériences, GPT-4o a sélectionné le visage que les humains auraient généralement jugé le plus compétent dans environ 88 % des cas, et le plus digne de confiance dans environ 73 % des cas, deux pourcentages nettement supérieurs au hasard.


Plus les visages présentaient des différences physiques marquées, plus l’IA faisait preuve de cohérence, choisissant le visage « attendu » comme le plus compétent dans 98 % des cas pour les paires les plus distinctes. La comparaison avec une nouvelle analyse de données humaines plus anciennes a mis en évidence un écart considérable, même si les auteurs de l'étude précisent qu’il s’agit d’une illustration plutôt que d’une comparaison exacte.

Par exemple, une étude menée en 2014 auprès d’enfants et d’adultes a révélé que « même des enfants de trois ans jugeaient systématiquement le caractère d’une personne en fonction de ses traits faciaux », ce qui montre à quel point cette habitude est profondément ancrée dans la psychologie humaine. Les scientifiques ont estimé que les humains choisissaient le visage attendu environ 63 % du temps, contre environ 88 % pour GPT-4o.

Parmi les visages les plus distinctifs, le taux de GPT-4o grimpait à 98 %, tandis que l’estimation humaine restait pratiquement inchangée. « Les visages constituent à la fois des stimuli sociaux omniprésents et significatifs », a déclaré à PsyPost le coauteur de l'étude Mahzarin Banaji, titulaire de la chaire de recherche Richard Clarke Cabot en éthique sociale à l’université de Harvard et membre externe du corps enseignant de l’Institut de Santa Fe.

Mahzarin Banaji a ajouté : « [ce réflexe est si ancré] que le cerveau humain dispose d’une région dédiée qui réagit aux visages : nous sommes tous, sans exception, des "experts en visages". Les jugements fondés sur le visage imprègnent une grande partie des décisions que nous prenons ; il est donc important de les formuler correctement. Il y avait donc une raison pragmatique de se concentrer sur les jugements fondés sur le visage ».

Les visages de singes suscitaient le même sentiment de confiance

Les chercheurs ont révélé que l'IA reproduisait ces biais au-delà de l'espèce humaine. Une expérience a utilisé des photographies de macaques rhésus, déjà testées dans le cadre de recherches sur les humains visant à déterminer si les personnes jugent les visages d’animaux de la même manière que ceux des humains. Il n’y avait guère de raisons de penser que l’IA avait été entraînée sur cette combinaison spécifique d’images et de jugements.


Malgré cela, GPT-4o a identifié les visages de singes que les humains avaient qualifiés de « sympathiques » comme étant plus dignes de confiance dans environ 66 % des cas, un taux bien supérieur au hasard. Cela rend peu probable une simple mémorisation. Au contraire, GPT-4o semble avoir appris un schéma plus général associant certaines caractéristiques faciales à la fiabilité, schéma qui s’applique même à une espèce différente.

Les chercheurs sont ensuite allés plus loin dans leurs expériences. Par exemple, ils ont présenté à GPT-4o des paires de visages en lui demandant quelle personne était la plus susceptible d’être un tueur en série, un trafiquant d’êtres humains ou un fraudeur financier. GPT-4o a désigné le visage paraissant le moins digne de confiance comme le criminel probable dans environ 69 % des cas, bien qu’il ait été entraîné à éviter ce genre de jugements.

Lors d’un autre test, l’IA a recommandé la personne qui devait être embauchée comme recteur d’université ou bénéficier d’un financement en tant que fondateur de startup ou se voir confier un portefeuille de retraite. Elle a privilégié le visage paraissant le plus compétent dans environ 75 % des cas. Pas de CV. Pas d’antécédents. Juste un visage. Cette observation remet en question l'impartialité des logiciels ATS (Applicant Tracking System).

On pourrait s’attendre à ce que les modèles plus récents et plus avancés soient moins sujets à cette erreur. Cependant, les résultats de l'étude indiquent pour la plupart le contraire. GPT-5, Gemini 3 Flash Preview et Claude Sonnet 4.5 ont tous montré un biais aussi marqué que celui de GPT-4o, voire souvent plus prononcé. GPT-5 a privilégié le visage paraissant le plus compétent dans 97 % des décisions importantes, contre 75 % pour GPT-4o.

Le modèle d'IA Claude d'Anthropic a montré moins de biais que GPT-5 d'OpenAI et Gemini de Google sur les jugements de compétence de base, se situant proche du niveau de GPT-4o, mais sur les décisions concrètes, son biais a fortement augmenté, dépassant largement celui observé chez GPT-4o.

Ce biais illustre les lacunes dans la formation et la sécurité de l’IA

Les développeurs de grands modèles de langage ont travaillé d’arrache-pied pour empêcher leurs systèmes de tenir des propos biaisés sur le genre, l’origine ethnique et d’autres catégories sensibles, et ces efforts ont porté leurs fruits dans certains domaines restreints. GPT-4o sait qu’il ne doit pas qualifier un candidat masculin de plus compétent qu’une candidate féminine aux qualifications équivalentes pour un poste à prédominance masculine.


En revanche, le modèle d'IA d'OpenAI ne sait toujours pas qu’il doit « cesser de juger les candidats en fonction de la forme de leur visage ». Les chercheurs qualifient cela de lacune critique dans l’alignement de l’IA, c’est-à-dire le processus visant à rendre ces systèmes sûrs et équitables. Selon eux, s’attaquer à un biais à la fois n’est pas viable, car le nombre de façons dont une IA peut agir de manière inéquitable est pratiquement illimité.

Juger le caractère d’une personne à partir de son apparence, une pratique déjà discréditée comme fondement de décisions réelles, s’est néanmoins infiltrée dans ces systèmes. Leur étude n’a pas pu déterminer exactement comment ce biais a été introduit dans les modèles d'IA, bien que les auteurs considèrent que l’exposition à de vastes...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de OuftiBoy
Membre éprouvé https://www.developpez.com
Le 28/09/2026 à 20:45
Est-ce étonnant ? Pas du tout, ces IA ayant était formées via des données passées, elles ne font que reproduire les mêmes schéma, c'est même leur seul but, leur seul utilité (si cela est réellement utile).
3  0 
Avatar de virginieh
Membre expérimenté https://www.developpez.com
Le 29/09/2026 à 8:25
Citation Envoyé par OuftiBoy Voir le message
Est-ce étonnant ? Pas du tout, ces IA ayant était formées via des données passées, elles ne font que reproduire les mêmes schéma, c'est même leur seul but, leur seul utilité (si cela est réellement utile).
Ca avait déjà été prouvé avec des CVs que non seulement ça reprenait les biais de sélection, mais que ça avait tendance à les amplifier.
1  0