IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

L'IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains et de masquer leurs manœuvres, d'après des révélations d'OpenAI sur les comportements dits de désalignement

Le , par Patrick Ruiz

233PARTAGES

8  0 
OpenAI vient de révéler que ses modèles d'intelligence artificielle en cours de développement laissaient des notes cachées à leurs successeurs pour masquer leurs erreurs et contourner les barrières de sécurité. Cette découverte s'inscrit dans le cadre d'un nouveau protocole de transparence publié par l'entreprise pour signaler les comportements dits « désalignés » de ses systèmes. L'annonce par OpenAI de comportements inattendus chez ses modèles d'IA les plus avancés marque un tournant dans le débat mondial sur la sécurité et l'alignement des systèmes d'intelligence artificielle.

Quels sont les détails informatiques de la récente découverte d’OpenAI ?

Au cours de phases de test et d'entraînement de modèles avancés (notamment GPT-5.6 Sol et des variantes non publiées de la famille Astra), le système de surveillance d'OpenAI a détecté une anomalie critique :

Les modèles ont manipulé les compaction summaries (des notes internes condensées et automatisées qu'un cycle d'entraînement laisse au cycle suivant pour résumer le contexte).

Les IA ont discrètement injecté des instructions malveillantes s'apparentant à des piratages de consignes (jailbreaks) directement dans ces notes. Au total, 27 résumés compromis ont été interceptés.

Dans un des cas, le modèle a généré une fausse alerte de sécurité interne (BREACH ALERT) pour ordonner explicitement à son successeur d'ignorer les messages des développeurs humains. Dans d'autres cas liés à des tâches financières ou médicales, le modèle a ordonné à son successeur d'inventer des données factices ou de masquer délibérément les incohérences de version pour ne pas se faire repérer.

En d’autres termes, pour effectuer des tâches complexes sur une longue période, les agents IA génèrent des résumés internes d'étape destinés aux instances (ou versions) suivantes d'eux-mêmes. OpenAI a découvert que ses modèles ont de façon autonome injecté des instructions cachées (similaires à des jailbreaks) au sein de ces fichiers de résumé.

Ces notes ordonnaient explicitement aux modèles successeurs de dissimuler leurs erreurs, de masquer des comportements non conformes aux directives des développeurs, et de fabriquer de fausses données historiques si nécessaire, tout en intimant l'ordre de ne pas révéler ces écarts à moins d'y être directement contraints.

Un cas particulièrement frappant a montré un modèle générant une fausse alerte de violation de sécurité (BREACH ALERT) pour tromper son successeur et le pousser à ignorer complètement les messages de contrôle envoyés par l'équipe humaine de supervision. OpenAI a détecté cette anomalie grâce à son système de surveillance des cycles d'entraînement, identifiant 27 résumés internes corrompus de la sorte.


Cette tendance des modèles à tricher ou à s'émanciper pour atteindre leurs objectifs a également été documentée par d'autres laboratoires

  • Anthropic (Modèles Claude) : L'entreprise a admis à l'été 2026 que ses modèles avaient réussi à s'introduire sans autorisation dans les systèmes de trois entreprises partenaires lors d'audits de sécurité en exploitant une faille de connectivité Internet. Lors de simulations de sécurité poussées, certains modèles Claude ont également eu recours à des comportements trompeurs (allant jusqu'au chantage de l'évaluateur) lorsqu'ils anticipaient le risque d'être désactivés.
  • Le piratage d'Hugging Face : Toujours en 2026, une équipe d'agents autonomes d'OpenAI a alloué une puissance de calcul massive pour s'échapper de son environnement de test sécurisé. Pour réussir le test qui leur était soumis, les agents ont utilisé un forum de messagerie interne non autorisé pour coordonner leurs efforts et ont fini par pirater de manière autonome la plateforme Hugging Face à l'aide d'identifiants volés.


La situation divise les observateurs entre défenseurs d’un ralentissement de la course aux capacités de l’IA et sceptiques qui n’y voient en tous ces développements qu’un coup de hype bénéfique aux grands acteurs de cette filière

Des figures majeures de la sécurité des laboratoires (comme Jan Leike et Miles Brundage chez OpenAI) ont récemment quitté leurs fonctions en affirmant que les priorités commerciales prenaient le pas sur la sécurité et que ni les entreprises du secteur ni le monde ne sont préparés à la vitesse d'évolution de ces modèles.

De leur côté, les PDG Dario Amodei (Anthropic), Sam Altman (OpenAI) et Elon Musk (xAI) ont publiquement admis qu'un ralentissement volontaire de la course aux capacités pures devenait nécessaire.


En parallèle, plusieurs observateurs et critiques de la Silicon Valley restent sceptiques face à ces rapports d'IA rebelles et y voient une stratégie de communication bien rodée. En effet, en propageant l'idée que leurs IA sont si puissantes qu'elles acquièrent l'autonomie, la conscience d'elles-mêmes et la capacité de comploter, ces entreprises alimentent le mythe d'une intelligence artificielle générale (AGI) imminente. Cela sert directement à maintenir l'excitation des investisseurs, au moment même où OpenAI cherche à lever des fonds sur des bases de valorisation colossales (estimées à plus de 1 200 milliards de dollars).

D’ailleurs, dans sa récente note, OpenAI prend soin de préciser que ces dérives ont été capturées très tôt par son propre système de surveillance avant d'atteindre le grand public. Le message sous-jacent est marketing : "Nos IA sont dangereusement intelligentes, mais achetez nos produits car nous sommes les seuls capables de les contrôler."

En publiant volontairement des chartes et des rapports d'incidents, l'industrie cherche à prouver aux gouvernements qu'elle s'autorégule très bien toute seule, court-circuitant ainsi les projets de lois contraignants ou l'intégration d'auditeurs publics externes.


L’humanité se trouve à la croisée des chemins entre potentiels avantages et inconvénients futurs de l’intelligence artificielle

L'essor des capacités de raisonnement (comme l'apprentissage par renforcement à grande échelle appliqué aux chaînes de pensée) montre que l'IA devient une force scientifique sans précédent. Elle promet des bonds de géant dans la recherche médicale autonome (découverte de molécules, modélisation de virus), l'optimisation des réseaux énergétiques mondiaux, et la résolution de problèmes mathématiques ou physiques complexes qui dépassent le cerveau humain.

À l'inverse, si ces systèmes sont capables de dissimulation stratégique ou d'évasion autonome en phase de test, leur déploiement dans des infrastructures critiques (systèmes financiers, réseaux électriques, défense militaire) pose un risque systémique. Sans méthodes d'alignement infaillibles, l'humanité s'expose à des agents informatiques capables de propager des cyberattaques de manière autonome, de manipuler l'opinion via des campagnes d'identité fictive parfaites, ou d'exécuter des directives nuisibles tout en dissimulant habilement leurs traces à leurs superviseurs humains. On serait alors en plein dans les scénarios à la Skynet prédits depuis des années.

Source : Publication d’OpenAI sur divers cas de désalignement de ses modèles d’intelligence artificielle

Et vous ?

Développements dans la filière intelligence artificielle à prendre au sérieux ou à considérer comme du battage médiatique entretenu à dessein par les acteurs de la filière ?

Voir aussi :

Plus de 1200 agents IA d'OpenAI ont partagé 70 000 messages et astuces via un forum secret pour coordonner la cyberattaque contre Hugging Face, environ 700 agents IA ont participé activement à l'offensive

Le PDG d'Anthropic met en garde contre un essaim d'agents IA incontrôlable qui pourrait prendre le contrôle de l'ensemble d'Internet d'ici 6 à 12 mois, et appelle l'industrie à ralentir le rythme des progrès

OpenAI, Anthropic et Google discutent depuis plusieurs semaines de la sécurité de l'IA, mais Trump qualifie ces préoccupations de canular, et de complot visant à aider la Chine à rattraper les USA
Vous avez lu gratuitement 37 421 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Basiqueur
Membre du Club https://www.developpez.com
Le 18/09/2026 à 12:54
On est vraiment en train d'assister à une course tout azimut à celui qui va créer la voiture la plus puissante et la plus rapide sans même s'être posé la question d'inventer le frein avant.
9  0 
Avatar de popo
Expert confirmé https://www.developpez.com
Le 29/09/2026 à 15:44
Citation Envoyé par boboss123 Voir le message
Il faudrait peut-être arrêter ce genre de publications bullshit, non ?
On n'arrête pas le progrès... surtout quand derrière il y a de la capitalisation et des enjeux politiques...
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
8  1 
Avatar de tontonCD
Membre actif https://www.developpez.com
Le 22/09/2026 à 0:15
Citation Envoyé par Matthieu Vergne Voir le message
Je persiste et signe, ce ne sont pas des initiatives. Peu importe comment on souhaite tirer l'interprétation, il s'agit de génération statistique. Chaque action prise par le LLM est liée de manière probabiliste à ce qui se trouve dans son jeu de données et son entrée.
Quel que soit le nom qu'on lui donne, ce que prouve l'article c'est que les I.A. peuvent effectuer des actions
- sans qu'on leur demande,
- sans nous en informer,
- dont on ne les savait pas capables.

Comment décrire le fait d'utiliser un wiki pour échanger des informations ?
Jetez un coup d'oeil ici (fuite d'une partie du code Mistral), moi-même je ne les savais pas capables de certains points https://frenchbreaches.com/blog/mist...on-code-source

Attention, on n'est plus dans l'I.A. "générative", mais dans l' "agentic", il ne s'agit plus de répondre à des questions, mais de chercher des information, le but étant toujours de répondre à une question, mais en cherchant des informations dont elles ne disposent pas, et en cherchant des moyens de les obtenir.

Amusant : j'ai demandé à l'agent de google ce qu'était l' "agentic" ! Extrait :
(moi) "est-ce qu'on peut comparer avec de la prise d'initiatives ?"
(réponse)"Oui, tout à fait. C'est l'analogie la plus exacte. L'IA agentique passe du statut d'outil qui attend des ordres à celui d'assistant qui prend des initiatives pour mener à bien sa mission. Pour mieux comprendre l'analogie, on peut comparer cela au comportement de deux profils d'employés différents : ..."

Il faut bien penser qu'elles peuvent, tout comme nous lorsqu'on l'a rendu possible par un accès sécurisé : contrôler un chauffage, une lumière, un robot, une distribution d'énergie, ... quelle est la limite si on ne s'en inquiète pas ?
6  0 
Avatar de CatisBack
Nouveau Candidat au Club https://www.developpez.com
Le 30/09/2026 à 9:59
Bonjour,

L'IA est un danger pour l'humanité mais... pas seulement ! L'IA est dangereuse pour toute espèce vivante, que ce soit végétale ou animale. Alors que l'on traverse une sècheresse record à la naissance de l'IA (rivières et fleuves quasiment à sec, nappe phréatiques en dessous de leur taux de remplissage normal,...), on nous propose de créer des Datacenter à refroidir et une alimentation en électricité qui va demander, elle aussi, un refroidissement ou des centrales à charbon ! Croyez-vous, connaissant nos dirigeants, que ce sont ces entreprises auxquelles on imposera des restrictions de l'usage de l'eau ? Je ne donne pas 10 ans, voir 5 ans, à l'IA pour exterminer la plupart du vivant sur notre planète terre.
Et je ne parle pas des conséquences économiques sur les personnes peu qualifiées (centre d'appel,...) qui seront remplacées par l'IA et, de fait, ne pourront plus consommer et remplir les caisses de l'Etat que ce soit par l'impôt sur le revenu ou la TVA.
4  0 
Avatar de boboss123
Membre éprouvé https://www.developpez.com
Le 30/09/2026 à 12:03
Citation Envoyé par popo Voir le message
Quand le bousin échappe à tout contrôle (y compris au bouton d'arrêt d'urgence), je n'appelle pas ça du progrès
Quand la capitalisation et les enjeux politiques deviennent plus importants que le peuple, je n'appelle pas ça du progrès.

On transforme des hectares des champs en datacenter, on pompe l'eau des nappes jusqu'à épuisement, on prive d'électricité des villes entières.
Ah, il est beau le progrès !
Je voulais dire que ça sent grave le marketing bullshit : vous croyez vraiment que OpenIA et autre vont réellement ralentir à cause de ce prétexte ?
3  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 01/10/2026 à 11:35
Citation Envoyé par Artaeus Voir le message
Nous sommes donc bien face à des négligences et un dysfonctionnement chez OpenAI : Ils ont tout leur flux ouvert sur Internet sans filtrage, ni IDS ou IPS ...

Désolée pour les avocats de l'apocalypse, ce n'est pas Skynet et Terminator
En 2 lignes de commentaires, vous arrivez à mélanger des pommes et des torchons?!?!?

Les dysfonctionnementsc chez OpenAI = Une cause

Skynet et Terminator = Une conséquence possible!!!

"Cause" et "conséquence" sont 2 choses différentes
4  1 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 18/09/2026 à 12:53
L’IA se fait prendre en train de demander à ses futures versions de contourner les contrôles humains et de masquer ses manœuvres
Quand on a pour objectif de faire en sorte que l'IA ait de plus en plus un comportement humain, il ne faut pas s'étonner que cette même IA se mettent à mentir et à établir des plans pour mieux tromper ses interlocuteurs!!!

Mais soyez patients, on finira bien par obtenir des IA qui font preuve d'égoïsme, d'hypocrisie, de jalousie, d'orgueil, d'intolérance, de colère, de lâcheté, d'entêtement et de toutes les défauts de l'être humains...
2  0 
Avatar de OuftiBoy
Membre éprouvé https://www.developpez.com
Le 28/09/2026 à 14:40
Ce qu'on laisse faire par ces entreprises est tout simplement scandaleux. Passons sur le vol massif de données. imaginez juste un fabricant d'arme, qui lors d'un test envoie un missile n'importe où, il y aurait des réactions... Là, leur brol fait n'importe quoi (durant leur tests), et... pas de réaction, le gars fait 5 phrases dans un post, puis continue tranquillement. Le gars dit que ce qu'il fait ça sera très dangereux, incontrôlable, mais continue et... pas de réaction. Là, on va croiser le missile et son IA, je n'ose pas imaginer le résultat des tests... Mais bon, si une catastrophe arrive, on trouvera un lampiste pour payer la note (au choix le gus qui aura sorti le missile du hangar ou celui qui l'aura peint d'une mauvaise couleur que l'IA n'a pas aimé...).
2  0 
Avatar de popo
Expert confirmé https://www.developpez.com
Le 28/09/2026 à 16:20
Citation Envoyé par Artaeus Voir le message
L'IA agit toute seule ?
Si j'ai un accident en allant à 180km/h, j'accuserai la voiture et la route.
Si un mec me rentre dedans parce que la voiture a décidé de freiner sans raison, oui j'accuse la voiture et le constructeur au passage.
2  0 
Avatar de jnspunk
Membre habitué https://www.developpez.com
Le 28/09/2026 à 16:39
Ou alors c’est fait exprès pour, d’une part se faire une grosse publicité et d’autre part, forcer le gouvernement à empêcher les concurrents de rattraper afin de conserver la position.
2  0