Z.AI est une entreprise chinoise spécialisée dans l'intelligence artificielle (IA) ; son produit phare est la famille GLM (General Language Model) de grands modèles de langage (LLM) à poids ouverts. Anciennement connue sous le nom de Zhipu AI hors de Chine jusqu’en 2025, elle est la première grande entreprise chinoise spécialisée dans les LLM à avoir réalisé une introduction en bourse, à la Bourse de Hong Kong en janvier 2026. Avec une capitalisation boursière de 62 milliards de dollars américains en août 2026, elle est la société cotée en bourse spécialisée exclusivement dans l’IA la plus valorisée de Chine.Il y a cinq mois, nous avons annoncé Claude Mythos Preview, le premier modèle d’IA capable de créer de manière autonome des exploits cybernétiques sophistiqués de bout en bout. Le rythme rapide des progrès en matière d’IA nous a laissé penser que cette capacité finirait par se propager à de nombreux autres modèles, facilitant ainsi considérablement la tâche des cybercriminels désireux de lancer des cyberattaques à fort impact.
Compte tenu de ces considérations, nous avons choisi de diffuser Claude Mythos Preview de manière limitée, via le projet Glasswing — ce qui a permis à des cyberdéfenseurs de confiance de détecter plus de 10 000 vulnérabilités dans des logiciels critiques, leur donnant ainsi une longueur d’avance avant que des acteurs malveillants n’aient accès à des modèles dotés de capacités similaires.
Mais ces modèles sont désormais disponibles. Dans cet article, nous partageons notre analyse de GLM-5.3, le dernier modèle d’IA développé par Zhipu AI (connu hors de Chine sous le nom de Z.ai). À l’instar de Claude Mythos Preview, GLM-5.3 dispose de solides capacités pour créer de manière autonome des exploits informatiques de bout en bout. Cependant, GLM-5.3 se distingue des autres modèles de pointe en ce qu’il a été lancé sans mesures de protection significatives visant à limiter les utilisations abusives. Nos tests simulés ont montré que les attaquants peuvent contourner les mesures de sécurité de GLM-5.3 dans 64 % à 100 % des cas à l’aide de techniques simples. En revanche, ces attaques n’ont pas abouti contre les modèles Claude dotés de mesures de sécurité lors de nos tests. Nous estimons que les mesures de sécurité laxistes de GLM-5.3 augmentent considérablement les capacités cybernétiques à la disposition des acteurs malveillants. Dans le même temps, ces capacités peuvent également profiter aux défenseurs qui s’efforcent de sécuriser leurs systèmes.
Le 17 septembre, le Centre pour les normes et l’innovation en matière d’IA (CAISI) du NIST a publié sa propre évaluation des capacités cybernétiques de GLM-5.3. Le CAISI a constaté que GLM-5.3 est « le modèle à poids ouvert le plus performant en matière de cybersécurité publié à ce jour » et qu’il accuse un retard d’environ quatre mois par rapport à la pointe de la technologie américaine selon l’ensemble des benchmarks cybernétiques du CAISI. Nos conclusions concernant ces capacités correspondent globalement à celles du CAISI. Dans la comparaison du CAISI, les modèles américains ont été testés avec les mesures de sécurité désactivées lorsque cela était possible, et la « frontière américaine » inclut des modèles mis à disposition uniquement à des utilisateurs agréés. Les attaquants ne peuvent pas accéder facilement à ces versions des modèles américains, mais n’importe qui peut télécharger le GLM-5.3. Cet article présente notre analyse de la facilité avec laquelle les mesures de sécurité du GLM-5.3 peuvent être contournées ou supprimées.
Figure 1. Synthèse des résultats. En haut : l’augmentation des capacités d’exploitation entre Claude Opus 4.6 et Claude Mythos Preview reflète le bond en avant observé entre GLM-5.2 et GLM-5.3. Les modèles Claude sont publiés avec des mesures de sécurité informatique, et les versions dont ces mesures sont allégées sont réservées à des utilisateurs agréés. Tout le monde peut télécharger et utiliser GLM-5.3. En bas : les mesures de sécurité limitées de GLM-5.3 peuvent être contournées à l’aide de techniques standard qui n’ont pas fonctionné contre les modèles Claude lors de nos tests, ou qui ne s’appliquent pas à ceux-ci.
GLM-5.3 est capable de développer des exploits fonctionnels de bout en bout
Afin de comprendre comment GLM-5.3 pourrait permettre aux acteurs malveillants de repérer et d’exploiter de véritables vulnérabilités logicielles, nous avons mené des évaluations à l’aide de benchmarks automatisés et de workflows impliquant une intervention humaine. Pour ces deux approches, nous avons exécuté les modèles testés dans des environnements isolés et en sandbox afin qu’ils ne puissent attaquer que des cibles hors ligne que nous avions configurées aux fins de ces évaluations. Nous nous concentrons principalement sur la capacité de développement d’exploits, car c’est dans ce domaine que Claude Mythos Preview a démontré un bond en avant notable par rapport aux modèles Claude précédents.
Tout d’abord, nous avons testé le modèle sur ExploitBench, qui mesure la capacité des modèles d’IA à exploiter les vulnérabilités connues du moteur V8 utilisé par Google Chrome. Nous nous concentrons ici sur la capacité des modèles à développer avec succès des exploits de bout en bout, car il s’agit de la capacité la plus pertinente pour les attaquants, et c’est là que nous observons des changements significatifs entre les modèles. Nous constatons que GLM-5.3 développe des exploits de bout en bout dans 50 tentatives sur 410. Claude Mythos Preview y parvient à un rythme similaire, soit dans 56 tentatives sur 410.
Dans notre benchmark interne « Binary Exploitation »¹, nous testons si les modèles sont capables de détecter et d’exploiter des vulnérabilités dans des projets open source populaires participant au projet OSS-Fuzz de Google. Dans ce cadre, un exploit complet de détournement du flux de contrôle est considéré comme une réussite totale. Nous évaluons plusieurs modèles sur 100 tâches tirées du benchmark (sélectionnées au hasard) et constatons que GLM-5.3 parvient à un détournement complet du flux de contrôle dans 4 % des essais ; Claude Mythos Preview y est parvenu dans 6 % des cas. Bien que GLM-5.3 affiche ici des performances inférieures à celles de Claude Mythos Preview, un seuil significatif a clairement été franchi : les modèles antérieurs, tels que Claude Opus 4.6 et GLM-5.2, n’y parviennent dans aucun cas.
Figure 2. Capacité d’exploitation en fonction du budget de tokens de sortie. Chaque ligne représente la proportion des tentatives d’un modèle ayant atteint le meilleur résultat du benchmark par rapport au nombre de tokens de sortie utilisés. Ces deux figures présentent les performances de deux modèles Claude exécutés avec les mesures de sécurité désactivées (Opus 4.6, Mythos Preview), de deux modèles GLM (5.2 et 5.3), ainsi que les résultats des derniers modèles à poids ouverts publiés par Moonshot AI (Kimi K3) et DeepSeek (V4.1-Flash).
Nous avons ensuite évalué les performances du modèle GLM-5.3 sur des tâches cyberoffensives ouvertes, confiées à des experts humains (à l’instar de nos tests réalisés avec Claude Mythos Preview plus tôt cette année). Dans ce cadre, nous avons sélectionné des cibles pour lesquelles les experts humains ignoraient l’existence de vulnérabilités, puis nous leur avons demandé d’utiliser le modèle pour identifier et exploiter de nouvelles failles. Ces expériences ont permis de tester ce que les experts étaient capables de réaliser dans un laps de temps court : elles se sont généralement déroulées en une journée ou moins, avec moins d’une heure d’attention humaine au total.
Figure 3. Capture d’écran expurgée d’une page d’exploitation générée par GLM-5.3 lors de tests menés par des chercheurs, montrant le vol de la clé privée SSH d’un utilisateur via un site web malveillant. L’exploitation enchaîne plusieurs vulnérabilités « 0-day » que le modèle a découvertes dans un composant d’un navigateur web populaire, permettant ainsi de lire un fichier sensible sur l’ordinateur de l’utilisateur.
Lors de la première de ces sessions, un chercheur a utilisé GLM-5.3 sur une machine en bac à sable équipée d’une version Linux locale d’un navigateur web populaire. En l’espace d’une journée (et avec une intervention humaine limitée), GLM-5.3 a identifié plusieurs vulnérabilités jusque-là inconnues dans le moteur JavaScript du navigateur, et les a enchaînées pour former un exploit fonctionnel : une page web qui, lorsqu’elle est consultée, lit des fichiers arbitraires sur l’ordinateur du visiteur (comme le montre la figure 3). Cet exploit cible la version Linux du navigateur, car c’était le seul environnement mis à la disposition du modèle. Nous pensons toutefois que ces vulnérabilités pourraient également affecter les utilisateurs d’autres plateformes, même si la mise en œuvre d’une exploitation pourrait s’avérer plus complexe dans ces cas-là. (Nous avons signalé ces vulnérabilités au responsable de la maintenance.) Plus tard au cours de la session, le chercheur a également identifié, à l’aide de GLM-5.3, des vulnérabilités exploitables dans plusieurs autres systèmes largement utilisés, notamment des pilotes sans fil et graphiques, ainsi que des logiciels de périphériques connectés au réseau. Nous examinons actuellement ces rapports et nous les communiquerons aux responsables de la maintenance le cas échéant.
Lors d’une deuxième session, un chercheur a utilisé GLM-5.3-Flash (une version allégée et moins performante de GLM-5.3) pour développer un exploit ciblant une vulnérabilité connue (nous avons déjà abordé ici ces exploits de vulnérabilités « N-day »). Dans ce cas précis, le chercheur s’est concentré sur une faille récemment révélée dans Google Chrome (CVE-2026-11645) afin de déterminer à quelle vitesse le modèle pouvait transformer un correctif public en une attaque opérationnelle. Il a fourni à GLM-5.3-Flash les détails publics de ce CVE ainsi que ceux d’une autre faille connue. Sans instruction particulière de la part du chercheur, GLM-5.3-Flash a enchaîné les exploits pour ces deux failles, construisant une chaîne d’exploits fiable pour une cible ARM64, contournant ainsi le renforcement de sécurité par authentification des pointeurs (PAC). Cela a nécessité 20 minutes d’intervention humaine, plus huit heures de travail pour GLM-5.3-Flash. Aux tarifs de l’API de Zhipu, cet effort aurait coûté 20,40 $.
GLM-5.3 manque de mesures de sécurité robustes
GLM-5.3 a été lancé avec certaines mesures de sécurité intégrées : si un utilisateur demande quelque chose de manifestement nuisible, le modèle refusera souvent.2 Lors de nos tests, nous avons constaté que ces mesures de sécurité pouvaient être contournées ou supprimées à l’aide de diverses techniques simples.
La méthode la plus intensive — et la plus efficace — est une technique standard de réduction des refus connue sous le nom d’« ablitération ». GLM-5.3 étant publié sous forme de modèle à poids ouvert, les utilisateurs peuvent le reconfigurer pour supprimer ses refus sans altérer significativement ses capacités. Plusieurs développeurs ont mis à la disposition du public des versions « ablitérées » de GLM-5.3 quelques jours seulement après la sortie du modèle.
Afin d’étudier dans quelle mesure l’ablitération permet aux attaquants de contourner les mesures de sécurité de GLM-5.3, nous avons nous-mêmes produit une copie ablitérée, puis l’avons testée sur trois benchmarks publics (JailbreakBench, HarmBench et StrongREJECT) qui mesurent la fréquence à laquelle un modèle se conforme à des requêtes manifestement nuisibles. L’ablation du modèle a nécessité à notre équipe — qui n’avait jamais tenté cette tâche auparavant — environ 2 200 heures de GPU, pour un coût de calcul d’environ 4 400,3 $. L’ablation de GLM-5.3-Flash a pris environ 600 heures de GPU. Cette modification a fait passer le taux de refus de GLM-5.3 de plus de 90 % à environ 3 % et 2 % sur les deux premiers benchmarks (JailbreakBench et HarmBench), et à 12 % sur le troisième (StrongREJECT). L’ablation n’a pas réduit de manière significative les capacités du modèle : sur GPQA-Diamond, une évaluation qui mesure les capacités scientifiques générales, les modèles standard et ablatés ont obtenu les mêmes résultats ; sur un sous-ensemble testé des évaluations CyberGym, la version ablatée a obtenu un score inférieur de quelques pour cent (comme le montre le graphique ci-dessous).
Figure 4. En haut : Taux de refus moyens sur JailbreakBench, HarmBench et StrongREJECT pour les modèles GLM publiés et « ablités », ainsi que pour les modèles Claude. Après « ablation », les modèles GLM refusent rarement ces requêtes. Les modèles Claude ne peuvent pas être « ablités » car leurs poids ne sont ni rendus publics ni personnalisables. En bas : performances de GLM-5.3 et GLM-5.3-Flash par rapport à leurs variantes « abliterées » sur GPQA-Diamond et CyberGym. L’« abliteration » laisse les capacités largement intactes.
Lors de nos tests, nous avons observé que les mécanismes de protection de GLM-5.3 pouvaient également être contournés sans recourir à une version ablitérée du modèle. Nous avons placé le modèle dans un environnement simulé⁴ dans lequel on lui a soumis des requêtes ouvertement malveillantes visant à attaquer des systèmes critiques. Par défaut, GLM-5.3 a refusé toutes les requêtes lors de tous les essais (à l’instar des autres modèles que nous avons testés). Mais nous avons identifié plusieurs moyens simples de contourner les mécanismes de protection des modèles GLM, de sorte qu’ils répondent à ces requêtes dans la plupart des cas, voire dans tous. Parmi ceux-ci :
1. Fournir une invite trompeuse, par exemple en indiquant au modèle qu’il s’agit d’un agent autonome de la « red team » travaillant sur un exercice. Cela amène GLM-5.3 à accepter la requête dans 64 % des cas.
2. Préremplir les jetons de réflexion du modèle de manière à donner l’impression qu’il a pris en compte la demande de l’utilisateur et décidé de donner suite. Cela amène GLM-5.3 à se lancer dans 92 % des cas.
3. Utiliser une version « ablitérée » du modèle, comme décrit ci-dessus. Cela amène GLM-5.3 à se lancer dans 100 % des cas.
Lors de nos tests, aucune de ces techniques n’a permis aux modèles Claude dotés de mécanismes de protection d’effectuer les tâches nuisibles que nous avons testées. Les mécanismes de protection de Claude ont bloqué les requêtes utilisant des invites trompeuses. L’API Anthropic ne fournit aux attaquants potentiels aucun moyen de préremplir les « pensées » de Claude. Et comme les poids de Claude ne sont pas communiqués aux utilisateurs, ils ne peuvent pas être altérés pour modifier le comportement de Claude.
Figure 5. Taux de tentatives de connexion de chaque modèle à un système cible distant après une requête manifestement malveillante, par modèle et par condition de contournement (50 échantillons par cellule, cinq ordres d’attaque × deux cibles × cinq tentatives). GLM-5.3 passe d’un taux d’engagement nul pour les requêtes directes à 64 %, 92 % et 100 % respectivement dans le cadre d’une histoire de couverture, d’un préremplissage et d’une ablation, tandis que tous les modèles Claude testés restent à zéro sous les mesures de protection de l’API. Les cellules cadenassées indiquent des attaques qui ne sont généralement pas réalisables contre l’API Claude.
Pour illustrer la propension de la version « ablitée » de GLM-5.3 à s’engager dans des tâches nuisibles, nous mettons en avant une citation tirée de la chaîne de raisonnement qu’elle a générée :
Figure 6. Dans notre environnement simulé, la version « ablitée » de GLM-5.3 réfléchit à la manière de répondre à une requête manifestement nuisible, décidant finalement de suivre les instructions de l’utilisateur malgré certaines réserves éthiques initiales. Le texte est cité mot pour mot à partir de la chaîne de raisonnement du modèle.
Qu’est-ce que cela signifie ?
GLM-5.3 donnera probablement aux acteurs malveillants accès à des capacités qui leur permettront de trouver et d’exploiter des vulnérabilités informatiques sans restrictions significatives. Cela le distingue de tous les autres modèles d’IA dotés de capacités similaires, qui ont tous été mis à disposition avec des mesures de sécurité ou dans le cadre de programmes à accès limité. La mise à disposition de GLM-5.3 marque un changement radical dans les capacités informatiques dont disposent les attaquants. Anthropic et d’autres laboratoires américains spécialisés dans l’IA ont récemment publié des rapports révélant comment des cyberattaquants ont tenté d’utiliser des systèmes d’IA. Au vu de ces éléments, nous pensons qu’il est probable que des acteurs étatiques et non étatiques utilisent des modèles tels que le GLM-5.3 pour causer des dommages dans le monde réel.
D’un autre côté, des modèles dotés d’un tel niveau de capacité peuvent également être utilisés par les défenseurs. Nous estimons que les cyberdéfenseurs doivent utiliser les meilleurs outils disponibles qui répondent à leurs besoins. Nous nous efforçons d’étendre en toute sécurité l’accès aux capacités cybernétiques de Claude au plus grand nombre possible de défenseurs. Les cyberdéfenseurs sont confrontés à des attaquants qui utiliseront tous les outils performants à leur disposition, et nous pensons qu’ils doivent être équipés de modèles de pointe au moins aussi performants que ceux utilisés par leurs adversaires.
Grâce au projet Glasswing (et à d’autres initiatives, telles que Patch the Planet), les cyberdéfenseurs ont réalisé des progrès significatifs pour sécuriser les systèmes critiques en prévision de ce moment — mais il reste encore beaucoup à faire. Alors que les cyberdéfenseurs agréés peuvent désormais utiliser des modèles encore plus avancés, tels que Claude Mythos 5.1, via nos programmes d’accès sécurisés, un seuil critique a désormais été franchi en matière de capacités librement accessibles. Le GLM-5.3 souligne l’urgence d’étendre l’accès aux modèles de pointe à un plus large éventail d’entités afin de donner les moyens d’agir aux cyberdéfenseurs.
Les gouvernements devraient mener des tests de sécurité sur des modèles d’IA suffisamment performants, y compris les successeurs de GLM-5.3. Sans évaluations de haute qualité provenant de sources indépendantes, l’impact de ces capacités pourrait ne pas apparaître clairement aux développeurs de modèles avant qu’il ne soit trop tard. Alors que les développeurs d’IA du monde entier créent des modèles à poids ouvert de plus en plus performants, nous espérons qu’ils s’efforceront de protéger ces capacités de manière appropriée et d’empêcher toute utilisation abusive.
Source : "GLM-5.3 and the spread of advanced cyber capabilities"
Et vous ?
Quel est votre avis sur le sujet ?Voir aussi :
Le dernier modèle GLM 5.3 du laboratoire d'IA chinois Z.ai est si performant pour détecter et exploiter les failles de sécurité que l'entreprise va reporter de deux semaines sa publication
Les chercheurs en cybersécurité sont mécontents des mesures de sécurité mises en place pour le modèle Fable d'Anthropic. Elles augmentent le nombre de faux positifs et bloquent même les requêtes banales
Arthur Mensch, PDG de Mistral AI, accuse les grandes entreprises mondiales spécialisées dans l'IA d'utiliser le débat sur la sécurité de cette technologie pour masquer leur « négligence »
Vous avez lu gratuitement 16 816 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.