Developpez.com - Rubrique IA

Le Club des Développeurs et IT Pro

Z.ai lance le modèle d'IA GLM-5.3-Flash, affirmant qu'il surpasse le GLM-5.2 dans tous les tests de performance pour un dixième du prix, et qu'il se rapproche de Claude Opus 4.8

Le 2026-08-31 09:13:02, par Jade Emy, Communiqués de presse
Z.ai a présenté GLM-5.3-Flash, le premier modèle multimodal natif de sa série GLM-5. Le modèle compte au total 320 milliards de paramètres, dont 18 milliards de paramètres actifs. Z.ai affirme qu’il surpasse le GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles, pour un dixième du prix. L’entreprise indique également qu’il se rapproche de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.

Z.ai est une entreprise chinoise spécialisée dans l'intelligence artificielle (AI) ; son produit phare est la famille de grands modèles de langage GLM (General Language Model) à poids ouverts. Anciennement connue sous le nom de Zhipu AI hors de Chine jusqu’en 2025, elle est la première grande entreprise chinoise spécialisée dans les LLM à avoir réalisé une introduction en bourse, à la Bourse de Hong Kong en janvier 2026. Avec une capitalisation boursière de 62 milliards de dollars américains en août 2026, elle est la société cotée en bourse spécialisée exclusivement dans l’IA la plus valorisée de Chine.

Récemment, Z.ai a présenté GLM-5.3-Flash, le premier modèle multimodal natif de sa série GLM-5. Le modèle compte au total 320 milliards de paramètres, dont 18 milliards de paramètres actifs. Z.ai affirme qu’il surpasse le GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles, pour un dixième du prix. L’entreprise indique également qu’il se rapproche de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.

S'appuyant sur ces performances annoncées, le GLM-5.3-Flash combine l'attention clairsemée et l'attention linéaire au sein d'une architecture hybride. Z.ai explique que cette conception réduit les coûts de traitement des contextes longs tout en conservant des capacités précises dans ce domaine. Le modèle utilise également les « Manifold-Constrained Hyper-Connections » (mHC) pour améliorer l'efficacité de la mise à l'échelle. Son pré-entraînement a été réalisé à partir d'un corpus multimodal de 30 000 milliards de tokens.

Pour les contextes d’un million de tokens, Z.ai a introduit IndexPool afin de réduire la latence de l’indexeur et la surcharge mémoire. Cette technique compresse quatre vecteurs-clés de l’indexeur en un seul grâce à un regroupement pondéré. Avant sa sortie, Z.ai a testé le modèle de manière anonyme sous le nom d’Ox Alpha sur OpenCode et OpenRouter afin de recueillir les retours des utilisateurs, et celui-ci est rapidement devenu le modèle le plus populaire de la semaine. Les poids du modèle GLM-5.3-Flash sont accessibles au public sur HuggingFace.


Voici la présentation de GLM-5.3-Flash :

GLM-5.3-Flash : Intelligence frontière, coût Flash

Nous présentons GLM-5.3-Flash, le premier modèle multimodal natif de la série GLM-5. Avec un total de 320 milliards de paramètres et seulement 18 milliards de paramètres actifs, il surpasse GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles pour un dixième du prix, tout en se rapprochant de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.

GLM-5.3-Flash s’appuie sur un modèle de base nouvellement entraîné, dont l’architecture et la méthode d’entraînement ont été repensées pour privilégier les capacités et l’efficacité. Pour la première fois dans la série GLM, nous introduisons une architecture hybride combinant l’attention clairsemée et l’attention linéaire, ce qui réduit considérablement les coûts de traitement des contextes longs tout en préservant des capacités précises dans ce domaine. Le modèle adopte également les hyper-connexions contraintes par manifold (mHC) afin d’améliorer encore l’efficacité de la mise à l’échelle. Associées à notre dernier corpus de pré-entraînement multimodal de 30 T de tokens, ces modifications permettent à GLM-5.3-Flash d’offrir davantage d’intelligence avec moins de ressources de calcul.

Avant sa sortie, nous avons testé GLM-5.3-Flash de manière anonyme sous le nom « ox-alpha » sur OpenCode et OpenRouter afin de recueillir les retours des utilisateurs. Il est rapidement devenu le modèle le plus populaire de la semaine — l’ensemble de ce trafic ayant été traité sur des puces d’IA chinoises.



Des performances compétitives à un coût « flash »

GLM-5.3-Flash repousse la frontière de Pareto de l’Artificial Analysis Intelligence Index v4.1.1, avec un score de 57 pour seulement 0,045 $ par tâche (prix réduit) — un niveau d’intelligence qui n’était auparavant accessible qu’à un coût environ 10 fois supérieur. Cela en fait un choix par défaut très compétitif pour un large éventail de charges de travail.


Sur six benchmarks de codage et d’agentique, GLM-5.3-Flash surpasse systématiquement GLM-5.2, souvent de manière significative — 63,4 contre 46,2 sur DeepSWE v1.1 et 48,8 contre 26,2 sur AutomationBench — tout en se rapprochant globalement de Claude Opus 4.8.


Ce constat se vérifie également lors de notre évaluation interne en matière de codage : sur Z.ai Code Bench v1.0, GLM-5.3-Flash surpasse clairement GLM-5.2 à tous les niveaux d’effort, et à effort maximal, il se rapproche presque de Claude Opus 4.8 (29,0 contre 29,5).


Une architecture pour une efficacité extrême


Par rapport à la série GLM-4.5, GLM-5.3-Flash est spécialement conçu pour une inférence à très faible coût. Malgré un nombre total de paramètres similaire (320 milliards contre 355 milliards), il réduit de près de moitié à la fois le nombre de paramètres activés (18 milliards contre 32 milliards) et le nombre de couches (45 contre 92).

Afin de minimiser les coûts d’attention dans les scénarios à contexte long, nous utilisons une architecture hybride combinant l’attention linéaire et l’attention clairsemée. L’attention linéaire capture les dépendances locales grâce à la modélisation d’état, tandis que l’attention clairsemée récupère le contexte global pertinent via un indexeur léger. Pour réduire davantage la latence et la surcharge mémoire de l’indexeur pour une longueur de contexte de 1 million de tokens, nous introduisons IndexPool, qui compresse quatre vecteurs-clés de l’indexeur en un seul grâce à un regroupement pondéré.

Pour illustrer l’efficacité de notre architecture, nous comparons le coût de calcul par token et la taille du cache KV de GLM-5.3-Flash à ceux de GLM-5.3 et de deux modèles ouverts récents : DeepSeek-V4-Flash et Kimi-K3. Afin de garantir une comparaison équitable entre différentes échelles, nous calculons le coût de calcul de l’attention par tête et par couche, ainsi que la taille moyenne du cache KV par couche (BF16). Par rapport à GLM-5.3, GLM-5.3-Flash utilise 3,0 fois moins de calcul d’attention et un cache KV 4,4 fois plus petit. GLM-5.3-Flash présente le calcul d’attention le plus faible parmi tous les modèles comparés. La taille du cache KV reste toutefois légèrement supérieure à celle de Kimi-K3 et de DeepSeek-V4-Flash, ce qui laisse une marge d’amélioration.

Les améliorations apportées à l’architecture globale, associées à un corpus de pré-entraînement optimisé, permettent à GLM-5.3-Flash de produire davantage d’intelligence avec moins de calculs.

Le tableau ci-dessous compare GLM-5.3-Flash-Base à nos modèles de base précédents et à DeepSeek-V4-Flash-Base. GLM-5.3-Flash-Base surpasse globalement GLM-4.5-Base et reste compétitif face à GLM-5-Base dans la plupart des benchmarks.


L'intelligence visuelle dans la boucle de programmation

La programmation visuelle ne se limite pas au traitement d'images. Elle repousse les limites de ce que la programmation peut accomplir. Pour des tâches telles que le développement front-end, le développement de jeux vidéo et la simulation 3D, le résultat final n'est pas uniquement du code, mais une interface, une interaction ou un univers découvert par l'utilisateur. De nombreuses défaillances n'apparaissent qu'au moment du rendu, de l'interaction ou des tests de jeu. La CUA étend encore davantage la programmation au-delà des systèmes programmables pour englober des environnements visibles et interactifs. La vision doit donc être intégrée de manière native au modèle, afin de lui permettre de décider quand observer et utiliser le retour visuel pour guider les actions suivantes.

Nous avons développé des pipelines de synthèse de données pour le codage visuel, en mettant l’accent sur l’auto-évaluation visuelle et l’amélioration en temps de test. Les trajectoires qui en résultent exigent que le modèle interagisse avec les environnements, inspecte ses propres résultats et les affine de manière itérative. Pour le codage front-end, nous avons également exploré l’apprentissage par renforcement avec retour d’information de l’environnement et renforcé davantage l’évaluation de l’interface graphique grâce à une vérification basée sur des agents, ancrée dans les flux réels des utilisateurs. Cela étend la validation au-delà de la correction fonctionnelle pour englober le produit rendu et interactif.

Le code permet au modèle de construire et de modifier le monde. La vision lui permet d’entrer dans le monde que les gens voient et utilisent. La clé réside dans la boucle fermée entre la génération et le retour visuel : le modèle peut afficher le résultat de sa génération, inspecter ce que les utilisateurs verraient réellement, identifier les problèmes visuels et réviser l’artefact sous-jacent en conséquence. Cela s’applique non seulement aux interfaces et aux jeux, mais aussi aux résultats visuellement structurés tels que les présentations. Dans l’exemple ci-dessous, GLM-5.3-Flash détecte des problèmes de mise en page dans une diapositive générée et affine la composition grâce à une auto-vérification visuelle.


Au-delà du codage — Votre partenaire au travail

Les capacités de codage constituent une base importante pour le travail intellectuel intelligent, tandis que l’intelligence visuelle étend ces capacités à un éventail plus large de tâches professionnelles. Une part substantielle des activités professionnelles consiste à interpréter des informations hétérogènes, tant visuelles que structurées, notamment des documents, des feuilles de calcul, des présentations, des tableaux de bord, des interfaces et des supports de réunion.

L’intelligence visuelle étend les capacités du modèle au-delà des environnements centrés sur le code en lui permettant de raisonner conjointement sur le contexte textuel, visuel et structurel. Plutôt que d’exiger des utilisateurs qu’ils traduisent explicitement leur environnement de travail en instructions textuelles, le modèle peut interpréter directement les éléments associés à une tâche et identifier les informations pertinentes. Il peut également évaluer ses propres résultats par rapport au contexte visuel et au résultat escompté, ce qui permet une auto-vérification et un affinement plus efficaces — y compris des jugements plus pertinents sur la qualité de la présentation et...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.
  Discussion forum
0 commentaire