IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Alibaba Cloud lance Qwen3.8-Flash-Next, un modèle d'IA multimodal doté d'une nouvelle architecture et offrant un meilleur rapport coût-efficacité

Le , par Anthony

156PARTAGES

3  0 
Alibaba Cloud a lancé Qwen3.8-Flash-Next, un modèle d'intelligence artificielle (IA) multimodal de type « mixture-of-experts », offrant un premier aperçu de l'architecture de la future famille Qwen4. Cette refonte architecturale porte à la fois sur le mécanisme d'attention, les connexions résiduelles, l’intégration et l’optimisation. Qwen3.8-Flash-Next dispose d'un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires, dont seuls 6 milliards sont activés par token. Alibaba revendique de meilleurs résultats en matière de codage et dans les tâches bureautiques par rapport à Qwen3.7-Plus, pour un coût d'entraînement environ neuf fois moindre, avec un contexte s'étendant jusqu'à 1 million de tokens via YaRN.

Alibaba Cloud est une entreprise de cloud computing, filiale du groupe Alibaba. Alibaba Cloud fournit des services de cloud computing aux entreprises en ligne et à l'écosystème de commerce électronique d'Alibaba. Elle propose des services cloud disponibles selon un modèle de paiement à l'utilisation, notamment des ressources de calcul élastiques, le stockage de données, des bases de données relationnelles, le traitement du Big Data, la protection contre les attaques DDoS et des réseaux de diffusion de contenu (CDN).

Qwen (également connu sous le nom de Tongyi Qianwen) est une famille de grands et petits modèles de langage (LLM et SLM), pour la plupart open source, développée par Alibaba Cloud. La première version de Qwen, basée sur Llama 1 de Meta AI, a été lancée en version bêta en avril 2023, et les poids de son modèle 72B ont été rendus publics en décembre de la même année. Début août 2026, Alibaba a lancé Qwen 3.8-Max, un modèle d'IA à poids ouverts de 2 400 milliards de paramètres capable de traiter du texte, des images et des vidéos. Il s'agit du modèle le plus puissant de la famille Qwen, se situant à un niveau proche de Kimi K3 de Moonshot AI.

Le 26 août dernier, Alibaba Cloud a publié les poids ouverts de Qwen3.8-Flash-Next, un modèle multimodal de type « mixture-of-experts » qui offre également un premier aperçu de l'architecture de sa future série Qwen4. Selon l'entreprise, ce modèle bénéficie d'une mise à niveau systématique dans quatre domaines clés : la conception, l'attention, les connexions résiduelles, l'intégration et l'optimisation. Cette mise à niveau vise à renforcer ses capacités tout en réduisant le coût de calcul, les exigences en matière de capacité du modèle et l'instabilité lors de l'entraînement.


Les modifications techniques s’articulent en plusieurs niveaux. Du côté de l’attention, le modèle associe le Gated DeltaNet (GDN), qui compresse l’historique du contexte antérieur, au Qwen Sparse Attention (QSA), un indexeur léger et compressé qui sélectionne le contexte le plus important à l’échelle des micro-blocs, réduisant ainsi considérablement le coût de l’attention sur les longues séquences. Le flux résiduel est divisé en quatre branches selon un schéma Gated Residual (GR), avec une porte dynamique contrôlant les lectures et les écritures afin de renforcer le flux d’informations entre les couches et la stabilité de l’entraînement. Pour l'intégration, un nouveau composant N-gram Embedding adapte la capacité du modèle avec un surcroît de calcul minimal en effectuant des recherches dans une table à partir du contexte local ; de plus, comme la table d'intégration peut être transférée vers la mémoire de l'hôte et préchargée de manière asynchrone, ce processus se déroule en parallèle du calcul du modèle. Enfin, la pile d’entraînement adopte l’optimiseur Muon, perfectionné en termes de précision d’orthogonalisation, de répartition des tâches entre Muon et AdamW, et de fractionnement des paramètres fusionnés, la loi d’évolutivité ayant été réajustée pour s’adapter à la nouvelle architecture.

En termes d’échelle et d’efficacité, Qwen3.8-Flash-Next dispose d’un modèle principal de 125 milliards de paramètres, complété par 51 milliards de paramètres supplémentaires dans N-gram embeddings, avec seulement 6 milliards de paramètres activés par token. Par rapport à la version précédente, Qwen3.7-Plus, l’entreprise affirme que ce nouveau modèle offre des capacités supérieures en matière de codage et de tâches bureautiques, tout en réduisant le coût de l’entraînement à environ un neuvième de celui de son prédécesseur. Le modèle prend en charge nativement 262 144 tokens de contexte, et cette fenêtre peut être étendue à un million de tokens grâce à YaRN.

Les poids du modèle Qwen3.8-Flash-Next sont désormais disponibles sur Hugging Face et ModelScope, ce qui rend cette architecture immédiatement accessible aux chercheurs et aux développeurs, tandis qu'Alibaba Cloud pose les bases de la génération Qwen4.

La publication de Qwen3.8-Flash-Next intervient alors que l'adoption mondiale des modèles d'IA open source chinois a presque triplé, passant de 13 % à environ 30 % de l'utilisation totale en 2025. Cette tendance, qui résulte de l'essor de DeepSeek et de Qwen d'Alibaba, a été documentée dans le rapport « State of AI » d'OpenRouter. Ce rapport a analysé plus de 100 000 milliards de jetons sur plus de 300 modèles, révélant ainsi le passage d'une domination propriétaire à une concurrence pluraliste et open source à l'échelle mondiale.

Voici un extrait de l'annonce du modèle Qwen3.8-Flash-Next par Alibaba :

Dans cette version, nous rendons publics les poids de Qwen3.8-Flash-Next, un modèle MoE multimodal qui offre également un premier aperçu de l'architecture utilisée dans Qwen4. Il joue le même rôle que Qwen3-Next pour Qwen3.5 : la conception hybride Gated DeltaNet + Gated Attention introduite à l’époque a depuis été utilisée dans les séries Qwen3.5, Qwen3.6, Qwen3.7 et Qwen3.8. Nous publions à nouveau les modifications architecturales en avant-première, afin que la communauté puisse les examiner avant que la famille complète de modèles Qwen4 ne soit construite sur cette base.

Qwen3.8-Flash-Next améliore le modèle de manière systématique selon quatre axes — attention, résidu, intégration et optimisation —, ce qui renforce ses capacités tout en optimisant davantage l'efficacité de calcul, la capacité du modèle et la stabilité de l'entraînement :

  • Attention : une architecture hybride GDN + QSA. Le Gated DeltaNet (GDN) compresse efficacement l’historique ; le Qwen Sparse Attention (QSA) utilise un indexeur léger et compressé pour sélectionner le contexte important à l’échelle des micro-blocs, réduisant ainsi considérablement le coût de l’attention sur les longues séquences.
  • Résidu : Gated Residual (GR) divise le flux résiduel en 4 branches et contrôle les lectures et les écritures à l’aide d’une porte dynamique, renforçant ainsi le flux d’informations entre les couches et la stabilité de l’entraînement.
  • Intégration : N-gram Embedding effectue des recherches dans une table en utilisant le contexte local pour adapter la capacité du modèle avec un surcoût de calcul très faible ; la table d'intégration peut être déchargée vers la mémoire de l’hôte et superposée au calcul du modèle grâce à une prélecture asynchrone.
  • Optimisation : l’optimiseur Muon est utilisé ; il a été affiné en termes de précision d’orthogonalisation, de répartition des tâches entre Muon et AdamW, et de fractionnement des paramètres fusionnés, la loi d’échelle ayant été réajustée pour la nouvelle architecture.

Qwen3.8-Flash-Next intègre un modèle principal de 125 milliards de paramètres, complété par 51 milliards N-gram Embeddings supplémentaires, avec 6 milliards de paramètres activés par token. Par rapport à Qwen3.7-Plus, Qwen3.8-Flash-Next réduit considérablement les coûts d’entraînement et d’inférence : l’entraînement ne prend qu’environ 1/9 du temps, tout en offrant des capacités supérieures en matière de codage et de tâches bureautiques.

Il prend en charge nativement 262 144 tokens de contexte et est extensible à 1 000 000 de tokens avec YaRN. Les poids de Qwen3.8-Flash-Next sont désormais disponibles sur Hugging Face et ModelScope. La version de production, avec 1 million de tokens de contexte par défaut et des outils officiels intégrés, est proposée sous le nom de Qwen3.8-Flash sur QwenCloud, au prix de 0,15 dollar par million de tokens d’entrée et de 0,47 dollar par million de tokens de sortie.

Architecture du modèle


Attention : GDN + QSA pour une gestion efficace de la mémoire et une récupération précise

Le « Full-Attention » traditionnel offre un accès direct à tous les tokens précédents, mais à mesure que le contexte s'allonge, les coûts de calcul et d'accès à la mémoire du cache KV augmentent considérablement.

S'inspirant de l'architecture présentée dans Qwen3.5, Qwen3.8-Flash-Next adopte une architecture hybride GDN + Attention : trois couches sur quatre utilisent le Gated DeltaNet (GDN) pour compresser en continu les informations historiques en un état de taille fixe, tandis que la couche restante utilise l'Attention globale pour une récupération précise des informations sur l'ensemble du contexte.

En ce qui concerne l'attention globale, nous présentons également le « Qwen Sparse Attention » (QSA). L'attention dispersée réduit la charge de calcul liée aux longues séquences en ne prenant en compte que le contexte pertinent. Cependant, les approches existantes, telles que le DSA, s'appuient toujours sur un indexeur au niveau des tokens pour identifier les positions importantes ; à mesure que le contexte s'étend, l'indexeur lui-même devient une source de calcul non négligeable.

QSA simplifie encore davantage ce processus : un indexeur léger regroupe d’abord la séquence en micro-blocs, évalue l’importance du contexte au niveau de chaque bloc, puis sélectionne les régions les plus pertinentes pour l’Attention. Cela réduit non seulement le coût de l’Attention elle-même, mais aussi la charge d’indexation nécessaire pour identifier le contexte important. Par rapport aux approches qui partagent des indices entre les couches, QSA effectue la compression des séquences de manière indépendante au sein de chaque couche, ce qui réduit sa dépendance à l'égard de la similarité d'attention intercouches et le rend particulièrement bien adapté aux architectures hybrides dans lesquelles les couches GDN et Attention sont entrelacées.


En termes simples : GDN « mémorise » efficacement, tandis que QSA « récupère » avec précision.

Avec 1 million de tokens, le noyau d’Attention du QSA permet d’atteindre des gains de vitesse allant jusqu’à 7,6x et 4,9x respectivement pour les phases de préremplissage et de décodage. Dans un cadre expérimental représentatif des scénarios de service en ligne avec une réutilisation élevée du cache (un taux de réussite de 90 % dans le cache de préfixes), Qwen3.8-Flash-Next atteint un débit de préremplissage 8,6 fois supérieur à celui de Qwen3.7-Plus pour une longueur de contexte de 1 million de tokens.


Gated Residual : davantage de voies pour la circulation de l'information

Dans un transformeur classique, toutes les couches lisent et écrivent en continu dans le même flux résiduel. À mesure que le réseau gagne en profondeur, les caractéristiques initiales sont mélangées à plusieurs reprises avec les informations ultérieures, ce qui augmente le risque de voir les signaux importants se diluer progressivement.

Gated Residual (GR) peut être considéré comme la combinaison de deux concepts : il s'inspire de l'approche « Hyper-Connection » pour élargir le flux résiduel en plusieurs branches, tout en intégrant le filtrage dynamique élément par élément de GatedNorm dans la lecture du flux résiduel. Le flux résiduel unique d'origine est divisé en quatre branches parallèles, ce qui permet au modèle de déterminer de manière dynamique la quantité d'informations à lire dans chaque branche et celle à réécrire dans chacune d'elles en fonction du contenu actuel.

On peut conceptualiser ce phénomène comme l'extension d'un canal d'information unique en plusieurs voies parallèles : certaines branches gèrent le flux d'informations local, tandis que d'autres transmettent les informations initiales directement vers les couches profondes du réseau. L'analyse empirique révèle également que l'une de ces branches émerge naturellement comme une voie à longue portée reliant la première couche d'attention à la plupart des couches intermédiaires et suivantes.

GR simplifie encore davantage l’Hyper-Connection. Une fois que les opérations de lecture et d’écriture sont suffisamment expressives, le mélange supplémentaire des branches n’apporte aucun avantage significatif et peut donc être directement supprimé, ce qui réduit la surcharge liée aux accès mémoire et les sources d’instabilité. Le Gate supprime également efficacement les valeurs aberrantes d’activation et améliore la stabilité de l’apprentissage. De plus, l’état résiduel prend en charge le stockage en FP8, ce qui réduit encore davantage la surcharge liée aux accès mémoire.

N-gram Embedding : augmenter la capacité du modèle à moindre coût

En nous inspirant du Per-Layer Embedding de Gemma 3n et de travaux tels que DeepSeek Engram, nous introduisons également l’Embedding N-gram afin d’étendre la capacité du modèle au-delà des paramètres de l’architecture Transformer.

Un intégration standard effectue une recherche sur la base d’un seul token. N-gram Embedding, quant à lui, effectue des recherches en utilisant le contexte local formé par le token actuel et plusieurs tokens précédents, fournissant ainsi des représentations supplémentaires pour les expressions courantes et les motifs locaux.

Son principal avantage réside dans sa capacité à intégrer un grand nombre de paramètres sans entraîner pratiquement aucun surcoût de calcul par token.

Qwen3.8-Flash-Next introduit 51 milliards de paramètres supplémentaires N-gram Embedding. Les emplacements de recherche pouvant être déterminés à l’avance, ces paramètres peuvent être stockés dans la mémoire hôte et préchargés de manière asynchrone, en parallèle du calcul du modèle, sans occuper en permanence la mémoire du GPU.

Le modèle final n'utilise qu'une seule couche N-gram Embedding située près du début du réseau, ce qui permet d'ajouter efficacement une « mémoire de motifs locaux » à grande échelle pour un coût supplémentaire relativement faible.

Optimisation : conception conjointe de l'architecture et de l'optimisation

Qwen3.8-Flash-Next a été entraîné à l'aide de l'optimiseur Muon, avec des améliorations supplémentaires portant sur trois aspects clés de l'application de Muon à l'entraînement de grands modèles : la précision de l'orthogonalisation, l'attribution des paramètres entre Muon et AdamW, et le fractionnement des matrices de paramètres fusionnées.

Pour les paramètres qui agissent véritablement comme des applications linéaires bidimensionnelles, tels que les poids principaux dans Attention, GDN et MoE Experts, nous utilisons Muon. Les intégrations, le MoE Router et les paramètres de rang faible dans GR continuent d'utiliser AdamW. Pour les projections QKV, SwiGLU et...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !