IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Le laboratoire chinois d'IA DeepSeek lance le modèle de raisonnement multimodal V4.1-Flash, doté d'une architecture « Mixture-of-Experts » de 552 milliards de paramètres et d'une compréhension visuelle native

Le , par Jade Emy

106PARTAGES

5  0 
Le laboratoire chinois d'IA DeepSeek lance le modèle de raisonnement multimodal V4.1-Flash, doté d'une architecture « Mixture-of-Experts » de 552 milliards de paramètres, d'une compréhension visuelle native et d'une empreinte mémoire réduite. Selon l’entreprise, ce modèle est le plus petit de sa nouvelle famille d’architectures et le premier de cette famille à intégrer une compréhension visuelle native, c’est-à-dire des capacités multimodales directement intégrées au modèle plutôt que rajoutées a posteriori. L’entreprise affirme que de nouvelles méthodes de pré-entraînement, combinées à un post-entraînement par apprentissage par renforcement à plus grande échelle, permettent d’obtenir des résultats de benchmark supérieurs à ceux de la génération précédente.

DeepSeek est une entreprise chinoise spécialisée dans l'intelligence artificielle (IA) qui développe des grands modèles de langage (LLM) à paramètres ouverts. Basée à Hangzhou, dans la province du Zhejiang, DeepSeek est détenue et financée par High-Flyer, un fonds spéculatif chinois. Le laboratoire chinois d’IA DeepSeek a annoncé le 8 septembre le lancement de DeepSeek-V4.1-Flash, qualifiant cette version de « plus intelligente, plus rapide et plus efficace ».

Selon l’entreprise, ce modèle est le plus petit de sa nouvelle famille d’architectures et le premier de cette famille à intégrer une compréhension visuelle native, c’est-à-dire des capacités multimodales directement intégrées au modèle plutôt que rajoutées a posteriori. DeepSeek a indiqué que cette architecture avait été conçue dès le départ pour offrir des capacités accrues, une inférence plus rapide et un débit plus élevé, et pour servir de base permettant de s’adapter à des modèles plus grands de la même famille.

Au cœur de cette version se trouve ce que DeepSeek appelle une architecture asymétrique : un modèle « Mixture-of-Experts » de 552 milliards de paramètres, reposant sur une conception novatrice de codeur-décodeur causal, avec seulement 8 milliards de paramètres actifs dédiés au traitement des entrées et 16 milliards à la génération des sorties. L’entreprise affirme que de nouvelles méthodes de pré-entraînement, combinées à un post-entraînement par apprentissage par renforcement à plus grande échelle, permettent d’obtenir des résultats de benchmark supérieurs à ceux de la génération précédente.

Les gains d’efficacité ne se limitent pas non plus au calcul : le cache clé-valeur de V4.1-Flash ne nécessite qu’un quart de la mémoire HBM et un huitième de l’espace de stockage SSD par rapport à son prédécesseur, une compression qui, selon DeepSeek, se traduit par des économies importantes, car les coûts liés aux accès au cache représentent souvent une part importante des charges de travail de l’IA agentique.


V4.1-Flash est désormais disponible sur l’API DeepSeek sous le nom de modèle « deepseek-flash », avec une prise en charge multimodale native ; les anciens modèles V4-Flash et V4-Flash-Vision-Exp ont été retirés, bien que les points de terminaison hérités redirigent temporairement vers la nouvelle version pour des raisons de compatibilité. Compte tenu de la réduction des coûts de service, DeepSeek baisse les tarifs de son API et maintient son système de tarification en fonction des heures de pointe et des heures creuses.

Avec cette tarification, les tarifs en heures creuses s’élèvent à 50 % de ceux des heures de pointe, ce qui incite les développeurs à planifier leurs charges de travail de manière flexible pendant les heures de moindre activité. Fidèle à sa tradition open source, l’entreprise a publié le modèle sur Hugging Face et indique qu’elle travaillera en étroite collaboration avec la communauté open source sur la prise en charge de l’inférence, invitant les opérateurs prévoyant des déploiements à grande échelle de 2 000 GPU ou plus à la contacter.

Cette annonce intervient alors que les autorités fédérales américaines accusent la Chine de distillation « systématique » de modèles d’IA américains. Un avis conjoint allègue que des entreprises chinoises utilisent des systèmes sophistiqués pour acheminer des millions de requêtes de données vers des modèles d’IA américains via différents comptes et différentes plateformes.

L’avis cite des entreprises chinoises telles que DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun et Z.AI, affirmant qu’elles ont dépensé des milliards de jetons au cours de millions d’échanges et de requêtes avec des modèles d’IA américains de pointe tels que Claude d’Anthropic, ChatGPT d’OpenAI, Gemini de Google et Grok de xAI, depuis au moins fin 2024. « La lutte contre la distillation à l’échelle industrielle mérite une réponse coordonnée à l’échelle de l’écosystème de l’IA, incluant un partage efficace des informations entre le gouvernement américain, le secteur privé et les nations alliées », précise l’avis.

Voici l'annonce de DeepSeek :

Introduction de DeepSeek-V4.1-Flash : plus intelligent, plus rapide, plus efficace.

Découvrez le plus petit modèle de notre nouvelle famille d’architectures, doté d’une compréhension visuelle native. Conçu pour offrir des capacités accrues, une inférence plus rapide, un débit plus élevé et une évolutivité vers des modèles plus volumineux.


Architecture asymétrique. Plus d’intelligence, moins de coûts

- MoE à 552 milliards de paramètres.
- Nouvelle architecture encodeur-décodeur causale : seulement 8 milliards de paramètres actifs pour l’entrée, 16 milliards pour la sortie.
- De nouvelles méthodes de pré-entraînement + un post-entraînement par apprentissage par renforcement (RL) à plus grande échelle offrent des résultats de référence supérieurs à ceux des modèles phares, y compris DeepSeek-V4-Pro.


Un cache KV plus petit. Des économies plus importantes.

Par rapport à la génération précédente, le cache KV de V4.1-Flash ne nécessite que :

- 1/4 de la mémoire HBM
- 1/8 de l’espace de stockage SSD

Les frais liés aux accès au cache représentent souvent une part importante des coûts des agents. La compression du cache réduit considérablement ces coûts.


V4.1-Flash est désormais disponible sur l’API DeepSeek avec prise en charge multimodale native.

Configurez votre modèle sur deepseek-flash.

- Les versions V4-Flash et V4-Flash-Vision-Exp sont retirées. Pour des raisons de compatibilité, les requêtes « deepseek-v4-flash » et « deepseek-v4-flash-vision-exp » sont temporairement redirigées vers V4.1-Flash.
- Des tests menés par plusieurs parties placent V4.1-Flash devant V4-Pro en termes de performances, de coût, de vitesse et de durée d’exécution totale. Nous supprimons progressivement V4-Pro.
- À partir de 04 h 00 UTC le 14 septembre 2026, toutes les requêtes « deepseek-v4-pro » seront redirigées vers V4.1-Flash aux tarifs de V4.1-Flash. Cette mesure restera en vigueur jusqu’au lancement de V4.1-Pro.

Nos partenaires officiels WorkBuddy (y compris CodeBuddy) et OpenCode prennent désormais pleinement en charge V4.1-Flash. Essayez-le dès aujourd’hui !

Une architecture plus efficace. Des tarifs API plus bas.

La version V4.1-Flash nous permet de servir davantage d’utilisateurs à moindre coût. Nous vous faisons profiter de ces économies.

- La tarification en heures de pointe et hors pointe continue d’équilibrer la demande.
- Les tarifs hors pointe correspondent à 50 % des tarifs en heures de pointe. Planifiez vos charges de travail flexibles en dehors des heures de pointe pour réaliser des économies.
- La nouvelle tarification entrera en vigueur à 04 h 00 UTC le 10 septembre 2026.


Soutien à l’open source. Élargissement des options de déploiement.

Nous travaillerons en étroite collaboration avec la communauté open source sur la prise en charge de l’inférence avec V4.1-Flash et explorerons davantage d’options de déploiement. Vous prévoyez un déploiement à grande échelle avec plus de 2 000 GPU et un cluster de stockage ? Contactez-nous.

Source : Annonce de DeepSeek V4.1-Flash

Et vous ?

Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?

Voir aussi :

Le nouveau modèle DeepSeek-V4-Flash-0731 surpasse sa propre version « Pro ». Il rivalise avec GPT-5.6 Luna, pour un coût inférieur d'environ 60 %, même après la baisse de prix de 80 % pratiquée par OpenAI

Anthropic dévoile les campagnes de « distillation » menées par Alibaba, Moonshot AI et DeepSeek, pour extraire les capacités de l'IA Claude

DeepSeek augmente les tarifs facturés aux développeurs pour l'accès à ses modèles V4-Flash et V4-Pro, avec des hausses pouvant atteindre 1 100 %, selon le modèle et le jeton
Vous avez lu gratuitement 20 157 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !