IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Le nouveau modèle DeepSeek-V4-Flash-0731 surpasse sa propre version « Pro ». Il rivalise avec GPT-5.6 Luna, pour un coût inférieur d'environ 60 %, même après la baisse de prix de 80 % pratiquée par OpenAI

Le , par Mathis Lucas

108PARTAGES

5  0 
DeepSeek lance la version bêta publique de son API DeepSeek-V4-Flash (0731). Ce modèle léger surpasse désormais la version V4-Pro-Preview sur plusieurs benchmarks clés grâce à une optimisation post-entraînement rigoureux. Il offre aux développeurs un agent de codage extrêmement performant à une fraction du coût des modèles premiums concurrents. L'API assure une compatibilité native avec les formats OpenAI et Codex, facilitant ainsi son intégration immédiate dans les écosystèmes existants. Alors que les applications Web et mobiles restent inchangées pour le moment, l'entreprise prévoit de publier prochainement une version V4-Pro officielle.

DeepSeek emboîte le pas à ses homologues chinois Z.ai et Moonshot AI en signant un nouvel exploit. Le 31 juillet, l'entreprise a lancé la version bêta publique de l'API de son nouveau modèle d'IA léger, DeepSeek-V4-Flash. Bien que ce modèle d'IA conserve strictement la même architecture et la même échelle de paramètres que sa version préliminaire, il a fait l'objet d'optimisations itératives majeures durant sa phase de post-entraînement.

Ces ajustements lui ont permis d'accomplir un bond notable dans ses capacités d'agent autonome, lui permettant même de surpasser la version supérieure de sa propre gamme, DeepSeek-V4-Pro-Preview, sur de nombreux benchmarks. (DeepSeek V4-Pro-Preview est un modèle d'IA plus coûteux et plus puissant.) En mai 2026, DeepSeek estimait déjà que le prix V4-Pro-Preview était « au moins 34 fois inférieur à celui de GPT-5.5 d'OpenAI ».

Selon le journal officiel des modifications de DeepSeek, cette mouture vise principalement à améliorer les capacités du modèle d'IA en matière d'exécution autonome et d'appel d'outils dans le cadre de tâches complexes. DeepSeek-V4-Flash-0731 obtient un score de 50 sur l'index d'Artificial Analysis, soit une progression de 10 points par rapport à DeepSeek-V4-Flash (sorti en avril), ce qui lui confère une avance de 6 points sur DeepSeek-V4-Pro.

L'industrie chinoise de l'IA évolue à un rythme effréné, réalisant sans cesse des percées dans la génération de vidéos, la compréhension multimodale, les capacités agentiques, etc. Les experts chinois de l'IA ont déclaré que ces progrès étaient le résultat naturel d’années d’investissements soutenus.

DeepSeek optimise l'architecture du modèle pour l'efficacité

DeepSeek-V4-Flash est le modèle allégé de la gamme V4 de DeepSeek, conçu pour un déploiement économique. La version officielle (identifiant du modèle : deepseek-v4-flash) est entrée en bêta publique le 31 juillet (07/31), avec une API qui reste entièrement rétrocompatible. Il suffit au développeur de définir le nom du modèle sur « deepseek-v4-flash » pour que tout fonctionne. « Les Chinois passent à la vitesse supérieure », a écrit un critique.


La percée réside ici non pas dans un modèle plus volumineux, mais dans un meilleur apprentissage. V4-Flash-0731 utilise la même architecture et la même taille que la version préliminaire, à savoir un modèle de type MoE (Mixture of Experts) doté de 284 milliards de paramètres au total. Selon DeepSeek, le seul changement a consisté en un post-entraînement plus abouti. Mêmes paramètres, performances de l’agent nettement différentes.

Cela suggère que DeepSeek a trouvé une méthodologie d’apprentissage qui libère les capacités de l’agent IA sans augmenter les besoins en puissance de calcul. V4-Flash-0731 n'active que 13 milliards de paramètres par inférence, un chiffre bien inférieur aux 49 milliards de paramètres actifs sur les 1 600 milliards que compte le modèle supérieur, V4-Pro. Les résultats obtenus par le nouveau modèle sur les benchmarks sont impressionnants.

Selon la documentation officielle de l’API de DeepSeek, le modèle V4-Flash-0731 a obtenu un score de 82,7 sur le benchmark Terminal Bench 2.1, contre 72,1 pour le modèle supérieur V4-Pro-Preview. Cela représente un avantage de 14,7 % pour le modèle économique par rapport à son homologue haut de gamme. Et à 0,14 dollar par million de tokens d’entrée, ce modèle redéfinit l’équation de rentabilité pour le développement d’agents IA.

Sur GDPval, un benchmark conçu pour évaluer les modèles sur des tâches de bureau complexes issues du monde réel, V4-Flash-0731 passe de 1 189 à 1 559 points Elo. Il produit également moins souvent d'hallucinations. Les poids du modèle V4-Flash-0731 sont disponibles sous licence MIT sur Hugging Face.

Résultats des benchmarks : V4-Flash face à la concurrence

L'amélioration fulgurante du DeepSeek-V4-Flash provient exclusivement d'une phase d'entraînement post-déploiement plus pointue, incluant l'apprentissage par renforcement et la distillation. La progression est encore plus spectaculaire sur le benchmark DeepSWE, dédié à l'ingénierie logicielle, où le score est passé de 7,3 pour la version préliminaire à 54,4 pour la version officielle (V4-Flash-0731), soit une amélioration colossale de 645 %.

DeepSeek-V4-Flash s'illustre également sur d'autres benchmarks majeurs avec des scores de 68,7 sur DSBench-FullStack, 76,7 sur Cybergym, et 70,3 sur Toolathlon Verified. La tendance est claire : V4-Flash surpasse V4-Pro-Preview sur tous les benchmarks qui évaluent les performances des agents IA.

Tarification : l'agent de codage le plus rentable ?

Selon la page de tarification de DeepSeek, le coût de V4-Flash est le suivant :

  • Entrée sans cache : 0,14 $ par million de tokens ;
  • Entrée avec cache : 0,0028 $ par million de tokens ;
  • Sortie : 0,28 $ par million de tokens.


À titre de comparaison, le modèle de pointe Opus-4.8 d’Anthropic, qui arrive en tête dans la plupart des benchmarks, coûte nettement plus cher par million de tokens. V4-Flash affiche un score de 82,7 sur Terminal Bench 2.1 contre 85,0 pour Opus-4.8, soit un écart de seulement 2,3 points, pour un prix nettement inférieur. Pour les équipes exécutant des charges de travail d’agents à grande échelle, ce calcul revêt une importance considérable.

Un détail important : le mode « réflexion » est activé par défaut et est facturé au tarif de sortie, même si ces tokens de raisonnement n’apparaissent pas dans la réponse finale. DeepSeek a également annoncé la prise en charge d'outils existants, ce qui devrait attirer les utilisateurs de modèles concurrents.

Prise en charge de l’API Responses et de Codex

Selon DeepSeek, la version officielle de V4-Flash prend en charge nativement le format de l’API Responses d’OpenAI, ce qui signifie que les développeurs qui s’appuient déjà sur l’écosystème d’OpenAI peuvent facilement passer à V4-Flash avec un minimum de modifications du code. DeepSeek a également adapté spécifiquement le modèle pour l’intégration à Codex, la configuration étant documentée sur son portail dédié aux développeurs.


Il s’agit d’une décision stratégique. En prenant en charge nativement l’API Responses, DeepSeek positionne V4-Flash comme un remplacement direct des modèles OpenAI dans les pipelines d’agents IA. Combiné à sa tarification, cela fait de V4-Flash le candidat le plus solide du marché pour « changer une ligne de code et économiser 90 % ». « L'Amérique est en train de perdre la guerre de l'IA », a commenté un utilisateur sur Hacker News.

Comparaison entre les modèles V4-Flash et V4-Pro

Le plus remarquable dans cette mise à jour, c’est l’histoire qui se cache derrière. DeepSeek propose désormais deux modèles pour la gamme V4 : Flash (allégé) et Pro (complet). V4-Flash était censé être l’option la moins chère, mais légèrement moins performante. Or, grâce à un meilleur entraînement post-développement, ce petit modèle économique surpasse désormais la version préliminaire du modèle haut de gamme sur tous les plans.

Pour les équipes qui développent des agents IA, des assistants de codage ou des workflows automatisés, V4-Flash vient bouleverser la dynamique économique « développer ou acheter ». Les résultats obtenus par DeepSeek-V4-Flash sur les différents benchmarks indiquent qu’il est désormais possible d’obtenir des performances d’agent proches de la pointe de la technologie pour environ un dixième du coût des alternatives haut de gamme.

Implications pratiques :

  • les agents IA de codage obtiennent un modèle qui atteint 82,7 sur Terminal Bench 2.1 pour quelques centimes par tâche ;
  • les pipelines SWE (Software Engineering) s'exécutent sur DeepSWE avec un score de 54,4, un chiffre compétitif face à des modèles coûtant 10 fois plus cher ;
  • les agents IA utilisant des outils obtiennent un score Toolathlon Verified de 70,3, juste derrière Opus-4.8 ;
  • les tâches de développement full-stack atteignent le score de 68,7 sur DSBench-FullStack, à seulement 3 points d'Opus-4.8.


DeepSeek a confirmé dans son journal des modifications que cette mise à jour ne s’applique qu’à l’API V4-Flash. L’API V4-Pro ainsi que les modèles disponibles sur l’application et le site Web de DeepSeek restent inchangés pour le moment. La sortie officielle du modèle complet V4-Pro suivra prochainement, ce qui soulève une question évidente : si le modèle économique est déjà aussi performant, à quoi ressemblera V4-Pro lors de sa sortie ?

Les startups chinoises accélèrent la cadence de publication

ByteDance vient de lancer son nouveau modèle de génération vidéo Seedance 2.5. Cette version étend la durée maximale de génération d’une vidéo unique de 15 à 30 secondes et prend en charge l’extension en plusieurs étapes. Elle améliore également les capacités de référence multimodales, permettant aux utilisateurs d’entrer jusqu’à 30 images, 10 clips vidéo et 10 extraits audio comme supports de référence lors d’une seule génération.

Il peut générer des données vidéo synthétiques de haute qualité pour aider à entraîner les capacités de perception et de manipulation des robots. Il excelle aussi dans la simulation industrielle, la formation aux processus et les démonstrations d’équipements. Dans les scénarios de conduite autonome, Seedance 2.5 peut simuler des situations peu fréquentes telles que des conditions météorologiques extrêmes et des conditions routières complexes.

MiniMax Group a lancé H3, un modèle d'IA polyvalent qui permet une compréhension unifiée des contextes multimodaux composés de texte, d’images, de vidéos et d’audio. Il est capable de générer en natif du contenu audio-vidéo à deux canaux, d’une durée maximale de 15 secondes en résolution 2K.

Le 19 juillet, Alibaba a présenté Qwen 3.8 Max Preview au World AI Conference à Shanghai. En matière de performances, Alibaba a déclaré que « Qwen 3.8 est comparable aux modèles d’IA de pointe ». Il est décrit comme « le deuxième modèle le plus performant sur le marché après Claude Fable 5 d’Anthropic ».

Un jour auparavant, la startup chinoise Moonshot AI dévoilait Kimi K3, un modèle à poids ouverts doté de 2 800 milliards de paramètres, offrant des capacités de vision natives et une fenêtre contextuelle d'un million de tokens. Selon le benchmark Intelligence Index d'Artificial Analysis, Kimi K3 devance Claude Opus 4.8 d'Anthropic et GPT-5.6 Terra d'OpenAI, et se classe à seulement deux ou trois points derrière Claude Fable 5 et GPT-5.6 Sol.

La Maison Blanche accuse la Chine de vol de technologie

Les modèles chinois séduisent de plus en plus. « La publication concentrée de ces avancées n’est pas le fruit du hasard. Après des années d’accumulation, les modèles d’IA nationaux ont acquis des avantages en matière de performances, d’ouverture du code source et de coût, ouvrant ainsi la voie à une période de percées concentrées », a déclaré Hu Qimu, professeur à l’Institut de la Route maritime de la Soie de l’université de Huaqiao, à Global Times.

Selon Hu Qimu, la Chine dispose d’un vaste marché d’applications et d’un système industriel bien développé, capable de soutenir une mise en œuvre dans de multiples scénarios. Des initiatives nationales telles que « IA+ » abaissent encore davantage le seuil d’industrialisation et accélèrent le rythme de déploiement.

De hauts responsables américains ont déclaré qu’ils allaient ouvrir des enquêtes sur des entreprises d'IA chinoises sur la « distillation » de modèles américains de pointe. Ils menacent également de sanctions ces entreprises pour des motifs tels que le « vol de propriété intellectuelle américaine ». La Chine a qualifié ces accusations de fallacieuses et des experts en IA américains mettent en garde Washington contre les effets négatifs de ces sanctions.

Le ministère chinois du Commerce a vivement critiqué ces mesures américaines, qui manquent de fondement factuel et de justification juridique, soulignant que l’innovation n’est pas l’apanage d’un seul pays. « Les entreprises chinoises spécialisées dans l’IA s’engagent...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Pierre Louis Chevalier
Expert éminent sénior https://www.developpez.com
Le 08/08/2026 à 15:11
Il faut bien payer les data center quand c'est du cloud. Ceci dit il y a quand même une forte différence entre la chine et les US.

1) Le développement de modèles performantes en Chine n'a couté que quelques centaines de milliers de dollars contre plus de 100 milliards aux US, d'après les US les chinois aurait cloné les meilleur LLM US par distillation.
Enfin n'oublions pas que le code de Claude d'Anthropic à fuité donc il est dans la nature.
Par conséquent les chinois n'ont pas besoin d'inclure dans leur prix le remboursement plus de 100 milliard d'investissement.

2) Les chinois sont a même de construire et de faire tourner des centres de données certainement pour moins de 50% du prix des US, par conséquent rien que pour cette raison il pourront toujours être bien moins cher que les US.

3) Les US sont dans une situation énergétique catastrophique, ayant stoppé les programmes de constructions de centrales nucléaires, et Trump ayant trouvé ça amusant de bloquer les autorisations de sites d'Eoliennes aux US, les USA en sont réduits à alimenter leur data centers avec des centrales a charbon et des turbines à gaz, ce qui est un désastre écologique total.
Pendant ce temps la chine a développé un énorme programme de création d'électricité décarboné avec des centrales nucléaires et des parcs solaires et éoliens énormes, une magnifique prouesse.

Donc au final, la chine sera toujours en mesure de proposer de L'IA cloud bien moins chère que les US, et il n'y a pas besoin d'être un grand génie de la finance pour comprendre que les milliards investis par les spéculateurs dans les sociétés IA LLM ne seront jamais remboursés et qu'un écroulement total de la bulle IA US peut arriver à tout moment, déjà le titre Space X s'est écroulé entre autres parce que Grok fait un Bide, et des financiers ont décidé de Shorter le titre Oracle qui s'est lourdement endetté à cause de l'IA et qui devrait donc d'après eu s'écrouler lamentablement.

Tout ne va pas d'écrouler, cela prendra des années pour mettre en place des usines pour concurrencer NVIDIA et d'autres fabricants de puces, qui vont donc continuer à vendre leurs puces à prix forts, et il n'y a aucune raison que l'éclatement de la bulle IA US touche les sociétés d'IA chinoises vu qu'au final c'est la Chine qui va rafler le marché global.
3  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 07/08/2026 à 17:19
Que l'IA soit américaine ou chinoise, tous utilisent la même stratégie marketing:

1° On rase d'abord gratis: Gratuité pour attirer les clients

2° Une fois que les clients sont captifs, la gratuité laisse place à la facturation!!!

Que le modèle économique soit américain ou chinois, l'objectif d'une entreprise est de faire de l'argent!!!

---

Et n'oubliez pas un point important: Si un service reste gratuit dans la durée, cela signifie que c'est vous le produit qui est vendu... Vous et vos données personnelles!!!
3  1 
Avatar de jnspunk
Membre habitué https://www.developpez.com
Le 08/08/2026 à 5:39
On a de la chance d'avoir des modèles qui tournent en local gratos, si toutefois on a eu la chance de se procurer du matériel avant la montée des prix.
1  0 
Avatar de der§en
Membre expérimenté https://www.developpez.com
Le 08/08/2026 à 11:55
La phase de dumping des chinois est terminée, maintenant il va falloir passer à la caisse, plus cela change, moins cela change avec eux…
1  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 09/08/2026 à 8:47
Citation Envoyé par OrthodoxWindows Voir le message
Il faut distinguer gratuit et open-source, ainsi que quels sont les éléments open-source
On ne parle pas de la même chose: Pour moi, quand on parle de déploiement "local", on parle d'une IA qui n'est pas connectée à internet!!!

Que votre IA soir "open-source" ou pas, cela ne change rien... Il n'y a pas un seul utilisateur d'un quelconque logiciel "open-source" qui a vérifié ce que faisait effectivement le code du logiciel qu'il utilise. Affirmer le contraire serait tout simplement mentir!

Donc rien n'empêche votre IA "open-source" connectée de "s'échapper" de votre usage "locale" et de transmettre vos données à des tiers...

Votre IA "locale" déployée dans une infrastructure connectée n'est pas locale!
0  0 
Avatar de Anselme45
Membre extrêmement actif https://www.developpez.com
Le 08/08/2026 à 11:44
Citation Envoyé par jnspunk Voir le message
On a de la chance d'avoir des modèles qui tournent en local gratos, si toutefois on a eu la chance de se procurer du matériel avant la montée des prix.
Et vos modèles deviendront très vite obsolètes puisque ne profitant pas des nouvelles versions devenues... Payantes!
1  2 
Avatar de OrthodoxWindows
Membre expert https://www.developpez.com
Le 08/08/2026 à 22:20
Citation Envoyé par Anselme45 Voir le message
Et vos modèles deviendront très vite obsolètes puisque ne profitant pas des nouvelles versions devenues... Payantes!
Il faut distinguer gratuit et open-source, ainsi que quels sont les éléments open-source.
Un modèle open-source est, comme sont nom l'indique, de source ouverte, et peut donc être déployé en local. La majorité des modèles open-source sont publiés sous licence permissive MIT, à l’exception de quelques modèles (surtout de Meta et de Stable Diffusion) publiés sous une licence restrictive faussement open-source.
Cependant, rare sont les données et méthode d’entraînement open-source. En pratique, cela signifie qu'un contrôle est laissé à l'utilisateur pour utiliser le modèle, et le finetuner, enlever telle ou telle censure... Mais l'utilisateur n'ayant pas le contrôle sur comment le modèle à été entraîné, il ne peut pas modifier son comportement global, car un LLM fonctionne avant tout par ses données d’entraînement, c'est le principe même d'un LLM.

Quand à la question de savoir si les entreprises ayant une politique d'open-source continueront à avoir cette politique, rien ne porte à penser qu'à court terme, cela changera, vu que les modèles d'open-source tendent plutôt à se multiplier.
A plus long terme, il est délicat de prédire, cela dépendra de la rentabilité du modèle économique actuel... Je partage l'avis de Pierre Louis Chevalier, les chinois semblent clairement viser une domination mondial dans les LLM, et semblent bien parti pour y parvenir.

Et dans le pire des cas, il ne faut pas oublier que de la même manière que les chinois ont utilisés la distillation pour développer leurs LLMs, de future communautés FOSS pourront probablement faire la même chose. Des universitaires sont d'ailleurs déjà parvenu à construire des LLMs assez performant pour un prix particulièrement peu élevé.
0  1