Mistral a dévoilé un aperçu de Mistral Large 4, un modèle de 1 T qui, selon l'entreprise parisienne, est le système d'IA à poids ouvert le plus puissant en dehors de la Chine. Dès aujourd'hui, les développeurs peuvent y accéder via l'API de Mistral, et les poids du modèle seront disponibles le 27 octobre. Surnommé « Le Chonk », ce nouveau modèle est capable de traiter à la fois du texte et des images. Il a été entraîné à partir de zéro pendant deux mois à l'aide d'environ 4 000 GPU Nvidia Grace Blackwell dans les centres de données européens de Mistral. La cybersécurité est au cœur de ce modèle, et c'est là que l'ouverture revêt toute son importance.Mistral AI SAS est une entreprise française spécialisée dans l'intelligence artificielle (IA) dont le siège social est situé à Paris. Fondée en 2023, elle développe des modèles de langage à grande échelle (LLM). En 2025, la valorisation de l'entreprise s'élève à plus de 14 milliards de dollars américains, soit la plus élevée parmi les entreprises européennes du secteur de l'IA. En août 2026, son plus grand modèle accessible au public est Mistral Large 3, lancé en décembre 2025 : il s’agit d’un modèle de type « mixture of experts » comptant 675 milliards de paramètres, dont 41 sont actifs. Mistral a lancé « Le Chat », son chatbot, en février 2024 ; celui-ci a été rebaptisé « Mistral Vibe » en 2026.
Mistral a dévoilé un aperçu de Mistral Large 4, un modèle de 1 T qui, selon l’entreprise parisienne, est le système d’IA à poids ouvert le plus puissant en dehors de la Chine. Dès aujourd’hui, les développeurs peuvent y accéder via l’API de Mistral. Les poids du modèle, qui permettent à tout un chacun de le télécharger et de l’exécuter sur ses propres serveurs, seront disponibles le 27 octobre. L’entreprise consacrera les trois prochaines semaines à tester le modèle en conditions réelles. Les développeurs, les entreprises de cybersécurité et les organismes publics recevront une version comportant moins de restrictions et davantage de fonctionnalités de cybersécurité que l’API publique. Large 4 est surnommé « Le Chonk », et ce nouveau modèle est capable de traiter à la fois du texte et des images.
Cette fois-ci, on trouve la mention « Made in Europe » sur l’étiquette
Pour n’importe quelle tâche, il n’utilise que 49 milliards de ses mille milliards de paramètres. De plus, le modèle a été entraîné à partir de zéro pendant deux mois à l’aide d’environ 4 000 GPU Nvidia Grace Blackwell dans les centres de données européens de Mistral, qui alimentent désormais également la version préliminaire. L’entreprise a indiqué que l’entraînement avait consommé environ 10 mégawatts d’électricité. La phase d’apprentissage par renforcement, au cours de laquelle le modèle s’améliore par essais et erreurs et grâce au retour d’information, est toujours en cours.
Mistral indique que les progrès n’ont pas encore commencé à ralentir. Les résultats des tests de performance sont préliminaires, et l’entreprise s’attend à ce qu’ils évoluent avant la publication des poids. Sur DeepSWE, un test de codage agentique dans lequel les modèles effectuent de véritables tâches d’ingénierie logicielle, Large 4 a obtenu un score de 62 %. Il devance ainsi de justesse le GLM-5.3 de Zhipu (61 %) et le DeepSeek-V4-Pro (57 %), et devance largement le Qwen 3.8 Max (51 %) et le Beam de Reflection AI (44 %).
En ce qui concerne l'indice de référence financier, « Large 4 » a atteint 67 % sur le FinWorkBench (FinWorkBench), à égalité avec DeepSeek-V4-Pro et juste devant GLM-5.3 (65 %), et presque le double du « Medium 3.5 » de Mistral (37 %). Selon l'indice de référence « Legal Agent » d'Harvey, il a obtenu un score de 15 %, devançant Kimi K3 (13 %) et le GPT-6 Astra d'OpenAI (5 %) ; toutefois, ces scores globalement faibles montrent à quel point tous ces modèles sont encore loin de pouvoir traiter seuls des dossiers juridiques.
C'est dans le domaine de la vision que Mistral se distingue le plus. En matière de « grounding » (c'est-à-dire la localisation d'objets spécifiques dans une image), Large 4 a obtenu un score de 73 % au test de télédétection DIOR-RSVG, contre 68 % pour GPT-6 Astra. Les deux modèles ont obtenu un score de 42 % sur Dense200. Mistral affirme également que son modèle surpasse le Fable 5.1 d’Anthropic sur ces tâches, mais n’a pas communiqué les chiffres de cette comparaison.
L’entreprise prévoit de mettre ces compétences en pratique, notamment en aidant les assureurs à évaluer les dégâts causés par les tempêtes à partir de photos aériennes, les services publics à inspecter les lignes électriques et les exploitations agricoles à surveiller la santé de leurs cultures. Le nouveau modèle, « Large 4 », est également capable de convertir des dessins techniques en modèles CAO, et Mistral affirme qu’il affiche d’excellentes performances lors des tests sur les semi-conducteurs, ce qui suggère qu’il est destiné à une clientèle industrielle.
La cybersécurité est au cœur de ce modèle, et c’est là que l’ouverture revêt toute son importance. Les modèles les plus puissants issus des laboratoires américains sont fermés : les clients ne peuvent les louer que via les serveurs du fournisseur, et c’est ce dernier qui décide de ce que le modèle peut ou ne peut pas faire. Une fois les poids de Large 4 rendus publics, une banque ou un gouvernement peut télécharger le modèle, l’exécuter sur ses propres machines et l’utiliser pour protéger ses propres réseaux sans avoir à demander l’autorisation à qui que ce soit.
Pour les équipes de sécurité, cette différence est d’ordre pratique. Elles doivent analyser quotidiennement leurs systèmes à la recherche de nouvelles vulnérabilités, et les modèles fermés sont souvent trop coûteux pour un tel volume de travail, trop restrictifs, ou refusent tout simplement la demande. L’entreprise affirme également que « Large 4 » surpasse les meilleurs modèles ouverts de Kimi, DeepSeek et Meta sur les tâches liées à la cybersécurité, bien qu’elle n’ait pas communiqué de chiffres pour étayer cette affirmation.
« Ces capacités de cyberdéfense permettront aux entreprises et aux gouvernements de se défendre contre les acteurs malveillants qui piratent les modèles fermés pour mener des cyberattaques », a déclaré Guillaume Lample, cofondateur et directeur scientifique de Mistral. Il existe toutefois une dimension politique : comme le souligne Mistral, les entreprises et les gouvernements ne devraient pas dépendre d’un fournisseur susceptible de désactiver leurs outils à tout moment, et ses clients souhaitent obtenir deux garanties : qu’aucun pays étranger ne puisse leur couper l’accès, et un historique clair de la manière dont le modèle a été entraîné.
Les préoccupations en matière de souveraineté détermineront la manière dont « Large 4 » sera commercialisé. Les clients pourront l’exécuter sur leurs propres serveurs ou l’utiliser via l’API de Mistral dans la région de leur choix, y compris une région européenne où les données sont protégées par la législation de l’UE. Le modèle est également conçu pour fonctionner bien au-delà de l’anglais, puisqu’il a été entraîné sur plus de 160 langues, dont toutes les langues officielles de l’UE ainsi que des langues telles que le coréen.
Tout cela est financé par la levée de fonds de 3 milliards d’euros réalisée par Mistral en septembre, et « Large 4 » est le premier modèle issu de cette opération. Ces mêmes fonds permettront d’acquérir davantage de puissance de calcul, qui devrait être mise en service au cours du premier semestre 2027. Mistral collabore déjà avec plus de 125 grandes entreprises, dont Airbus, ASML et HSBC, et certaines d’entre elles ont contribué à l’entraînement de Large 4 à l’aide des mêmes outils que ceux que Mistral commercialise via sa plateforme Forge.
Avant la publication des poids le 27 octobre, Mistral indique qu’elle publiera davantage d’informations sur la construction du modèle, d’autres résultats de tests de performance, la manière dont il a été affiné après son apprentissage principal et les tests de sécurité auxquels il a été soumis. Par la suite, l'entreprise prévoit d'utiliser le Large 4 comme base pour une nouvelle gamme de modèles spécialisés ; la version que les développeurs peuvent tester aujourd'hui constitue donc un point de départ plutôt qu'un produit fini. « L'idée selon laquelle l'Europe ne serait pas compétitive est donc fausse », a déclaré Arthur Mensch lors d'une conférence à Abu Dhabi, avant le lancement de ce nouveau modèle.
En août 2026, la startup française Mistral AI s’était visiblement repositionnée sur le marché de l'IA. Elle était passée du statut de concurrent direct d'OpenAI à celui d'acteur spécialisé dans la souveraineté numérique européenne. Initialement reconnue pour l'efficacité de ses modèles à poids ouverts, elle avait fini par perdre du terrain face aux Big Tech américains et chinois en raison d'un manque de puissance de calcul et de financements. Cependant, Mistral connaît une croissance financière en vendant des garanties de confidentialité des données sur le sol européen. Elle attire des secteurs stratégiques comme la banque ou la défense, qui privilégient le contrôle local à la puissance brute.
Voici l'annonce de la sortie de Mistral Large 4 :
Découvrez Mistral Large 4
Le Chonk
Aujourd'hui, nous lançons une préversion publique de Mistral Large 4. Officieusement ML4, très officiellement : le Chonk. ML4 repousse les limites de la performance des modèles à poids ouverts. Vous pouvez dès aujourd'hui essayer l'API de préversion sur Mistral Studio. Les poids seront publiés à la fin du mois.
Performances de pointe
ML4 est un modèle nativement multimodal de 1 000 milliards de paramètres, avec 49 milliards de paramètres actifs. C'est à ce jour notre modèle le plus grand et le plus performant, et il continue de s'améliorer rapidement à mesure que nous l'affinons. Le modèle affiche des performances exceptionnelles en codage, en workflows agentiques et en compréhension multimodale. Il rivalise déjà avec les meilleurs modèles open source au monde, tout en surpassant largement tout modèle à poids ouverts développé aux États-Unis ou en Europe.
Sur les charges de travail critiques en entreprise, notamment en cybersécurité, en finance et en droit, il représente selon nous l'état de l'art des modèles ouverts. Dans certains domaines, comme le grounding visuel, il va encore plus loin et surpasse même les modèles fermés de pointe. Nous publierons les poids d'ici la fin du mois. D'ici là, nous soumettons le modèle à un red-teaming en conditions réelles aux côtés de leaders de la cybersécurité, de partenaires validés et d'autorités publiques, qui accéderont au même modèle avec une modération allégée et des capacités cyber étendues.
Forgé en Europe. Conçu pour la souveraineté de l'IA
ML4 a été entraîné à partir de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans nos propres datacenters en Europe. La préversion publique s'exécute sur cette même infrastructure. C'est une étape importante de notre investissement à long terme dans l'infrastructure, la recherche et le développement produit : des performances de pointe dans des secteurs critiques, livrées via des poids ouverts et conçues pour donner aux clients le contrôle sur leur IA.
C'est particulièrement important en cybersécurité, où les refus imposés par les fournisseurs peuvent bloquer des recherches légitimes sur les vulnérabilités et la réponse aux incidents, et où la perte d'accès à une capacité en pleine gestion d'incident peut elle-même devenir un risque de sécurité critique. ML4 associe des performances cyber de tout premier ordre à des poids ouverts et à la possibilité de déployer le modèle soi-même, offrant aux organisations à la fois la capacité et l'autonomie nécessaires pour mener des travaux de sécurité avancés selon leurs propres politiques.
Le modèle sera disponible dans plusieurs régions du monde, dont un déploiement européen opéré de bout en bout par Mistral, indépendamment d'autres fournisseurs de services numériques et dans le cadre du droit européen. À noter : une part importante des données d'entraînement de ML4 était multilingue, couvrant plus de 160 langues, dont toutes les langues officielles de l'Union européenne.
Nous travaillons en étroite collaboration avec des entreprises de premier plan du monde entier — en finance, en ingénierie, en production industrielle, en logistique, dans l'industrie pharmaceutique, dans les sciences, dans le transport maritime, dans le secteur public et dans d'autres industries critiques — pour entraîner ML4. De fait, le modèle utilise le même environnement d'entraînement, de personnalisation et de RL que celui que nous proposons à nos clients via Mistral Forge.
Fonctionnalités en détail
Cybersécurité
ML4 est l'un des modèles d'IA les plus puissants au monde en matière de cybersécurité. Sur l'Artificial Analysis Cyber Index, une évaluation indépendante qui mesure la capacité des modèles d'IA à trouver et corriger des failles de sécurité dans des logiciels réels, il figure parmi les cinq meilleurs modèles au monde et devance très largement les modèles à poids ouverts développés hors de Chine. Sur l'un des tests de cet index, qui demande au modèle de reproduire une véritable vulnérabilité dans un logiciel open source puis de la corriger, ML4 obtient 82 %, le score le plus élevé de tous les modèles. Il résout également 93 % des défis de Cybench, un ensemble de 40 exercices issus de compétitions de sécurité, soit l'un des meilleurs scores rapportés pour un modèle à poids ouverts.
Ce meilleur score reflète un avantage concret. Plusieurs modèles fermés de premier plan, dont Claude Opus 5.5 et GPT-6 Astra, obtiennent un score proche de zéro sur ce même test, car ils refusent d'effectuer la tâche. Or, la défense des logiciels commence souvent par prouver qu'une faille est réelle — précisément le type de travail que les filtres de sécurité des modèles fermés peuvent bloquer. L'enjeu est d'autant plus important que des acteurs malveillants parviennent de plus en plus à jailbreaker ces mêmes modèles pour appuyer des activités cyber offensives : les défenseurs ont besoin de systèmes capables d'égaler ces capacités sans être freinés par les mêmes refus. ML4 sait faire ce travail, et ses capacités vont au-delà de ce pour quoi il a été explicitement entraîné : lors de tests internes, il s'est montré utile pour analyser des malwares, prioriser des vulnérabilités et rédiger des règles de détection. Pour les organisations qui ont besoin d'une IA souveraine et auditable pour leurs opérations de sécurité, il pourra être déployé sur un cloud privé ou on-premise.
ML4 face à la concurrence : un raisonnement efficace sur des défis complexes et variés
Rétro-ingénierie de malwares : résolution d'une tâche d'investigation hors distribution
Codage agentique
ML4 excelle en ingénierie logicielle, en compréhension de dépôts et dans les workflows complexes en terminal, avec 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4. Son score combiné de 49,8 % au Coding Agent Index le place devant DeepSeek V4 Pro 0813 et Qwen3.8 Max.
Nous avons également mené, avec Surge AI, une évaluation humaine en aveugle sur la qualité du code : des annotateurs professionnels ont noté les sorties des modèles sur une échelle de 1 à 5, sans connaître l'identité des modèles. ML4 Preview se classe deuxième sur cinq modèles (3,74), devant Kimi K3 (3,59), GLM-5.3 (3,60) et GLM-5.2 (3,40), et seul Claude Opus 5 (4,22) le devance.
Workflows agentiques
ML4 pilote des agents généralistes qui rassemblent des informations, utilisent des outils et produisent des livrables aboutis dans des workflows complexes. Sur AutomationBench — 657 workflows métier répartis dans des applications comme Gmail, Google Sheets, Slack et Salesforce —, il obtient 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro. Il est tout aussi performant sur les livrables professionnels que produit réellement le travail intellectuel : tableurs, slides et PDF. Sur AA-Briefcase, qui évalue le travail intellectuel sur de longs horizons, il atteint 1 393 Elo, devant DeepSeek V4 Pro.
Multimodal
ML4 marque un changement d'échelle dans la capacité de nos modèles à comprendre les images. Il raisonne avec puissance sur des documents complexes, des graphiques et des images naturelles, et apporte la vision aux industries où la perception est critique, comme l'ingénierie, la production industrielle ou l'observation de la Terre. Le modèle peut en outre combiner grounding visuel et capacités agentiques : de l'inspection d'imagerie satellite gigapixel — pour aider les équipes de réponse aux catastrophes à agir quand chaque minute compte — à l'analyse de plans techniques — en zoomant, inspectant et vérifiant jusqu'à ce que la réponse soit exacte. En grounding visuel plus particulièrement, ML4 est l'un des modèles les plus performants que nous ayons testés, surpassant par exemple GPT-6-Astra sur Dense 200 (42 % contre 41 %).
Sciences et mathématiques
ML4 apporte de solides capacités scientifiques, fruit de la combinaison de méthodes fondées sur l'IA et de l'expertise de nos chercheurs en mathématiques, en physique et en chimie. Il est particulièrement à l'aise en codage agentique pour les tâches scientifiques, comme l'analyse de données, la modélisation ou la simulation de la réalité physique, ce qui permet aux chercheurs de se concentrer sur les questions plutôt que sur la plomberie. Sur les benchmarks, ML4 établit l'état de l'art sur SciCode-Verified parmi les modèles à poids ouverts. En pratique, il peut générer une simulation Hartree–Fock complète en une seule fois — une tâche de chimie complexe et multi-étapes, construite à partir d'une série de routines avancées.
ML4 est également plus solide en mathématiques, tant en raisonnement formel qu'en mathématiques appliquées. Dans nos évaluations humaines, il raisonne avec plus de précision et de structure que GLM-5.3, et il peut mener à bien de longues tâches de mathématiques appliquées à des domaines spécifiques, y compris des travaux pertinents pour la physique théorique la plus avancée. Ensemble, ces capacités font de ML4 un assistant de recherche solide sur l'ensemble du workflow...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.