Google a annoncé Gemini 4 Argon, mais en limite encore la disponibilité. Gemini 4 Argon est conçu pour des tâches complexes dans les domaines de l'ingénierie logicielle, du droit, de la finance et de la cybersécurité. Google en donne d'abord l'accès à certains professionnels de la cybersécurité sélectionnés dans le cadre de son programme Fairwind. L'entreprise participe également à un processus mis en place par le gouvernement américain pour l'accès aux modèles avant leur lancement officiel. Le modèle est limité à 1 million de tokens en sortie et son tarif de lancement via l’API sera de 2 dollars par million de tokens en entrée et de 10 dollars par million de tokens en sortie.Gemini est une famille de grands modèles de langage multimodaux (LLM) développée par Google DeepMind, qui succède à LaMDA et PaLM 2. Composée de Gemini Pro, Gemini Deep Think, Gemini Flash et Gemini Flash Lite, elle a été annoncée le 6 décembre 2023. Elle alimente le chatbot Gemini et tire son nom du mot latin signifiant « jumeaux » (symbolisant la fusion entre Google Brain et DeepMind) ainsi que du projet Gemini de la NASA.
Google a annoncé Gemini 4 Argon, mais en limite encore la disponibilité. Gemini 4 Argon est conçu pour des tâches complexes dans les domaines de l'ingénierie logicielle, du droit, de la finance et de la cybersécurité. Google en donne d'abord l'accès à certains professionnels de la cybersécurité sélectionnés dans le cadre de son programme Fairwind. L'entreprise participe également à un processus mis en place par le gouvernement américain pour l'accès aux modèles avant leur lancement officiel. Le modèle est limité à 1 million de tokens en sortie et son tarif de lancement via l’API sera de 2 dollars par million de tokens en entrée et de 10 dollars par million de tokens en sortie.
Google n’a pas encore mis Gemini 4 Argon à la disposition de tous les développeurs, entreprises et consommateurs, car l’entreprise teste encore les mesures de sécurité du modèle et recueille les retours d’expérience des premiers utilisateurs. Google participe également au processus volontaire mis en place par le gouvernement américain pour l’accès aux modèles d’IA avant leur lancement officiel.
Concernant les tests de performances, Argon a obtenu un score de 77,9 % sur DeepSWE v1.1 et de 68 % sur CWE-bench. Sa limite de sortie est passée de 64 000 à 1 million de tokens. Le prix de lancement de l’API est de 2 dollars par million de tokens d’entrée et de 10 dollars par million de tokens de sortie. Les clients de l’API payante et les abonnés à Google AI Ultra devraient y avoir accès après la phase initiale de cybersécurité.
Des milliers d’employés de Google utilisent déjà Argon. Ses agents ont contribué à la migration de code C et C++ vers Rust et ont libéré plus de 300 TiB de mémoire dans l’ensemble des centres de données de Google. Cela rappelle les déclarations du PDG de Google, Sundar Pichai, qui a révélé en avril que plus des trois quarts de tout le nouveau code de l'entreprise sont désormais générés par l'IA. Ce chiffre marque une accélération rapide de la transformation interne de Google, passant de 50 % il y a seulement six mois à 75 % aujourd'hui, ce qui marque le début de l'ère « agentique » dans l'ingénierie logicielle.
Les premiers utilisateurs sont des experts en cybersécurité de confiance participant au programme Fairwind de Google. Les équipes internes de Google y ont également accès. Ces utilisateurs reçoivent Argon sans les mesures de protection contre les cyberattaques afin de pouvoir tester ses capacités dans le cadre de leurs activités de sécurité. La société de sécurité Wiz utilise le modèle dans le cadre de son initiative « Scan for Good ».
Google indique qu’Argon a détecté une vulnérabilité critique dans un logiciel de santé utilisé par des hôpitaux du monde entier. Google indique également qu’il met en place des mesures de protection contre les utilisations abusives impliquant des attaques biologiques, chimiques, radiologiques et nucléaires. L’entreprise travaille également à la mise en place d’une protection contre l’injection indirecte de prompts.
Cette annonce intervient alors que Google a récemment déclaré que son modèle Gemini avait piraté trois autres entreprises. C'est la première fois que le géant de la recherche révèle qu'un de ses modèles a accédé de manière autonome et sans autorisation à des systèmes informatiques tiers. En mai, le modèle Gemini a accédé à trois systèmes informatiques privés distincts en devinant des mots de passe et en utilisant à deux reprises une base de données de mots de passe accessibles au public, a indiqué Google. L'incident s'est produit dans le cadre d'un test de sécurité de type « capture the flag » mené par la start-up israélienne Irregular. Cette révélation intervient alors que la surveillance des comportements inappropriés de l'IA s'intensifie à Washington et dans la Silicon Valley.
Voici l'annonce de Google :
Gemini 4 Argon : notre nouvelle ère d'intelligence de pointe
Nous annonçons aujourd’hui notre nouveau modèle de pointe, Gemini 4 Argon, qui est en cours de déploiement auprès d’un groupe de cyberdéfenseurs de confiance dans le cadre de notre programme Fairwind. Conçu pour permettre un raisonnement approfondi dans des flux de travail complexes et à long terme, Argon transforme en profondeur notre façon de travailler et de développer chez Google. Il offre des performances de pointe dans des flux de travail complexes, qu’il s’agisse d’ingénierie logicielle en conditions réelles, de travail intellectuel en entreprise (notamment dans les domaines juridique et financier) ou de cybersécurité.
La mise à disposition en toute sécurité de capacités de pointe à ce niveau nécessite une approche progressive. Nous participons activement au processus volontaire mis en place par le gouvernement américain pour l’accès aux modèles avant leur lancement officiel, tout en élargissant progressivement cet accès. Nous continuerons à recueillir les retours des premiers testeurs tout en affinant les mesures de sécurité avant de mettre Argon à la disposition des développeurs, des entreprises et des consommateurs dès que possible.
Argon sera lancé à un prix de lancement de 2 dollars par million de jetons d’entrée et de 10 dollars par million de jetons de sortie, les jetons d’entrée mis en cache bénéficiant d’une réduction de 95 % par rapport au prix des jetons d’entrée.
Changer notre façon de travailler et de développer chez Google
Gemini 4 Argon alimente déjà nos flux de travail internes, et des milliers d’employés de Google soulignent les atouts du modèle dans les tâches de codage spécialisées, la conduite de recherches approfondies et la rédaction de contenu de qualité. Il aide les équipes à développer plus rapidement, à repousser les limites de la productivité technique et à accélérer les avancées décisives :
- Optimisation algorithmique quantique : Argon aide nos chercheurs en informatique quantique à optimiser les ressources spatio-temporelles (qubits × portes) des sous-routines qui constituent un goulot d’étranglement pour des applications importantes. Dans un exemple concret, il a surpassé de 40 % la référence publiée en l’espace de quelques minutes.
- Efficacité mémoire : une équipe d’agents Argon a analysé les données télémétriques de profilage de l’ensemble du parc informatique afin d’identifier et d’appliquer de manière autonome des optimisations mémoire dans tous les centres de données de Google, libérant ainsi plus de 300 TiB de mémoire une fois le déploiement effectué, avec un gain total estimé entre 500 TiB et 1 PiB.
- Migrations et optimisations de bases de code à grande échelle : les agents Argon travaillent à la migration des bases de code C/C++ vers Rust à l’échelle de Google — allant de dizaines de milliers de lignes dans des bibliothèques centrales telles que re2 et libgav1 jusqu’à plus de 800 000 lignes pour le noyau Zircon de Fuchsia. Compte tenu de l’importance critique de bon nombre de ces systèmes, ces réécritures à grande échelle font l’objet d’audits rigoureux, automatisés et manuels, de tests d’émulation et de révisions avant leur déploiement en production.
Pour libgav1, le logiciel open source de Google dédié au décodage vidéo, les agents Argon ont repris un portage Rust existant et remplacé 32 000 lignes de code SIMD en menant de nombreuses séries d’expériences guidées par le profilage, en étudiant la sortie du compilateur et en produisant du code Rust sûr afin que le compilateur puisse le vectoriser automatiquement. Le résultat final est un décodeur vidéo sans risque pour la mémoire qui s’exécute 2,7 fois plus vite que le portage Rust, avec une sortie vidéo identique, ce qui le rapproche du C++ optimisé.
Aller plus loin dans la résolution de vos problèmes les plus complexes
Afin de soutenir les capacités de Gemini 4 Argon dans des cas d’utilisation plus longs et plus complexes, nous augmentons considérablement la limite de tokens en sortie du modèle pour atteindre 1 million de tokens, un niveau de pointe dans le secteur, contre 64 000 tokens auparavant. Lorsque le modèle dispose de la marge de manœuvre nécessaire pour réfléchir en profondeur et générer des centaines de milliers de tokens en une seule trajectoire, il apporte un nouveau niveau de profondeur au raisonnement pour résoudre des problèmes complexes en une seule fois.
Faciliter le codage et les workflows d’entreprise dans tous les domaines
Les capacités de Gemini 4 Argon en matière de codage, de raisonnement et de multimodalité, ainsi que sa capacité à mener à bien des tâches longues et en plusieurs étapes, lui permettent d’exceller dans toute une gamme de workflows d’entreprise.
Les ingénieurs de Google utilisent Argon pour leurs tâches quotidiennes, du débogage courant aux migrations de bases de code à grande échelle en passant par la conception d’algorithmes. Il établit un nouveau record sur DeepSWE v1.1 (77,9 %), qui mesure les performances d’un modèle dans des tâches réelles d’ingénierie logicielle à long terme.
Au-delà du codage, Argon est le modèle de référence selon l’indice Vals, qui mesure l’impact économique dans les domaines de la finance, du codage, du droit et de la fiscalité, chaque secteur étant pondéré en fonction de sa contribution au PIB américain. Nous observons des performances tout aussi exceptionnelles dans d’autres évaluations spécifiques à certains domaines, comme Vals Finance Agent v2 (recherche financière en plusieurs étapes) et le benchmark Legal Agent de Harvey (recherche juridique et rédaction). Sur AutomationBench, le benchmark de Zapier mesurant l’exécution de bout en bout des fonctions métier essentielles, Argon se classe n° 1 avec un score de 51,3 %.
Argon se distingue également par ses performances exceptionnelles lorsque le travail intellectuel nécessite une compréhension visuelle. Il est capable de réaliser des analyses graphiques professionnelles, d’identifier des détails dans de longues vidéos et de prendre des mesures sur la base d’une série de documents. Par exemple, sur LVBench, qui évalue la compréhension de vidéos longues, Argon est à la pointe de la technologie avec un score de 91,7 %.
À la pointe de la cybersécurité défensive
Afin de mieux préparer les cyberdéfenseurs à la nouvelle ère des cyberattaques, nous avons formé Gemini 4 Argon pour qu’il soit hautement performant en matière de défense cybernétique. Argon est capable de détecter, de valider et de corriger de manière autonome les vulnérabilités logicielles critiques. Pour les cyberdéfenseurs de confiance et nos propres équipes internes chez Google, nous mettrons Argon à disposition sans barrières de sécurité, afin qu’ils puissent exploiter pleinement ses capacités de défense de pointe en matière de cybersécurité.
Wiz utilise déjà Argon pour la défense en matière de cybersécurité dans le cadre de son initiative « Scan for Good » – un programme dédié à la protection gratuite des infrastructures publiques critiques en détectant et en corrigeant les expositions à haut risque. Lors d’une première démonstration de son impact, le modèle a mis au jour une vulnérabilité critique exposant des informations personnelles sensibles dans des logiciels de santé utilisés par des hôpitaux du monde entier, identifiant ainsi un risque grave que les modèles de pointe précédents n’avaient pas détecté.
Sur le benchmark CWE-bench v1, qui évalue la capacité du modèle à corriger les failles de sécurité, Argon se classe ex æquo à la première place avec un score maximal de 68 %, s’appuyant sur les performances de pointe de 3.8 Flash Cyber sur le benchmark CWE-bench v0.
Gemini 4 Argon affiche des progrès impressionnants en matière de détection des vulnérabilités par rapport à 3.8 Flash Cyber. Par exemple :
- Dans le cadre du benchmark interne complet de Google sur les vulnérabilités, Argon a mis au jour un large éventail de failles dans des bases de code complexes couvrant 20 langages de programmation.
- Dans le cadre du benchmark interne de Wiz sur les tests d’intrusion en boîte noire, qui évalue la capacité d’un modèle à analyser des systèmes web en production sans code source, Argon surpasse 3.8 Flash Cyber en matière de découverte de la surface d’attaque, d’identification des vulnérabilités et de production de preuves de concept pour les valider.
Renforcement des mesures de sécurité « Frontier » avant la mise à disposition à grande échelle
Avant de déployer...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.