IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

SpaceXAI lance Grok 4.7 à des prix très avantageux en apparence, mais le modèle peut s'avérer gourmand en tokens. Les tests de performance révèlent également un écart important par rapport à Claude et GPT-6

Le , par Mathis Lucas

190PARTAGES

4  0 
SpaceXAI d'Elon Musk lance Grok 4.7, une nouvelle version de son modèle d'IA optimisée pour les tâches de programmation de longue durée. La société revendique des performances supérieures à la concurrence grâce à un entraînement renforcé qui accroit l'endurance et la capacité d'autovérification de Grok. Toutefois, les tests indépendants révèlent qu'il échoue encore fréquemment face à des problèmes complexes. Malgré un tarif compétitif, Grok 4.7 reste nettement distancé par ses principaux concurrents Claude Fable 5.1 et GPT-6 sur les principaux benchmarks. Sur Artificial Analysis Intelligence Index, Grok 4.7 se classe en milieu de tableau.

Grok 4.7 est la dernière mouture de la famille de grands modèles de langage (LLM) Grok développés par l'entreprise SpaceXAI d'Elon Musk. Il est dédié au codage et aux tâches professionnelles nécessitant des connaissances spécialisées. D'après l'entreprise, Grok 4.7 repose sur un modèle de base plus volumineux, a été entraîné grâce à un apprentissage par renforcement plus long et a été conçu pour vérifier profondément ses propres résultats.

Cet entraînement a été délibérément orienté vers des tâches complexes afin de permettre à l'agent de gérer un historique d'interactions volumineux sans perdre le fil. L'entreprise présente Grok 4.7 comme la version de son modèle la plus performante à ce jour pour le codage et le travail intellectuel. Les tests de performance révèlent la direction que prendront prochainement les agents de programmation basés sur les grands modèles de langage.

Un agent de programmation fonctionnant pendant des heures peut prendre des dizaines de décisions tout en modifiant des fichiers, en effectuant des tests et en corrigeant des erreurs. Une seule erreur peut avoir des répercussions sur le reste de la tâche, à moins que l'agent ne la détecte. SpaceXAI semble entraîner Grok précisément pour résoudre ce problème. L'approche de SpaceXAI avec Grok 4.7 se distingue nettement du reste de l'industrie.

Chaque approche infructueuse d'un agent enrichit l'historique que le modèle doit gérer, et une seule hypothèse erronée peut se répercuter sur le reste de la tâche. SpaceXAI tente de remédier à cela grâce à une meilleure gestion du contexte et à une auto-vérification plus efficace, afin que Grok puisse détecter une erreur avant de s’y appuyer. Toutefois, les tests montrent que le modèle échoue encore fréquemment face à des tâches complexes.

Intégration native du harnais de contrôle et tarification agressive

Une innovation clé de Grok 4.7 réside dans son entraînement natif à la compréhension du harnais Grok Bot. Au lieu d'apprendre les formats d'outils et les schémas d'exécution au moment de l'inférence via des invites système, le modèle intègre directement la structure de son infrastructure hôte. Cela traduit une évolution majeure du secteur où « le modèle n'est plus la seule pièce optimisée, les systèmes qui l'entourent évoluent également ».


Sur le plan commercial, SpaceXAI propose Grok 4.7 à un tarif particulièrement compétitif ; ses tarifs sont en effet plus proches des modèles chinois que ceux proposés par les autres Big Tech américains. Le nouveau modèle Grok 4.7 est rendu accessible via l'API Grok, ainsi que sur les plateformes Cursor et Grok Build. Il est également disponible via des frameworks tiers de codage, des routeurs de modèles, ainsi que des plateformes cloud.

L'entreprise a opté pour une prise en charge élargie. GitHub déploie séparément Grok 4.7 de manière progressive sur Copilot Pro, Pro+, Max, Business et Enterprise, avec une prise en charge couvrant Visual Studio Code (VS Code), Visual Studio, Copilot CLI, l’agent cloud de GitHub, JetBrains, Xcode et Eclipse.

Pour les développeurs individuels, l’aspect le plus significatif de cette nouvelle version réside peut-être dans ce qui n’a pas changé : le prix. Grok 4.7 est proposé à partir de 2 dollars par million de tokens d’entrée et 6 dollars par million de tokens de sortie, soit les mêmes tarifs que Grok 4.6, sorti il y a à peine plus d’un mois. Cependant, pour les équipes d’ingénieurs, le plus important ici n’est peut-être pas du tout le tarif par million de tokens.

Plus précisément, les équipes d'ingénieurs doivent choisir le modèle sur lequel faire passer leurs charges de travail agentiques. Le plus important pour elles serait donc « le coût de la réalisation réussie d’une tâche », une fois les tokens de raisonnement pris en compte, les appels d’outils tiers et les boucles d’agent de longue durée. De nouveaux tests indépendants menés sur Grok 4.7 soulignent particulièrement l’importance de cette distinction.

SpaceXAI propose également une variante rapide offrant une vitesse de traitement des tokens accrue pour un prix deux fois plus élevé (4 $/12 $ par million de tokens d'entrée/sortie), bien que l'entreprise n’ait pas publié de chiffre concernant le nombre de tokens par seconde et que des mesures indépendantes du débit n’étaient pas encore disponibles au moment de la publication. Les caractéristiques de Grok 4.7 suscitent des réactions mitigées.

Benchmark : Grok 4.7 reste à la traine face aux rivaux américains

SpaceXAI indique avoir amélioré la gestion des contextes longs et avoir entraîné Grok 4.7 pour qu’il fonctionne mieux avec « Grok Bot Harness », récemment publié et axé sur l’IA agentique. Grok 4.7 affiche des gains de performance notables par rapport à son prédécesseur, Grok 4.6, sur des benchmarks tiers courants. Cependant, le modèle reste à la traine par rapport aux derniers modèles de ses rivaux américains OpenAI, Anthropic et même Google.


Pour reprendre les termes de Dan McAteer, développeur et auteur, dans son billet publié sur X (ex-Twitter), « ses performances sont épouvantables sur Terminal-Bench », le benchmark d’utilisation de terminal sur lequel il a pourtant enregistré la plus forte amélioration globale par rapport à son prédécesseur.

L'entreprise indépendante d’évaluation de modèles d’IA Artificial Analysis a mesuré les performances de Grok 4.7, avec son paramètre d’effort de raisonnement « xHigh ». Sur Artificial Analysis v4.3.2, qui combine 10 benchmarks, Grok 4.7 obtient un score global de 46, se situant au milieu du peloton, derrière Claude Fable 5.1 et GPT-6 qui prennent la tête avec un score de 53 chacun. L'écart pourrait davantage se creuser à la prochaine génération.

Sur le benchmark de codage agentique Terminal-Bench 4.0, les chiffres varient selon les sources : SpaceXAI a annoncé un score de 38,0 % pour Grok 4.7, en nette progression par rapport aux 20,3 % de Grok 4.6, tandis que les tests d'Artificial Analysis lui attribuent 26 %. À titre de comparaison, sur Terminal-Bench 4.0, GPT-6 Astra atteint 60 %, Claude Fable 5.1 se situe entre 55 % et 57,9 %, et DeepSeek V4.1 Flash le dépasse de peu avec 27 %.

Sur CursorBench 4.0, Grok 4.7 xHigh obtient un score de 46,3 %, contre 40,4 % pour Grok 4.6 High. GPT-5.6 Sol Max obtient un score de 41,7 % dans la comparaison de SpaceXAI, tandis que Fable 5.1 Max atteint 51,8 %. Sur DeepSWE v1.1, Grok 4.7 atteint 71,0 %, contre 65,2 % pour Grok 4.6. D'autres se sont toutefois montrés impressionnés par Grok 4.7. D'après certains fans, leurs propres mesures affichent des résultats plus impressionnants.

L’utilisateur @haider1, très suivi sur X et spécialisé dans l’actualité de l’IA, a qualifié les chiffres de CursorBench « d’absurdes », ajoutant que Grok 4.7 xHigh affichait 46,3 % pour environ 6,01 $ par tâche, contre 46,8 % à 7,05 $ pour Fable 5.1 Medium et 41,7 % à 8,23 $ pour GPT-5. 6 Sol Max dans le classement présenté dans son message. Il a également souligné l’amélioration par rapport à Grok 4.6, pour des tarifs à peu près comparables.

Grok 4.7 pourrait s'avérer beaucoup plus coûteux dans la pratique

Les tests réalisés par la société indépendante Artificial Analysis apportent désormais une nuance importante à l’argument du prix affiché. Grok 4.7 xHigh a utilisé environ 81 000 tokens de sortie par tâche de l’Intelligence Index, contre 36 000 pour Grok 4.6 High et 27 000 pour GPT-6 Astra Max. Selon Artificial Analysis, cela représente une consommation de tokens de sortie supérieure de 125 % à celle de Grok 4.6 et de 196 % à celle de GPT-6 Astra.


Artificial Analysis a également publié un résultat exprimé en dollars pour le coût par tâche : environ 3,74 $ par tâche de l’Intelligence Index pour Grok 4.7 xHigh et 2,73 $ pour Grok 4.7 High. À titre de comparaison, ce même benchmark situe actuellement GPT-5.6 Sol Max à environ 1,99 $ par tâche, malgré ses tarifs catalogue d’entrée/sortie nettement plus élevés (4 $/20 $). Grok 4.7 pourrait donc s'avérer beaucoup plus coûteux dans la pratique.

Cela va à l'encontre de ce que l'on pourrait penser à première vue en consultant la grille tarifaire de l'API. Un modèle facturant moins par token peut tout de même s'avérer plus coûteux pour une charge de travail donnée s'il nécessite un nombre nettement plus élevé de tokens de raisonnement pour y parvenir. Et cette différence devient rapidement significative à l'échelle de l'entreprise. Cela rend difficile la maîtrise des coûts liés à l'IA.

Aux tarifs...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !