L'expérience a été menée sur une Toyota Corolla 2022. Le test s'est déroulé avec succès sur un circuit de cônes d'environ 130 mètres dans un parking vide. L’initiative qui n’est pas nouvelle entre dans le cadre de l'intégration des modèles d'IA généralistes (ou modèles de fondation, incluant les LLM et les modèles multimodaux) dans la quête d’atteinte du niveau 5 en matière de conduite autonome. Le véhicule était équipé du boîtier matériel comma four de comma.ai. Ce dispositif est connecté directement au bus CAN de la voiture, permettant à un logiciel tiers d'envoyer des commandes pour agir physiquement sur le volant, l'accélérateur et les freins. Par mesure de sécurité, la vitesse était bridée à 3,5 m/s (environ 12 km/h), et un conducteur humain était présent à bord, prêt à écraser le frein d'urgence à tout moment.
Contrairement aux systèmes embarqués classiques, GPT-6 Astra n'avait pas un contrôle direct et continu sur la physique du véhicule. L'expérience a été menée via une interaction textuelle et visuelle par API.
Le modèle tournait au sein de son environnement de codage habituel (l'API Codex d'OpenAI). Il pilotait la voiture commande par commande dans une session de chat active. Le script mettait à disposition du LLM trois fonctions clés : observe() pour analyser le flux de la caméra et les données du véhicule, set_motion() pour ajuster la direction et la vitesse, et stop_now() pour le freinage d'urgence.
Lors de sa première tentative, Astra a échoué à 67 mètres en touchant une ligne blanche suite à un virage mal anticipé. Les chercheurs ont laissé le modèle analyser son propre échec dans le prompt, puis tenter à nouveau l'exercice. Lors de ce deuxième essai, Astra a adapté sa stratégie en effectuant des mouvements plus courts, plus lents, et en braquant à fond pour négocier les virages serrés, terminant le parcours à 100 % en 5 minutes et 22 secondes.
L’initiative est similaire à celle de Waymo au travers de son modèle multimodal de bout-en-bout pour la conduite autonome (EMMA) et ses résultats académiques probants.We gave ChatGPT, Claude, and Grok control of a real Toyota Corolla 🚗, steering/gas/brakes, no human driving (just a foot over the brake).
— DrivingBench (@DrivingBench) September 21, 2026
Only one model was able to complete our entire driving course. Introducing DrivingBench. 🔥⌛️🏁 pic.twitter.com/HhukXrByus
Le modèle d'IA multimodal EMMA (End-to-end Multimodal Model for Autonomous driving) a été présenté par Waymo fin 2024. L'objectif principal d'EMMA est de démontrer le potentiel des modèles de fondation multimodaux pour la conduite autonome de bout-en-bout. Plutôt que de diviser le système de conduite en modules isolés (un pour la détection, un pour la cartographie, un pour la trajectoire), Waymo a voulu explorer un système unifié capable de traiter simultanément toutes ces tâches. Le but est de transférer les connaissances générales sur le monde acquises par les grands modèles de langage pour aider le véhicule à mieux raisonner face à des situations complexes ou inédites.
Contrairement à la flotte commerciale de Waymo qui s'appuie fortement sur les capteurs LiDAR et les radars, la recherche EMMA a été conçue pour traiter directement les flux vidéo de caméras embarquées (généralement 8 caméras offrant une couverture à 360 degrés).
Bien que le document de recherche se concentre sur l'architecture logicielle, l'entraînement de ce modèle a été réalisé sur les infrastructures de calcul de sa maison-mère Alphabet, en utilisant les TPU (Tensor Processing Units) de Google dédiés aux modèles massifs comme Gemini.
Le modèle s'affranchit des cartes haute définition ultra-détaillées habituellement indispensables, requérant simplement des données de navigation standard (type Google Maps).
Bien qu'il s'agisse encore d'un modèle de recherche pur (non déployé directement dans les robotaxis en circulation commerciale sans supervision humaine), les résultats académiques ont été particulièrement probants. EMMA a atteint le meilleur niveau de performance de l'époque en matière de planification de mouvement en boucle ouverte sur le benchmark de référence nuScenes. Le modèle a obtenu des scores très solides sur le Waymo Open Motion Dataset (WOMD) ainsi que pour la détection d'objets en 3D.
Les tests ont montré qu'EMMA était capable d'éviter des obstacles pour lesquels il n'avait jamais été explicitement entraîné (comme des animaux traversant la route ou des détritus), prouvant l'efficacité de sa logique globale.
L'enthousiasme pour cette approche est immense, mais elle s'accompagne d'un pragmatisme rigoureux de la part des leaders technologiques et académiques.
En dévoilant de nouvelles architectures d'IA pour les véhicules autonomes en 2026, Jensen Huang a qualifié cette bascule de "moment ChatGPT de l'IA physique". Pour lui, l'intégration de modèles capables de "réfléchir" à des scénarios rares et d'expliquer leurs décisions est le verrou qui sautera pour naviguer en toute sécurité dans la complexité du monde réel.
Selon les travaux et interventions du Professeur Marco Pavone (Stanford / Directeur de la recherche AV chez NVIDIA), les modèles de fondation permettent aux véhicules de développer des capacités d'adaptation similaires à celles d'un conducteur humain. Ses recherches sur des projets comme Agent Driver démontrent qu'un LLM utilisé comme agent décisionnel surpasse les modèles autonomes traditionnels en exploitant sa base de connaissances globales, réduisant le besoin de milliards de kilomètres de données spécifiques
Selon Luc Julia (Expert IA, co-créateur de Siri), la plupart des constructeurs automobiles ont réalisé que le niveau 5 absolu relève de l'utopie commerciale ou technologique à court et à moyen terme en raison de son coût prohibitif et de sa complexité et préfèrent se concentrer sur des niveaux 4 robustes (autonomie dans des zones définies ou des flottes de robotaxis).
Les évaluations de benchmarks récents (comme Drive4C) indiquent que si les modèles d'IA généralistes possèdent une excellente compréhension sémantique des images (identifier un objet), ils ont encore d'importantes faiblesses en matière de compréhension spatiale précise (estimer les distances au centimètre près) et de physique dynamique, deux critères pourtant vitaux pour exécuter une action de conduite critique en temps réel.
Conclusion
L'IA généraliste est perçue par la communauté scientifique comme l'ingrédient manquant pour briser le plafond de verre de la conduite autonome. Cependant, les experts s'accordent à dire qu'un modèle généraliste pur ne peut pas piloter seul : il doit être couplé à une architecture modulaire et sécurisée similaire à celles présentes dans les véhicules actuels.
Et vous ?
Voyez-vous aussi les IA généralistes comme un atout pour la recherche en matière de quête du niveau 5 en conduite autonome ?
Sinon quelle approche préconiseriez-vous ?Voir aussi :
Tesla a dissimulé des données, menti et induit la police en erreur afin d'échapper à toute responsabilité dans un accident mortel impliquant son logiciel Autopilot. Il a été reconnu partiellement responsable
Tesla modifie la signification du terme « Full Self-Driving » et renonce à sa promesse d'offrir une conduite autonome sans surveillance. Les problèmes techniques persistent et le logiciel rebute les clients
« Le véhicule a soudainement accéléré avec notre bébé à l'intérieur » : la terrifiante vérité sur les raisons pour lesquelles les voitures Tesla continuent de s'écraser
Vous avez lu gratuitement 34 609 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Et meme pire, en france on la chance d'avoir des pauvres qui roule encore avec des vielles casserole et apporte de la mixité, a Singapour c'est que des tesla/suv chinois moderne et sur équipé toute option, ils se ressemble tous et sont très insipide. Très rare de tomber sur un think different.