Google a aujourd’hui le lancement de Gemini 3.8 Live et de Gemini 3.8 Live Extended Thinking, qu’il présente comme ses « modèles de dialogue en temps réel les plus avancés à ce jour ». Comme son nom l’indique, Gemini 3.8 Live Extended Thinking offre « une intelligence accrue et un raisonnement en plusieurs étapes ». Il est destiné à des tâches hautement complexes telles que les fonctionnalités récemment lancées Gmail Live (recherche conversationnelle), Docs Live (génération et édition de brouillons) et Keep Live (création de notes). Par ailleurs, le modèle de base Gemini 3.8 Live offre « une intelligence conversationnelle avec des dialogues fluides et une ancrage visuel ».Gemini est une famille de grands modèles de langage multimodaux (LLM) développée par Google DeepMind, qui succède à LaMDA et PaLM 2. Composée de Gemini Pro, Gemini Deep Think, Gemini Flash et Gemini Flash Lite, elle a été annoncée le 6 décembre 2023. Récemment, Google a aujourd’hui le lancement de Gemini 3.8 Live et de Gemini 3.8 Live Extended Thinking, qu’il présente comme ses « modèles de dialogue en temps réel les plus avancés à ce jour ».
Après le lancement de 3.1 Flash Live en mars, ces nouveaux modèles visent à « rendre les conversations avec l’IA plus intuitives et plus intelligentes ». Comme son nom l’indique, Gemini 3.8 Live Extended Thinking offre « une intelligence accrue et un raisonnement en plusieurs étapes ». Il est destiné à des tâches hautement complexes telles que les fonctionnalités récemment lancées Gmail Live (recherche conversationnelle), Docs Live (génération et édition de brouillons) et Keep Live (création de notes). Le modèle commence également à être déployé sur Gemini Live dès aujourd’hui.
Gemini 3.8 Live Extended Thinking « raisonne et s’exprime simultanément ». Il offre une intelligence accrue pour les flux de travail complexes tout en maintenant un flux conversationnel ininterrompu — en utilisant des indices verbaux précoces tels que « Laisse-moi vérifier ça… » pour répondre naturellement aux demandes, et une narration en direct de la progression afin de guider les utilisateurs à travers des tâches en arrière-plan en plusieurs étapes au fur et à mesure de leur avancement.
En termes de benchmarks, Gemini 3.8 Live Extended Thinking se place à la première place au classement général de l’indice de qualité « Speech to Speech » d’Artificial Analysis (82,6). Le modèle est également en tête pour l’exécution de tâches agentiques avec 68,6 % sur τ-Voice, présente un score de 35,1 % sur le benchmark τ-Voice-banking de Sierra. Le modèle intègre également de solides capacités de raisonnement, avec un score de 97,7 % sur Big Bench Audio, tout en conservant un prix très compétitif par rapport aux autres modèles de pointe.
Par ailleurs, le modèle de base Gemini 3.8 Live offre « une intelligence conversationnelle avec des dialogues fluides et une ancrage visuel ». Le modèle est capable de traiter « des entrées visuelles en temps quasi réel », les outils et les appels d’API s’exécutant en arrière-plan pendant que la conversation se poursuit. Les utilisateurs peuvent s’attendre à ce que le modèle « prenne en compte les demandes et continue à discuter pendant que les tâches s’exécutent en arrière-plan ». De plus, il est capable de détecter et de basculer entre les 97 langues prises en charge en cours de conversation. Il est « conçu pour l’évolutivité et la rentabilité » et occupe « la deuxième place du classement Speech Agent Arena ». Gemini 3.8 Live sera au cœur de l’expérience Search Live d’AI Mode.
Voici l'annonce de Google :
Présentation de Gemini 3.8 Live et 3.8 Live Extended Thinking
Aujourd’hui, nous présentons deux nouveaux modèles qui apportent des avancées en matière de raisonnement en temps quasi réel afin d’optimiser les performances des agents vocaux et de rendre les conversations avec l’IA plus intuitives et plus intelligentes.
- Gemini 3.8 Live : conçu pour l’évolutivité et la rentabilité, il allie l’intelligence conversationnelle à un dialogue fluide et à un ancrage visuel.
- Gemini 3.8 Live Extended Thinking : conçu pour les tâches hautement complexes, avec une intelligence accrue et un raisonnement en plusieurs étapes.
Pour les développeurs et les entreprises, ces modèles fournissent les éléments de base nécessaires à la création d’agents vocaux fiables et prêts à l’emploi. Ils rendent également les échanges avec Gemini via l’application Gemini, Google Workspace et la Recherche plus fluides et collaboratifs, vous aidant ainsi à accomplir des tâches complexes à l’aide de votre seule voix.
Profitez de conversations plus fluides et plus intelligentes
Gemini 3.8 Live Extended Thinking offre une exécution des tâches et une intelligence de niveau entreprise. Il occupe la première place du classement général de l’indice de qualité « Speech to Speech » d’Artificial Analysis (82,6) et se distingue dans l’exécution de tâches de type « agent » avec un score de 68,6 % sur τ-Voice et de 35,1 % sur le benchmark τ-Voice-banking de Sierra. Il offre également de solides capacités de raisonnement, avec un score de 97,7 % sur Big Bench Audio, tout en conservant un prix très compétitif par rapport aux autres modèles de pointe.
Gemini 3.8 Live a suscité un vif intérêt auprès des utilisateurs, se classant à la deuxième place du classement Speech Agent Arena. Outre ces performances, il reste très rentable, offrant aux développeurs et aux entreprises un modèle performant et efficace, conçu pour évoluer à grande échelle.
Sur EVA-Bench de ServiceNow, un benchmark destiné à évaluer les agents vocaux, nos modèles repoussent la frontière de Pareto pour les workflows complexes en parvenant à trouver le juste équilibre entre précision et qualité conversationnelle.
Gemini 3.8 Live traite les entrées visuelles en temps quasi réel, enrichissant les conversations de contexte pour des réponses plus pertinentes. Il détecte automatiquement les 97 langues prises en charge et bascule entre elles au cours d’une conversation. Il exécute des outils et des appels d’API en arrière-plan tout en poursuivant la conversation ; le modèle peut ainsi prendre en compte les demandes et continuer à dialoguer pendant que les tâches s’exécutent en arrière-plan.
Pour les tâches nécessitant un raisonnement plus approfondi, la fonctionnalité « Extended Thinking » de la version 3.8 Live raisonne et s’exprime simultanément. Elle offre une intelligence accrue pour les flux de travail complexes tout en maintenant un flux conversationnel ininterrompu — en utilisant des indices verbaux précoces tels que « Laisse-moi vérifier ça… » pour accuser réception des demandes de manière naturelle, ainsi qu’une narration en direct de la progression afin de guider les utilisateurs à travers les tâches en arrière-plan comportant plusieurs étapes au fur et à mesure de leur avancement.
Que ce soit dans Google Workspace ou dans la recherche Google, nos modèles « Live » offrent des expériences plus intuitives et collaboratives, notamment lorsque vous devez mener à bien vos tâches les plus complexes.
Renforcer l’écosystème vocal des développeurs et des entreprises
Grâce à l’API Gemini Live, des plateformes de développement telles qu’Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents permettent aux développeurs de créer et de déployer facilement des interfaces vocales hautement performantes. Ces plateformes gèrent en arrière-plan l’infrastructure complexe de diffusion multimédia en temps réel, ce qui permet aux développeurs de se concentrer entièrement sur la conception de l’expérience utilisateur.
Nous collaborons également avec des entreprises telles que Salesforce, Genspark et Lumeris, qui se montrent enthousiastes à l’égard de 3.8 Live et 3.8 Live Extended Thinking, soulignant leur latence impressionnante, leur fluidité et leurs capacités d’appel d’outils.
Garantir la transparence grâce au tatouage numérique SynthID
Tous les fichiers audio générés par nos produits d’IA sont marqués d’un tatouage numérique SynthID. Ce filigrane imperceptible est directement intégré à la sortie audio, garantissant que le contenu généré par l’IA reste identifiable afin de contribuer à la prévention de la désinformation. Pour plus de détails sur notre approche en matière de sécurité et de responsabilité, consultez la fiche du modèle.
Commencez à utiliser nos derniers modèles Gemini Audio :
3.8 Live est déployé à partir d’aujourd’hui :
- Pour les développeurs : dans l’API Gemini et Google AI Studio
- Pour les entreprises : en préversion privée dans Gemini Enterprise et bientôt disponible dans Gemini Enterprise for Customer Experience
- Pour tous : dans Search Live
La version 3.8 Live « Extended Thinking » est déployée à partir d’aujourd’hui :
- Pour les développeurs : dans l’API Gemini et Google AI Studio
- Pour les entreprises : en préversion privée dans Gemini Enterprise et bientôt disponible dans Gemini Enterprise for Customer Experience et pour les clients professionnels de Google Workspace
- Pour tous : dans Gemini Live et pour les abonnés à Google AI Pro et Ultra dans Workspace (Docs), ainsi que pour tous les abonnés à Google AI dans Gmail et Keep
Source : Annonce de Google
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?Voir aussi :
La start-up française Mistral AI annonce le lancement de Voxtral TTS, un modèle d'IA de synthèse vocale conçu pour la génération vocale multilingue avancée dans 9 langues, dont l'anglais et le français
OpenAI lance les modèles IA vocaux GPT-Live, qui permettent d'écouter et de parler en temps réel partout dans le monde, ouvrant de nouvelles possibilités pour les services interactifs et l'automatisation
La société IA xAI d'Elon Musk lance « Custom Voices » pour le clonage vocal instantané dans les API de synthèse vocale et d'agents vocaux. Le processus prend moins de deux minutes pour un modèle prêt à l'emploi
Vous avez lu gratuitement 20 157 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.