Grok Voice Think Fast 2.0 améliore les conversations vocales 

Suivez Intelligence-Artificielle

Grok Voice Think Fast 2.0 est la nouvelle version du modèle speech-to-speech de xAI. Elle est conçue pour les développeurs et les entreprises qui créent des agents vocaux destinés au service client, à la vente ou à l’assistance téléphonique. 

Cette mouture remplace la version 1.0, lancée seulement quelques mois plus tôt, en avril 2026. Accessible directement depuis le cloud via une connexion WebSocket, elle mise avant tout sur des échanges plus rapides et plus fluides entre l’utilisateur et l’assistant. Grok Voice Think Fast 2.0 s’inscrit dans la volonté de l’entreprise de faire évoluer ses solutions d’intelligence artificielle vocale. 

Une réponse plus rapide sans interrompre le raisonnement

La principale évolution de cet outil de synthèse vocale de xAI concerne la façon dont le modèle traite une conversation. Au lieu d’attendre la fin de la demande avant de répondre, Grok Voice Think Fast 2.0 est capable d’écouter, de réfléchir et de générer une réponse presque simultanément.

Youtube video

Selon les mesures d’Artificial Analysis, le délai avant la première réponse tombe à 0,70 seconde, contre 1,25 seconde avec la version précédente. Cette réduction peut sembler modeste sur le papier. Pourtant, elle rend les échanges plus naturels, notamment lors d’un appel téléphonique où chaque fraction de seconde compte.

D’après xAI, cette amélioration s’accompagne d’une baisse d’environ 60 % des tokens de raisonnement utilisés par le modèle. En pratique, cela lui permet d’appeler des outils ou des services externes dès les premiers instants de la conversation, sans attendre que la réponse soit entièrement construite.

Des résultats solides face aux autres modèles

Les premiers tests publiés montrent également une progression des performances. Sur le classement Speech-to-Speech d’Artificial Analysis, Grok Voice Think Fast 2.0 obtient un score de 82,9 %. Il devance ainsi GPT-Realtime-2.1 High, crédité de 79,1 %, ainsi que Gemini 3.1 Flash High, qui atteint 69,5 %.

Le modèle progresse aussi sur le benchmark τ-voice Bench, consacré aux capacités agentiques des assistants vocaux. Il obtient 56,5 %, contre 52,1 % pour la version 1.0.

Pour la transcription, xAI affirme que son modèle est 1,5 à 2 fois plus précis que Deepgram Nova 3 et ElevenLabs Scribe v2 sur un panel de 24 langues. L’entreprise ajoute que, dans les environnements difficiles, comme les appels téléphoniques compressés ou les lieux bruyants, cet avantage peut être multiplié par dix.

  

De nouvelles fonctions pour les développeurs

Grok Voice Think Fast 2.0 prend également en charge le barge-in, une fonction qui permet à l’utilisateur d’interrompre l’assistant sans casser le fil de la conversation. Cette capacité est devenue essentielle pour offrir une expérience proche d’un échange humain.

xAI indique avoir testé cette nouvelle version sur le support téléphonique de Starlink. Lors de ces essais A/B, l’entreprise affirme avoir observé une amélioration du taux de résolution des demandes ainsi qu’une hausse des conversions commerciales. Aucun chiffre détaillé n’a toutefois été communiqué.

Cette nouvelle version s’accompagne d’une légère hausse du prix, qui passe de 0,05 à 0,08 dollar par minute d’audio. Pour les développeurs déjà utilisateurs du service, la transition devrait rester simple. Le basculement automatique de l’alias grok-voice-latest vers Grok Voice Think Fast 2.0 est prévu le 5 août 2026. L’entreprise ne prévoit aucune modification des prompts existants.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Kits.AI : la manipulation vocale au potentiel illimité

La plateforme s’impose comme le studio vocal IA incontournable pour le clonage de voix chantées, la synthèse vocale et le mastering éthique dès 9,59 $/mois.

15 juillet 2026

Traduction vocale : les professionnels prêts à adopter l’IA

Selon une étude DeepL menée auprès de professionnels français, la traduction vocale en temps réel suscite un intérêt massif. L’intelligence artificielle ne se limite plus

3 juin 2026

Google Vids : 30 nouvelles voix expressives boostées par Gemini 3.1 Flash TTS

Avec Google Vids, la narration IA gagne enfin en relief. Derrière cette évolution, Gemini 3.1 Flash TTS insuffle émotion, rythme et naturel à 30 nouvelles

22 avril 2026

L’IA vocale devient expressive avec Gemini 3.1 Flash TTS

Google dévoile Gemini 3.1 Flash TTS, un modèle de synthèse vocale ultra-réaliste pilotable par des balises audio. Google a franchi une nouvelle étape dans l’IA

17 avril 2026

Google accélère ses conversations vocales avec Gemini 3.1 Flash Live 

Plus réactive, dotée d’une mémoire étendue et efficace en plein brouhaha : Google déploie Gemini 3.1 Flash Live pour transformer nos smartphones en véritables interlocuteurs.

30 mars 2026

IBM et ElevenLabs : Watsonx trouve enfin sa voix

IBM intègre les technologies de synthèse vocale d’ElevenLabs à sa plateforme Watsonx. Ce partenariat vise à humaniser l’IA d’entreprise pour favoriser son adoption massive par

26 mars 2026