Grok Voice Think Fast 2.0 améliore les conversations vocales 

Suivez Intelligence-Artificielle

Grok Voice Think Fast 2.0 est la nouvelle version du modèle speech-to-speech de xAI. Elle est conçue pour les développeurs et les entreprises qui créent des agents vocaux destinés au service client, à la vente ou à l’assistance téléphonique. 

Cette mouture remplace la version 1.0, lancée seulement quelques mois plus tôt, en avril 2026. Accessible directement depuis le cloud via une connexion WebSocket, elle mise avant tout sur des échanges plus rapides et plus fluides entre l’utilisateur et l’assistant. Grok Voice Think Fast 2.0 s’inscrit dans la volonté de l’entreprise de faire évoluer ses solutions d’intelligence artificielle vocale. 

Une réponse plus rapide sans interrompre le raisonnement

La principale évolution de cet outil de synthèse vocale de xAI concerne la façon dont le modèle traite une conversation. Au lieu d’attendre la fin de la demande avant de répondre, Grok Voice Think Fast 2.0 est capable d’écouter, de réfléchir et de générer une réponse presque simultanément.

Youtube video

Selon les mesures d’Artificial Analysis, le délai avant la première réponse tombe à 0,70 seconde, contre 1,25 seconde avec la version précédente. Cette réduction peut sembler modeste sur le papier. Pourtant, elle rend les échanges plus naturels, notamment lors d’un appel téléphonique où chaque fraction de seconde compte.

D’après xAI, cette amélioration s’accompagne d’une baisse d’environ 60 % des tokens de raisonnement utilisés par le modèle. En pratique, cela lui permet d’appeler des outils ou des services externes dès les premiers instants de la conversation, sans attendre que la réponse soit entièrement construite.

Des résultats solides face aux autres modèles

Les premiers tests publiés montrent également une progression des performances. Sur le classement Speech-to-Speech d’Artificial Analysis, Grok Voice Think Fast 2.0 obtient un score de 82,9 %. Il devance ainsi GPT-Realtime-2.1 High, crédité de 79,1 %, ainsi que Gemini 3.1 Flash High, qui atteint 69,5 %.

Le modèle progresse aussi sur le benchmark τ-voice Bench, consacré aux capacités agentiques des assistants vocaux. Il obtient 56,5 %, contre 52,1 % pour la version 1.0.

Pour la transcription, xAI affirme que son modèle est 1,5 à 2 fois plus précis que Deepgram Nova 3 et ElevenLabs Scribe v2 sur un panel de 24 langues. L’entreprise ajoute que, dans les environnements difficiles, comme les appels téléphoniques compressés ou les lieux bruyants, cet avantage peut être multiplié par dix.

  

De nouvelles fonctions pour les développeurs

Grok Voice Think Fast 2.0 prend également en charge le barge-in, une fonction qui permet à l’utilisateur d’interrompre l’assistant sans casser le fil de la conversation. Cette capacité est devenue essentielle pour offrir une expérience proche d’un échange humain.

xAI indique avoir testé cette nouvelle version sur le support téléphonique de Starlink. Lors de ces essais A/B, l’entreprise affirme avoir observé une amélioration du taux de résolution des demandes ainsi qu’une hausse des conversions commerciales. Aucun chiffre détaillé n’a toutefois été communiqué.

Cette nouvelle version s’accompagne d’une légère hausse du prix, qui passe de 0,05 à 0,08 dollar par minute d’audio. Pour les développeurs déjà utilisateurs du service, la transition devrait rester simple. Le basculement automatique de l’alias grok-voice-latest vers Grok Voice Think Fast 2.0 est prévu le 5 août 2026. L’entreprise ne prévoit aucune modification des prompts existants.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

OpenAI déploie GPT-Live-1 dans l’API : des agents vocaux en duplex intégral plus humains

OpenAI vient de rendre le modèle GPT-Live-1 accessible via son API. Conçu pour remplacer les chaînes logicielles morcelées (STT-LLM-TTS), ce système fonctionne en duplex intégral.

14 septembre 2026

Muse Voice Transcribe : transcription IA en temps réel multilingue et multi-locuteurs

Le Meta Superintelligence Lab (MSI) vient de lancer Muse Voice Transcribe, son tout premier modèle audio en temps réel. Présenté ce 1er septembre 2026 par

4 septembre 2026

Kits.AI : la plateforme pour la voix chantée par IA

Arpeggi Inc lance Kits.AI pour simplifier la production musicale depuis votre navigateur ou votre logiciel DAW. Le studio convertit vos enregistrements bruts en voix chantées

26 août 2026

Suno v4.5 une actualisation majeure pour cet outil de génération musicale

Suno v4.5 une actualisation majeure pour cet outil de génération musicale

Suno v4.5 a marqué une étape majeure dans la génération musicale par IA en 2025. Ce modèle a redéfini la qualité vocale, la richesse sonore

25 août 2026

MAI-Voice-2 : l’IA de Microsoft qui rend les voix plus naturelles

Avec MAI-Voice-2, Microsoft cherche à gommer l’un des principaux défauts des voix IA : leur manque de naturel. Alors que les anciennes voix artificielles étaient

31 juillet 2026

Traduction vocale : les professionnels prêts à adopter l’IA

Selon une étude DeepL menée auprès de professionnels français, la traduction vocale en temps réel suscite un intérêt massif. L’intelligence artificielle ne se limite plus

3 juin 2026