OpenAI déploie GPT-Live-1 dans l’API : des agents vocaux en duplex intégral plus humains

Suivez Intelligence-Artificielle

OpenAI vient de rendre le modèle GPT-Live-1 accessible via son API. Conçu pour remplacer les chaînes logicielles morcelées (STT-LLM-TTS), ce système fonctionne en duplex intégral. Il permet aux agents d’écouter et de parler simultanément. Et grâce à une latence de réponse réduite à 0,798 seconde, une gestion fluide des interruptions et la délégation du raisonnement à des modèles backend comme GPT-6 Astra, cette solution permet de déployer des assistants téléphoniques virtuels pour 0,05 $ la minute.

En réunissant le traitement audio entrant et sortant au sein d’un modèle unique, OpenAI élimine la rigidité des architectures vocales traditionnelles. En effet, cette technologie parvient à isoler le bruit de fond, absorber les interruptions en temps réel et maintenir des conversations naturelles sur la longue durée

Le couplage entre cette couche vocale frontale et la puissance analytique de Codex ou d’Astra offre donc la possibilité d’automatiser le support client téléphonique sans dégrader l’expérience utilisateur. Mais comment ?

Une architecture unifiée qui supprime la latence et simplifie le code

Les agents vocaux traditionnels reposent sur l’assemblage de trois briques distinctes : la transcription vocale (STT), un modèle de langage (LLM) et la synthèse vocale (TTS). Cependant, cette superposition d’étapes génère une latence élevée et multiplie les risques de rupture de contexte. De ce fait, les développeurs devaient jusqu’ici concevoir des algorithmes complexes pour gérer manuellement les pauses, les hésitations et les chassés-croisés de parole.

Youtube video

GPT-Live-1 résout cette problématique en fusionnant l’écoute et l’émission au sein d’une architecture unifiée. L’application d’apprentissage des langues Speak a ainsi constaté une réduction de près de 80 % des interruptions intempestives, laissant aux utilisateurs un temps de réflexion plus naturel.

Sur le plan de l’ingénierie, le gain est massif. Tony Stoyanov, cofondateur et CTO d’une structure partenaire, indique que l’adoption du modèle a permis de simplifier leur base de code de 80 % tout en supprimant 23 000 lignes de code. Cette sobriété logicielle facilite la création de parcours fluides, de la prise de rendez-vous médical au support technique téléphonique.

Délégation du raisonnement et orchestration backend avec Astra et Codex

L’une des grandes forces de GPT-Live-1 réside dans sa capacité à faire le pont entre l’interaction orale immédiate et le calcul intensif. Pendant que la couche frontale maintient le dialogue, le système peut déléguer les appels d’outils et le raisonnement profond à des modèles tiers ou des moteurs internes :

  • GPT-6 Astra : pour résoudre des requêtes clients hautement complexes nécessitant une analyse logique poussée.
  • Luna : pour traiter les tâches à fort volume comme la modification de commandes ou la planification.
  • Codex SDK : pour exécuter du code, inspecter des bases de données ou interroger un dépôt logiciel en arrière-plan pendant la conversation.

Par ailleurs, GPT-Live-1 intègre nativement la transcription ASR, la compréhension alphanumérique et le traitement par mots-clés. Bien que conçu pour le duplex intégral, il prend également en charge la détection explicite des tours de parole pour les interfaces qui l’exigent.

Benchmarks : une domination nette sur Tau3 et Full Duplex Bench

Les évaluations menées par OpenAI démontrent une progression spectaculaire par rapport à la génération précédente GPT-Realtime-2.1 :

Évaluation / BenchmarkGPT-Live-1GPT-Realtime-2.1GPT-Realtime-2
Intelligence Tau3 (Voix)86,2 % (Pass@1)45,7 %42,4 %
Connaissances Banque Tau32,0 % (Pass@1)12,4 %10,3 %
Dynamique conversationnelle97,3 %95,7 %95,3 %
Interactivité Full Duplex v1.580,1 %45,4 %47,8 %
Latence de réponse (Prise de tour)0,798 s (Plus rapide)1,41 s1,63 s
Appels d’outils Full Duplex v387,0 % (Pass@1)60,0 %58,0 %
Qualité des réponses v390,0 %88,0 %81,0 %

(Note : Les tests Tau3 et Tau Bank ont été exécutés avec un serveur backend GPT-6 Astra).

Sur le plan de la latence, le modèle passe sous la barre symbolique de la seconde à 0,798 s, offrant une réactivité humaine. De plus, son score de 86,2 % sur Tau3 confirme sa capacité à mener à bien des démarches complexes de service client dans le commerce, les télécoms et l’aérien.

Personnalisation vocale, retours d’expérience et tarification

Pour s’adapter aux identités de marque, OpenAI élargit son catalogue vocal en intégrant une grande variété d’accents, de dialectes et de langues. Parmi les nouvelles voix disponibles figurent Quartz, Ripple, Vesper, Willow, Pebble, Glow, Meridian, Bossa, Tempo, Beacon, Delta et Ash.

Les retours du terrain valident l’efficacité du modèle en conditions réelles :

  • Yelp Host & Hatch : Alex Levy, CTO de Yelp, confirme une hausse significative du taux de traitement des appels pour les réservations de restaurants et les commandes de repas. La gestion du bruit de fond et des conversations annexes permet aux clients de s’exprimer de manière plus naturelle.
  • Adoption industrielle : des entreprises comme Cognition, Picsart, HeyGen et Fin déploient déjà le modèle.

Tarifs et disponibilité API :

  • Couche vocale frontale : 0,05 $ par minute d’utilisation.
  • Offre Entreprise OpenAI Presence : une solution clé en main basée sur GPT-Live-1 pour déployer des agents IA de confiance, capables d’exécuter des actions métier et de transférer l’appel à un opérateur humain si nécessaire.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Muse Voice Transcribe : transcription IA en temps réel multilingue et multi-locuteurs

Le Meta Superintelligence Lab (MSI) vient de lancer Muse Voice Transcribe, son tout premier modèle audio en temps réel. Présenté ce 1er septembre 2026 par

4 septembre 2026

Kits.AI : la plateforme pour la voix chantée par IA

Arpeggi Inc lance Kits.AI pour simplifier la production musicale depuis votre navigateur ou votre logiciel DAW. Le studio convertit vos enregistrements bruts en voix chantées

26 août 2026

Suno v4.5 une actualisation majeure pour cet outil de génération musicale

Suno v4.5 une actualisation majeure pour cet outil de génération musicale

Suno v4.5 a marqué une étape majeure dans la génération musicale par IA en 2025. Ce modèle a redéfini la qualité vocale, la richesse sonore

25 août 2026

MAI-Voice-2 : l’IA de Microsoft qui rend les voix plus naturelles

Avec MAI-Voice-2, Microsoft cherche à gommer l’un des principaux défauts des voix IA : leur manque de naturel. Alors que les anciennes voix artificielles étaient

31 juillet 2026

Grok Voice Think Fast 2.0 améliore les conversations vocales 

Grok Voice Think Fast 2.0 est la nouvelle version du modèle speech-to-speech de xAI. Elle est conçue pour les développeurs et les entreprises qui créent

31 juillet 2026

Traduction vocale : les professionnels prêts à adopter l’IA

Selon une étude DeepL menée auprès de professionnels français, la traduction vocale en temps réel suscite un intérêt massif. L’intelligence artificielle ne se limite plus

3 juin 2026