OpenAI vient de rendre le modèle GPT-Live-1 accessible via son API. Conçu pour remplacer les chaînes logicielles morcelées (STT-LLM-TTS), ce système fonctionne en duplex intégral. Il permet aux agents d’écouter et de parler simultanément. Et grâce à une latence de réponse réduite à 0,798 seconde, une gestion fluide des interruptions et la délégation du raisonnement à des modèles backend comme GPT-6 Astra, cette solution permet de déployer des assistants téléphoniques virtuels pour 0,05 $ la minute.
En réunissant le traitement audio entrant et sortant au sein d’un modèle unique, OpenAI élimine la rigidité des architectures vocales traditionnelles. En effet, cette technologie parvient à isoler le bruit de fond, absorber les interruptions en temps réel et maintenir des conversations naturelles sur la longue durée.
Le couplage entre cette couche vocale frontale et la puissance analytique de Codex ou d’Astra offre donc la possibilité d’automatiser le support client téléphonique sans dégrader l’expérience utilisateur. Mais comment ?
Une architecture unifiée qui supprime la latence et simplifie le code
Les agents vocaux traditionnels reposent sur l’assemblage de trois briques distinctes : la transcription vocale (STT), un modèle de langage (LLM) et la synthèse vocale (TTS). Cependant, cette superposition d’étapes génère une latence élevée et multiplie les risques de rupture de contexte. De ce fait, les développeurs devaient jusqu’ici concevoir des algorithmes complexes pour gérer manuellement les pauses, les hésitations et les chassés-croisés de parole.
GPT-Live-1 résout cette problématique en fusionnant l’écoute et l’émission au sein d’une architecture unifiée. L’application d’apprentissage des langues Speak a ainsi constaté une réduction de près de 80 % des interruptions intempestives, laissant aux utilisateurs un temps de réflexion plus naturel.
Sur le plan de l’ingénierie, le gain est massif. Tony Stoyanov, cofondateur et CTO d’une structure partenaire, indique que l’adoption du modèle a permis de simplifier leur base de code de 80 % tout en supprimant 23 000 lignes de code. Cette sobriété logicielle facilite la création de parcours fluides, de la prise de rendez-vous médical au support technique téléphonique.
Délégation du raisonnement et orchestration backend avec Astra et Codex
L’une des grandes forces de GPT-Live-1 réside dans sa capacité à faire le pont entre l’interaction orale immédiate et le calcul intensif. Pendant que la couche frontale maintient le dialogue, le système peut déléguer les appels d’outils et le raisonnement profond à des modèles tiers ou des moteurs internes :
- GPT-6 Astra : pour résoudre des requêtes clients hautement complexes nécessitant une analyse logique poussée.
- Luna : pour traiter les tâches à fort volume comme la modification de commandes ou la planification.
- Codex SDK : pour exécuter du code, inspecter des bases de données ou interroger un dépôt logiciel en arrière-plan pendant la conversation.
Par ailleurs, GPT-Live-1 intègre nativement la transcription ASR, la compréhension alphanumérique et le traitement par mots-clés. Bien que conçu pour le duplex intégral, il prend également en charge la détection explicite des tours de parole pour les interfaces qui l’exigent.
Benchmarks : une domination nette sur Tau3 et Full Duplex Bench
Les évaluations menées par OpenAI démontrent une progression spectaculaire par rapport à la génération précédente GPT-Realtime-2.1 :
| Évaluation / Benchmark | GPT-Live-1 | GPT-Realtime-2.1 | GPT-Realtime-2 |
| Intelligence Tau3 (Voix) | 86,2 % (Pass@1) | 45,7 % | 42,4 % |
| Connaissances Banque Tau | 32,0 % (Pass@1) | 12,4 % | 10,3 % |
| Dynamique conversationnelle | 97,3 % | 95,7 % | 95,3 % |
| Interactivité Full Duplex v1.5 | 80,1 % | 45,4 % | 47,8 % |
| Latence de réponse (Prise de tour) | 0,798 s (Plus rapide) | 1,41 s | 1,63 s |
| Appels d’outils Full Duplex v3 | 87,0 % (Pass@1) | 60,0 % | 58,0 % |
| Qualité des réponses v3 | 90,0 % | 88,0 % | 81,0 % |
(Note : Les tests Tau3 et Tau Bank ont été exécutés avec un serveur backend GPT-6 Astra).
Sur le plan de la latence, le modèle passe sous la barre symbolique de la seconde à 0,798 s, offrant une réactivité humaine. De plus, son score de 86,2 % sur Tau3 confirme sa capacité à mener à bien des démarches complexes de service client dans le commerce, les télécoms et l’aérien.
Personnalisation vocale, retours d’expérience et tarification
Pour s’adapter aux identités de marque, OpenAI élargit son catalogue vocal en intégrant une grande variété d’accents, de dialectes et de langues. Parmi les nouvelles voix disponibles figurent Quartz, Ripple, Vesper, Willow, Pebble, Glow, Meridian, Bossa, Tempo, Beacon, Delta et Ash.
OpenAI just killed the awkward voice-agent pause.
— Min Choi (@minchoi) September 12, 2026
GPT-Live-1 listens + talks at the same time, handles interruptions, and costs $0.05/min.
Realistic Voice agents just got real. https://t.co/u9g2SC102j pic.twitter.com/qMWiDgVUzF
Les retours du terrain valident l’efficacité du modèle en conditions réelles :
- Yelp Host & Hatch : Alex Levy, CTO de Yelp, confirme une hausse significative du taux de traitement des appels pour les réservations de restaurants et les commandes de repas. La gestion du bruit de fond et des conversations annexes permet aux clients de s’exprimer de manière plus naturelle.
- Adoption industrielle : des entreprises comme Cognition, Picsart, HeyGen et Fin déploient déjà le modèle.
Tarifs et disponibilité API :
- Couche vocale frontale : 0,05 $ par minute d’utilisation.
- Offre Entreprise OpenAI Presence : une solution clé en main basée sur GPT-Live-1 pour déployer des agents IA de confiance, capables d’exécuter des actions métier et de transférer l’appel à un opérateur humain si nécessaire.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

