Le Meta Superintelligence Lab (MSI) vient de lancer Muse Voice Transcribe, son tout premier modèle audio en temps réel. Présenté ce 1er septembre 2026 par Mark Zuckerberg, cet outil est capable de gérer la dictée et la transcription simultanée de plus de 20 locuteurs. Le tout en identifiant automatiquement les passages d’une langue à l’autre au sein d’une même phrase. Disponible via l’API Model de Meta à 3 $ pour 1 000 minutes, cette technologie s’impose déjà comme une réponse directe à Google Gemini 3.5 Transcribe.
Le modèle intégre un mécanisme de délai adaptatif capable de gérer l’alternance codique (code-switching) et les réunions à forte densité d’intervenants.
Cette innovation renforce d’ailleurs l’écosystème du Meta Superintelligence Lab. Ainsi, elle le positionne en tant que meneur sur les outils de productivité vocale et l’intégration logicielle multi-applications.
Une prouesse technique face à la complexité des conversations réelles
Pour dévoiler cette technologie, le PDG de Meta, Mark Zuckerberg, a choisi la plateforme X. Il a en effet partagé une démonstration vidéo saisissante. La séquence illustre la capacité du modèle à distinguer automatiquement chaque intervenant. Mais aussi à basculer instantanément d’une langue à l’autre au cours d’un même échange oral.
D’un point de vue architectural, le modèle adapte son rythme d’analyse de manière dynamique. Il patiente plus longtemps sur les mots difficiles et s’exécute plus rapidement sur les termes simples. C’est-à-dire que Muse Transcribe exploite un délai adaptatif pour prédire chaque jeton et garantir une précision de transcription maximale.
Conçu pour traiter des enregistrements audios réels et complexes, Muse Voice Transcribe a été entraîné sur plus de 70 langues (dont 25 validées officiellement au lancement). Il peut même digérer sans faillir des sessions d’une heure réunissant plus de 20 locuteurs.
Disponibilité, intégration Mac et compétition avec Google
Ce lancement intervient moins d’une semaine après l’annonce de Gemini 3.5 Transcribe, la solution audio rivale développée par Google. Mais alors que le géant de Mountain View intègre nativement son modèle dans Android et prochainement dans Chrome, Meta n’a pas encore précisé la feuille de route d’intégration de Muse au cœur de ses applications phares comme WhatsApp ou Instagram.
Pour l’heure, l’outil est immédiatement accessible au grand public via l’application Mac Meta AI récemment déployée. Capable de propulser les fonctionnalités vocales d’autres logiciels sur macOS, elle permet désormais d’utiliser la dictée vocale universelle sur tous les services tiers. Pour les développeurs, le modèle est distribué à travers Muse Code et l’API Model de Meta au tarif compétitif de 3 $ pour 1 000 minutes audio, tandis qu’une démonstration interactive reste accessible sur le blog de recherche de Meta.
Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelligence Labs.
— AI at Meta (@AIatMeta) September 1, 2026
Muse Voice Transcribe delivers real-time streaming ASR, diarization with 20+ speakers, and endpointing. It’s multilingual with seamless code-switching and improves… pic.twitter.com/x6rfDI5ocB
Cette publication s’inscrit dans une dynamique d’innovation intense portée par le Meta Superintelligence Lab (MSI). Au cours des dernières semaines, le laboratoire de recherche s’est illustré par plusieurs annonces stratégiques, incluant son premier agent de codage dédié, un modèle de langage à poids ouverts (open-weight) et l’application Meta AI pour Mac.
Les caractéristiques clés de Muse Voice Transcribe
- Gestion multi-locuteurs : capacité à transcrire en temps réel plus de 20 voix distinctes lors de sessions complexes d’une heure.
- Support multilingue étendu : modèle entraîné sur plus de 70 langues, avec 25 langues pleinement validées dès le lancement.
- Détection de l’alternance codique : prise en charge fluide du passage d’une langue à l’autre au sein d’une même phrase.
- Architecture à délai adaptatif : ajustement en temps réel du temps de calcul pour optimiser la précision sur les mots rares ou complexes.
- Tarif et intégration : accessible pour les développeurs à 3 $ pour 1 000 minutes audio et intégré à la dictée système de l’application Mac Meta AI.
- Partager l'article :
Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

