Maison
Microsoft dévoile son premier modèle vocal IA full-duplex développé en interne, capable d'écouter et de parler simultanément dans 16 langues
Selon le site spécialisé dans les technologies TestingCatalog, Microsoft teste actuellement son tout premier modèle vocal natif en temps réel, baptisé « MAI Realtime ». Prise en charge de 16 langues et de deux styles vocaux distincts, ce système permet l'écoute et la parole simultanées, ce qui facilite la détection automatique de la langue et le changement de langue en cours de conversation. Cette avancée évite aux utilisateurs d'avoir à attendre que l'IA ait fini de parler avant de répondre, créant ainsi une expérience conversationnelle qui reflète fidèlement les interactions humaines naturelles.

MAI Realtime utilise une approche d’interaction bidirectionnelle en duplex intégral, rompant ainsi avec le schéma traditionnel des assistants vocaux où les utilisateurs parlent et le modèle répond de manière séquentielle. En utilisant une technologie de détection des points de fin pour identifier le début, les pauses et la fin de la parole, le système peut immédiatement adapter sa réponse lorsque les utilisateurs interviennent, permettant ainsi une écoute et une réponse synchronisées. Il s’agit d’une étape importante pour la famille de modèles vocaux MAI de Microsoft, qui passe d’une communication unidirectionnelle à une communication bidirectionnelle. Les modèles précédents, tels que MAI-Voice-2 et MAI-Transcribe-1.5, se limitaient à des tâches unidirectionnelles comme la synthèse ou la reconnaissance vocale.
Deux styles vocaux offrent un plus grand naturel, bien que les capacités de chant ne soient pas encore incluses
En ce qui concerne la prise en charge linguistique, MAI Realtime prend en charge 16 langues, dont le chinois, l’anglais, le japonais, le coréen, le français, l’allemand et l’arabe. Les utilisateurs peuvent soit spécifier manuellement la langue de la conversation, soit activer la détection automatique, ce qui permet au modèle d’identifier et de changer automatiquement de langue au cours du dialogue. En ce qui concerne les options vocales, la version d'essai propose deux voix, Victoria et Grant, qui seraient plus naturelles que le mode vocal actuel de Copilot.
Article connexe
Apple dévoile iOS 27 : une IA locale et un partenariat avec Google pour renforcer Siri
Le site The Information a récemment mis en avant l’approche stratégique d’Apple visant à intégrer l’intelligence artificielle dans le prochain système d’exploitation OS 27. En s’appuyant sur le modèle
Perplexity Computer dévoile une solution d'inférence hybride visant à concilier confidentialité et efficacité
Perplexity, une entreprise spécialisée dans l'intelligence artificielle, a dévoilé son projet de lancer cet été une amélioration majeure de son agent « Perplexity Computer ». Cette mise à jour introdu
NexCOBOT s'attaque aux obstacles physiques qui freinent le marché de l'IA et sa croissance
NexCOBOT, présenté lors du Robotics Summit & Expo, propose une gamme variée de contrôleurs. Source : NexCOBOTLes entreprises spécialisées dans la robotique humanoïde et l’IA physique ne se contentent
Recommandations de sujets spéciaux liés
commentaires (0)
Selon le site spécialisé dans les technologies TestingCatalog, Microsoft teste actuellement son tout premier modèle vocal natif en temps réel, baptisé « MAI Realtime ». Prise en charge de 16 langues et de deux styles vocaux distincts, ce système permet l'écoute et la parole simultanées, ce qui facilite la détection automatique de la langue et le changement de langue en cours de conversation. Cette avancée évite aux utilisateurs d'avoir à attendre que l'IA ait fini de parler avant de répondre, créant ainsi une expérience conversationnelle qui reflète fidèlement les interactions humaines naturelles.

MAI Realtime utilise une approche d’interaction bidirectionnelle en duplex intégral, rompant ainsi avec le schéma traditionnel des assistants vocaux où les utilisateurs parlent et le modèle répond de manière séquentielle. En utilisant une technologie de détection des points de fin pour identifier le début, les pauses et la fin de la parole, le système peut immédiatement adapter sa réponse lorsque les utilisateurs interviennent, permettant ainsi une écoute et une réponse synchronisées. Il s’agit d’une étape importante pour la famille de modèles vocaux MAI de Microsoft, qui passe d’une communication unidirectionnelle à une communication bidirectionnelle. Les modèles précédents, tels que MAI-Voice-2 et MAI-Transcribe-1.5, se limitaient à des tâches unidirectionnelles comme la synthèse ou la reconnaissance vocale.
Deux styles vocaux offrent un plus grand naturel, bien que les capacités de chant ne soient pas encore incluses
En ce qui concerne la prise en charge linguistique, MAI Realtime prend en charge 16 langues, dont le chinois, l’anglais, le japonais, le coréen, le français, l’allemand et l’arabe. Les utilisateurs peuvent soit spécifier manuellement la langue de la conversation, soit activer la détection automatique, ce qui permet au modèle d’identifier et de changer automatiquement de langue au cours du dialogue. En ce qui concerne les options vocales, la version d'essai propose deux voix, Victoria et Grant, qui seraient plus naturelles que le mode vocal actuel de Copilot.
Apple dévoile iOS 27 : une IA locale et un partenariat avec Google pour renforcer Siri
Le site The Information a récemment mis en avant l’approche stratégique d’Apple visant à intégrer l’intelligence artificielle dans le prochain système d’exploitation OS 27. En s’appuyant sur le modèle
Perplexity Computer dévoile une solution d'inférence hybride visant à concilier confidentialité et efficacité
Perplexity, une entreprise spécialisée dans l'intelligence artificielle, a dévoilé son projet de lancer cet été une amélioration majeure de son agent « Perplexity Computer ». Cette mise à jour introdu
NexCOBOT s'attaque aux obstacles physiques qui freinent le marché de l'IA et sa croissance
NexCOBOT, présenté lors du Robotics Summit & Expo, propose une gamme variée de contrôleurs. Source : NexCOBOTLes entreprises spécialisées dans la robotique humanoïde et l’IA physique ne se contentent











