Lar
A Microsoft apresenta o primeiro modelo de IA de voz full-duplex desenvolvido internamente, capaz de ouvir e falar simultaneamente em 16 idiomas
De acordo com o site especializado em tecnologia TestingCatalog, a Microsoft está atualmente testando seu primeiro modelo de voz nativo em tempo real, o MAI Realtime. Com suporte a 16 idiomas e dois estilos de voz distintos, esse sistema permite ouvir e falar simultaneamente, possibilitando a detecção automática de idiomas e a alternância de idioma no meio da conversa. Esse avanço elimina a necessidade de os usuários esperarem que a IA termine de falar antes de responder, criando uma experiência de conversa que se assemelha muito à interação humana natural.

O MAI Realtime emprega uma abordagem de interação bidirecional e full-duplex, rompendo efetivamente com o padrão tradicional dos assistentes de voz, em que os usuários falam e o modelo responde sequencialmente. Ao utilizar tecnologia de detecção de pontos-finais para identificar o início, as pausas e o fim da fala, o sistema pode ajustar imediatamente sua resposta quando os usuários interromperem, alcançando sincronização entre escuta e resposta. Isso representa um marco significativo para a família de modelos de voz MAI da Microsoft, marcando a transição da comunicação unidirecional para a bidirecional. Modelos anteriores, como o MAI-Voice-2 e o MAI-Transcribe-1.5, limitavam-se a tarefas unidirecionais, como síntese ou reconhecimento de fala.
Dois estilos de voz oferecem maior naturalidade, embora os recursos de canto ainda não estejam incluídos
Quanto à cobertura de idiomas, o MAI Realtime suporta 16 idiomas, incluindo chinês, inglês, japonês, coreano, francês, alemão e árabe. Os usuários podem especificar manualmente o idioma da conversa ou ativar a detecção automática, permitindo que o modelo identifique e alterne os idiomas automaticamente durante o diálogo. Em termos de opções de voz, a versão de teste oferece duas vozes, Victoria e Grant, que, segundo relatos, soam mais naturais do que o modo de voz atual do Copilot.
Artigo relacionado
A Apple lança o iOS 27 com IA local e parceria com o Google para aprimorar a Siri
O site The Information destacou recentemente a abordagem estratégica da Apple para integrar inteligência artificial ao futuro sistema operacional OS 27. Ao utilizar o modelo Gemini, do Google, para tr
A Perplexity Computer apresenta a inferência híbrida para equilibrar privacidade e eficiência
A Perplexity, uma empresa de inteligência artificial, revelou planos para lançar uma melhoria significativa em seu agente Perplexity Computer neste verão. Essa atualização introduz um modo de “raciocí
A NexCOBOT enfrenta as barreiras físicas do mercado de IA e promove o crescimento
A NexCOBOT, apresentada na Robotics Summit & Expo, oferece uma ampla variedade de controladores. Fonte: NexCOBOTEmpresas de robótica humanóide e IA física não estão apenas garantindo bilhões em financ
Recomendações de tópicos especiais relacionados
Comentários (0)
De acordo com o site especializado em tecnologia TestingCatalog, a Microsoft está atualmente testando seu primeiro modelo de voz nativo em tempo real, o MAI Realtime. Com suporte a 16 idiomas e dois estilos de voz distintos, esse sistema permite ouvir e falar simultaneamente, possibilitando a detecção automática de idiomas e a alternância de idioma no meio da conversa. Esse avanço elimina a necessidade de os usuários esperarem que a IA termine de falar antes de responder, criando uma experiência de conversa que se assemelha muito à interação humana natural.

O MAI Realtime emprega uma abordagem de interação bidirecional e full-duplex, rompendo efetivamente com o padrão tradicional dos assistentes de voz, em que os usuários falam e o modelo responde sequencialmente. Ao utilizar tecnologia de detecção de pontos-finais para identificar o início, as pausas e o fim da fala, o sistema pode ajustar imediatamente sua resposta quando os usuários interromperem, alcançando sincronização entre escuta e resposta. Isso representa um marco significativo para a família de modelos de voz MAI da Microsoft, marcando a transição da comunicação unidirecional para a bidirecional. Modelos anteriores, como o MAI-Voice-2 e o MAI-Transcribe-1.5, limitavam-se a tarefas unidirecionais, como síntese ou reconhecimento de fala.
Dois estilos de voz oferecem maior naturalidade, embora os recursos de canto ainda não estejam incluídos
Quanto à cobertura de idiomas, o MAI Realtime suporta 16 idiomas, incluindo chinês, inglês, japonês, coreano, francês, alemão e árabe. Os usuários podem especificar manualmente o idioma da conversa ou ativar a detecção automática, permitindo que o modelo identifique e alterne os idiomas automaticamente durante o diálogo. Em termos de opções de voz, a versão de teste oferece duas vozes, Victoria e Grant, que, segundo relatos, soam mais naturais do que o modo de voz atual do Copilot.
A Apple lança o iOS 27 com IA local e parceria com o Google para aprimorar a Siri
O site The Information destacou recentemente a abordagem estratégica da Apple para integrar inteligência artificial ao futuro sistema operacional OS 27. Ao utilizar o modelo Gemini, do Google, para tr
A Perplexity Computer apresenta a inferência híbrida para equilibrar privacidade e eficiência
A Perplexity, uma empresa de inteligência artificial, revelou planos para lançar uma melhoria significativa em seu agente Perplexity Computer neste verão. Essa atualização introduz um modo de “raciocí
A NexCOBOT enfrenta as barreiras físicas do mercado de IA e promove o crescimento
A NexCOBOT, apresentada na Robotics Summit & Expo, oferece uma ampla variedade de controladores. Fonte: NexCOBOTEmpresas de robótica humanóide e IA física não estão apenas garantindo bilhões em financ











