Alibaba Tongyi apresenta modelo de voz com controle de linguagem natural “FreeStyle”
Hoje, a equipe de fala do Alibaba Tongyi Lab apresentou dois modelos inovadores de geração de voz: Fun-CosyVoice3.5 e Fun-AudioGen-VD. A característica que se destaca nesses modelos é o suporte a comandos “FreeStyle”. Em vez de ajustes complexos de parâmetros, os usuários podem controlar com precisão os estilos de expressão vocal ou criar cenas de áudio complexas do zero usando descrições simples em linguagem natural.

Cada modelo tem finalidades distintas:
Fun-CosyVoice3.5: replicação multilíngue e controle refinado
Esta versão aprimorada do CosyVoice alcança avanços importantes na compreensão das nuances da expressão vocal.
Geração orientada por comandos: os usuários podem inserir instruções como “fale com mais confiança” ou “diminua o ritmo com variação emocional” para ajustes vocais em tempo real.
Expansão de idiomas: o suporte adicionado para tailandês, indonésio, português e vietnamita mantém o desempenho líder do setor em precisão de transcrição (WER) e similaridade de voz em 13 idiomas.
Otimização de caracteres raros: O treinamento especializado reduziu as taxas de erro para caracteres incomuns de 15,2% para 5,3%.
Aumento de desempenho: a latência do primeiro pacote diminuiu 35%, melhorando significativamente a fluidez da interação em tempo real.
Fun-AudioGen-VD: Design de som abrangente
Este modelo atua como um “diretor de áudio”, gerando áudio integrado que combina “personagens + ambientes”.
Personalização de voz: especifique gênero, idade, sotaque e características detalhadas, como vozes “roucas, graves ou agudas”.
Emoção e interpretação: simula papéis, incluindo agentes de atendimento ao cliente, locutores e crianças, transmitindo até mesmo estados complexos como “calma exterior com tensão interior”.
Ambientes imersivos: adiciona sons de fundo (caos no campo de batalha, murmúrios em cafés) e efeitos espaciais (reverberação em catedrais, acústica subaquática) para uma simulação espacial completa.
O Tongyi Lab observa que esses modelos democratizarão a criação de vozes de alta qualidade, oferecendo um poderoso suporte de IA para podcasting, desenvolvimento de jogos e pós-produção de filmes.
Artigo relacionado
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Em 14 de maio de 2026, a plataforma de desenvolvimento de aplicações de IA Lovable anunciou sua participação na rodada de investimento inicial (seed) de US$ 800.000 para a startup dinamarquesa de hardware Atech. Liderada pela Lovable, a rodada atraiu
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
Recomendações de tópicos especiais relacionados
Comentários (0)
Hoje, a equipe de fala do Alibaba Tongyi Lab apresentou dois modelos inovadores de geração de voz: Fun-CosyVoice3.5 e Fun-AudioGen-VD. A característica que se destaca nesses modelos é o suporte a comandos “FreeStyle”. Em vez de ajustes complexos de parâmetros, os usuários podem controlar com precisão os estilos de expressão vocal ou criar cenas de áudio complexas do zero usando descrições simples em linguagem natural.

Cada modelo tem finalidades distintas:
Fun-CosyVoice3.5: replicação multilíngue e controle refinado
Esta versão aprimorada do CosyVoice alcança avanços importantes na compreensão das nuances da expressão vocal.
Geração orientada por comandos: os usuários podem inserir instruções como “fale com mais confiança” ou “diminua o ritmo com variação emocional” para ajustes vocais em tempo real.
Expansão de idiomas: o suporte adicionado para tailandês, indonésio, português e vietnamita mantém o desempenho líder do setor em precisão de transcrição (WER) e similaridade de voz em 13 idiomas.
Otimização de caracteres raros: O treinamento especializado reduziu as taxas de erro para caracteres incomuns de 15,2% para 5,3%.
Aumento de desempenho: a latência do primeiro pacote diminuiu 35%, melhorando significativamente a fluidez da interação em tempo real.
Fun-AudioGen-VD: Design de som abrangente
Este modelo atua como um “diretor de áudio”, gerando áudio integrado que combina “personagens + ambientes”.
Personalização de voz: especifique gênero, idade, sotaque e características detalhadas, como vozes “roucas, graves ou agudas”.
Emoção e interpretação: simula papéis, incluindo agentes de atendimento ao cliente, locutores e crianças, transmitindo até mesmo estados complexos como “calma exterior com tensão interior”.
Ambientes imersivos: adiciona sons de fundo (caos no campo de batalha, murmúrios em cafés) e efeitos espaciais (reverberação em catedrais, acústica subaquática) para uma simulação espacial completa.
O Tongyi Lab observa que esses modelos democratizarão a criação de vozes de alta qualidade, oferecendo um poderoso suporte de IA para podcasting, desenvolvimento de jogos e pós-produção de filmes.
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Em 14 de maio de 2026, a plataforma de desenvolvimento de aplicações de IA Lovable anunciou sua participação na rodada de investimento inicial (seed) de US$ 800.000 para a startup dinamarquesa de hardware Atech. Liderada pela Lovable, a rodada atraiu
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.





Lar






