opção
Lar
Notícias
Modelo de áudio de código aberto da Meituan estabelece novo padrão de referência em clonagem de voz

Modelo de áudio de código aberto da Meituan estabelece novo padrão de referência em clonagem de voz

6 de Abril de 2026
310

A geração de áudio está passando por uma mudança fundamental, passando de arquiteturas em cascata de múltiplos estágios para modelos de ponta a ponta. Para superar a perda de informação e o acúmulo de erros inerentes à representação intermediária tradicional do “espectrograma Mel” usada em sistemas TTS, a equipe Meituan LongCat lançou oficialmente e disponibilizou como código aberto o LongCat-AudioDiT (disponível nas versões com 1B e 3,5B de parâmetros). Este modelo supera com sucesso os limites de desempenho anteriores na clonagem de voz zero-shot, realizando modelagem direta do espaço latente da forma de onda.

QQ20260402-101320.jpg

Arquitetura Central: Indo Além dos Espectrogramas Mel

O LongCat-AudioDiT descarta o pipeline convencional de múltiplos estágios de “previsão de características acústicas + vocoder neural”, estabelecendo, em vez disso, uma arquitetura minimalista e otimizada construída sobre um Wav-VAE (Autoencoder Variacional de Forma de Onda) e um DiT (Transformador de Difusão).

Wav-VAE eficiente: Utilizando um design totalmente convolucional, ele comprime formas de onda de 24 kHz em um fator de 2.000 vezes para uma taxa de quadros de 11,7 Hz. Por meio de ramificações de atalho não paramétricas e treinamento adversarial multiobjetivo, ele garante que a forma de onda reconstruída mantenha uma estrutura tempo-frequência precisa, ao mesmo tempo em que oferece excelente qualidade de audição natural.

DiT com Semântica Aprimorada: O modelo funde de forma inovadora as incorporações de palavras originais do codificador de texto UMT5 com seus estados ocultos de nível superior. Isso compensa os detalhes fonéticos perdidos em representações semânticas de alto nível, aumentando significativamente a inteligibilidade da fala gerada.

Otimização da inferência: correção precisa do desvio de voz

Para aprimorar ainda mais a qualidade da geração, a equipe implementou dois refinamentos técnicos essenciais:

Mecanismo de restrição dupla: essa técnica identifica e corrige o problema persistente de “incompatibilidade entre treinamento e inferência” no TTS com correspondência de fluxo. Ao redefinir forçosamente as variáveis latentes na área de prompt durante a inferência, ela resolve completamente os problemas de desvio e instabilidade da voz do locutor.

Orientação de projeção adaptativa (APG): A APG substitui a orientação tradicional sem classificador (CFG). Ela pode filtrar com precisão os componentes benéficos dentro do sinal de orientação enquanto suprime os componentes que causam degradação de áudio, melhorando significativamente a naturalidade da fala sem induzir “supersaturação” espectral.

Desempenho: Precisão de clonagem de nível SOTA

Em testes de benchmark no conjunto de dados Seed, o LongCat-AudioDiT demonstra desempenho dominante:

Similaridade (SIM): O modelo de 3,5 bilhões de parâmetros alcançou uma pontuação de 0,818 no conjunto de testes Seed-ZH e 0,797 no desafiador conjunto de frases Seed-Hard, superando modelos notáveis como Seed-TTS, CosyVoice3.5 e MiniMax-Speech.

Precisão: Ele está entre os melhores desempenhos do setor em métricas-chave, incluindo um WER em inglês de 1,50% e um CER em frases difíceis em chinês de 6,04%.

Notavelmente, o LongCat-AudioDiT alcança resultados superiores em comparação com modelos treinados em múltiplos estágios, utilizando apenas treinamento em um único estágio em dados de transcrição ASR pré-processados. O artigo de pesquisa associado, o código-fonte e os pesos do modelo estão agora totalmente em código aberto e disponíveis no GitHub e no HuggingFace.

Links do projeto:

GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT

HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT

Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Composição musical Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê
Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê

As melhores e mais bem avaliadas ferramentas de separação de faixas com IA de 2026, selecionadas especialmente para produção de remixes, preparação de samples e masters de karaokê. Essas ferramentas poderosas e revolucionárias passaram por testes práticos para oferecer isolamento de áudio preciso, aumentando significativamente a produtividade. A XIX.AI oferece um guia comparativo entre versões gratuitas e pagas, atualizado semanalmente, para ajudá-lo a encontrar a solução imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Análise de dados Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos
Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos

2026: Os melhores copilotos AI para SQL, atualizados e classificados entre os melhores! A XIX.AI reúne uma coleção poderosa e revolucionária, com testes em ambiente real atualizados semanalmente. Essas ferramentas indispensáveis ajudam a gerar painéis de controle de receita precisos, analisar funis de vendas e rastrear métricas de produtos de forma rápida, aumentando significativamente a produtividade. Explore agora e encontre a ferramenta perfeita para tomada de decisões baseadas em dados! 238 caracteres

9 ferramentas
xix.ai
Composição musical Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas
Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas

2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!

8 ferramentas
xix.ai
chatbot Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas
Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas

As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!

12 ferramentas
xix.ai
Design e Arte As melhores ferramentas de transferência de estilo com IA para experimentos criativos
As melhores ferramentas de transferência de estilo com IA para experimentos criativos

As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!

9 ferramentas
xix.ai
Criação de quadrinhos As melhores ferramentas de balões de diálogo com IA para a narrativa visual
As melhores ferramentas de balões de diálogo com IA para a narrativa visual

As melhores e mais bem avaliadas ferramentas de balões de diálogo com IA para narrativa visual de 2026 já estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e revolucionárias que ajudam os criadores a aumentar a produtividade e superar gargalos criativos. Veja uma comparação entre versões gratuitas e pagas, confira testes reais e verifique os rankings mais recentes para encontrar as soluções imperdíveis, perfeitas para criar narrativas visuais envolventes. Explore agora e descubra sua ferramenta ideal!

10 ferramentas
xix.ai
Comentários (1)
0/500
FredGreen
FredGreen 25 de Junho de 2026 à13 13:00:13 WEST

Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅

OR