Lar
Modelo de áudio de código aberto da Meituan estabelece novo padrão de referência em clonagem de voz
A geração de áudio está passando por uma mudança fundamental, passando de arquiteturas em cascata de múltiplos estágios para modelos de ponta a ponta. Para superar a perda de informação e o acúmulo de erros inerentes à representação intermediária tradicional do “espectrograma Mel” usada em sistemas TTS, a equipe Meituan LongCat lançou oficialmente e disponibilizou como código aberto o LongCat-AudioDiT (disponível nas versões com 1B e 3,5B de parâmetros). Este modelo supera com sucesso os limites de desempenho anteriores na clonagem de voz zero-shot, realizando modelagem direta do espaço latente da forma de onda.

Arquitetura Central: Indo Além dos Espectrogramas Mel
O LongCat-AudioDiT descarta o pipeline convencional de múltiplos estágios de “previsão de características acústicas + vocoder neural”, estabelecendo, em vez disso, uma arquitetura minimalista e otimizada construída sobre um Wav-VAE (Autoencoder Variacional de Forma de Onda) e um DiT (Transformador de Difusão).
Wav-VAE eficiente: Utilizando um design totalmente convolucional, ele comprime formas de onda de 24 kHz em um fator de 2.000 vezes para uma taxa de quadros de 11,7 Hz. Por meio de ramificações de atalho não paramétricas e treinamento adversarial multiobjetivo, ele garante que a forma de onda reconstruída mantenha uma estrutura tempo-frequência precisa, ao mesmo tempo em que oferece excelente qualidade de audição natural.
DiT com Semântica Aprimorada: O modelo funde de forma inovadora as incorporações de palavras originais do codificador de texto UMT5 com seus estados ocultos de nível superior. Isso compensa os detalhes fonéticos perdidos em representações semânticas de alto nível, aumentando significativamente a inteligibilidade da fala gerada.
Otimização da inferência: correção precisa do desvio de voz
Para aprimorar ainda mais a qualidade da geração, a equipe implementou dois refinamentos técnicos essenciais:
Mecanismo de restrição dupla: essa técnica identifica e corrige o problema persistente de “incompatibilidade entre treinamento e inferência” no TTS com correspondência de fluxo. Ao redefinir forçosamente as variáveis latentes na área de prompt durante a inferência, ela resolve completamente os problemas de desvio e instabilidade da voz do locutor.
Orientação de projeção adaptativa (APG): A APG substitui a orientação tradicional sem classificador (CFG). Ela pode filtrar com precisão os componentes benéficos dentro do sinal de orientação enquanto suprime os componentes que causam degradação de áudio, melhorando significativamente a naturalidade da fala sem induzir “supersaturação” espectral.
Desempenho: Precisão de clonagem de nível SOTA
Em testes de benchmark no conjunto de dados Seed, o LongCat-AudioDiT demonstra desempenho dominante:
Similaridade (SIM): O modelo de 3,5 bilhões de parâmetros alcançou uma pontuação de 0,818 no conjunto de testes Seed-ZH e 0,797 no desafiador conjunto de frases Seed-Hard, superando modelos notáveis como Seed-TTS, CosyVoice3.5 e MiniMax-Speech.
Precisão: Ele está entre os melhores desempenhos do setor em métricas-chave, incluindo um WER em inglês de 1,50% e um CER em frases difíceis em chinês de 6,04%.
Notavelmente, o LongCat-AudioDiT alcança resultados superiores em comparação com modelos treinados em múltiplos estágios, utilizando apenas treinamento em um único estágio em dados de transcrição ASR pré-processados. O artigo de pesquisa associado, o código-fonte e os pesos do modelo estão agora totalmente em código aberto e disponíveis no GitHub e no HuggingFace.
Links do projeto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (1)
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
A geração de áudio está passando por uma mudança fundamental, passando de arquiteturas em cascata de múltiplos estágios para modelos de ponta a ponta. Para superar a perda de informação e o acúmulo de erros inerentes à representação intermediária tradicional do “espectrograma Mel” usada em sistemas TTS, a equipe Meituan LongCat lançou oficialmente e disponibilizou como código aberto o LongCat-AudioDiT (disponível nas versões com 1B e 3,5B de parâmetros). Este modelo supera com sucesso os limites de desempenho anteriores na clonagem de voz zero-shot, realizando modelagem direta do espaço latente da forma de onda.

Arquitetura Central: Indo Além dos Espectrogramas Mel
O LongCat-AudioDiT descarta o pipeline convencional de múltiplos estágios de “previsão de características acústicas + vocoder neural”, estabelecendo, em vez disso, uma arquitetura minimalista e otimizada construída sobre um Wav-VAE (Autoencoder Variacional de Forma de Onda) e um DiT (Transformador de Difusão).
Wav-VAE eficiente: Utilizando um design totalmente convolucional, ele comprime formas de onda de 24 kHz em um fator de 2.000 vezes para uma taxa de quadros de 11,7 Hz. Por meio de ramificações de atalho não paramétricas e treinamento adversarial multiobjetivo, ele garante que a forma de onda reconstruída mantenha uma estrutura tempo-frequência precisa, ao mesmo tempo em que oferece excelente qualidade de audição natural.
DiT com Semântica Aprimorada: O modelo funde de forma inovadora as incorporações de palavras originais do codificador de texto UMT5 com seus estados ocultos de nível superior. Isso compensa os detalhes fonéticos perdidos em representações semânticas de alto nível, aumentando significativamente a inteligibilidade da fala gerada.
Otimização da inferência: correção precisa do desvio de voz
Para aprimorar ainda mais a qualidade da geração, a equipe implementou dois refinamentos técnicos essenciais:
Mecanismo de restrição dupla: essa técnica identifica e corrige o problema persistente de “incompatibilidade entre treinamento e inferência” no TTS com correspondência de fluxo. Ao redefinir forçosamente as variáveis latentes na área de prompt durante a inferência, ela resolve completamente os problemas de desvio e instabilidade da voz do locutor.
Orientação de projeção adaptativa (APG): A APG substitui a orientação tradicional sem classificador (CFG). Ela pode filtrar com precisão os componentes benéficos dentro do sinal de orientação enquanto suprime os componentes que causam degradação de áudio, melhorando significativamente a naturalidade da fala sem induzir “supersaturação” espectral.
Desempenho: Precisão de clonagem de nível SOTA
Em testes de benchmark no conjunto de dados Seed, o LongCat-AudioDiT demonstra desempenho dominante:
Similaridade (SIM): O modelo de 3,5 bilhões de parâmetros alcançou uma pontuação de 0,818 no conjunto de testes Seed-ZH e 0,797 no desafiador conjunto de frases Seed-Hard, superando modelos notáveis como Seed-TTS, CosyVoice3.5 e MiniMax-Speech.
Precisão: Ele está entre os melhores desempenhos do setor em métricas-chave, incluindo um WER em inglês de 1,50% e um CER em frases difíceis em chinês de 6,04%.
Notavelmente, o LongCat-AudioDiT alcança resultados superiores em comparação com modelos treinados em múltiplos estágios, utilizando apenas treinamento em um único estágio em dados de transcrição ASR pré-processados. O artigo de pesquisa associado, o código-fonte e os pesos do modelo estão agora totalmente em código aberto e disponíveis no GitHub e no HuggingFace.
Links do projeto:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅











