Открытая аудиомодель Meituan устанавливает новый стандарт в области клонирования голоса
В области генерации аудио происходит кардинальный переход от многоступенчатых каскадных архитектур к сквозным моделям. Чтобы преодолеть потерю информации и накопление ошибок, присущие традиционному промежуточному представлению «Мел-спектрограмма», используемому в системах TTS, команда Meituan LongCat официально выпустила и открыла исходный код LongCat-AudioDiT (доступно в версиях с 1 млрд и 3,5 млрд параметров). Эта модель успешно превосходит предыдущие ограничения производительности в области клонирования голоса без обучения (zero-shot) за счет прямого моделирования латентного пространства сигналов.

Основная архитектура: выход за пределы мелодических спектрограмм
LongCat-AudioDiT отказывается от традиционного многоступенчатого конвейера «предсказание акустических признаков + нейронный вокодер», создавая вместо этого оптимизированную минимальную архитектуру, построенную на основе Wav-VAE (вариационного автокодера сигнальных форм) и DiT (диффузионного трансформатора).
Эффективный Wav-VAE: Используя полностью сверточную конструкцию, он сжимает сигналы частотой 24 кГц в 2000 раз до частоты кадров 11,7 Гц. Благодаря непараметрическим ветвям-ярлыкам и многоцелевому состязательному обучению он гарантирует, что восстановленный сигнал сохраняет точную временно-частотную структуру, обеспечивая при этом превосходное естественное качество прослушивания.
DiT с улучшенной семантикой: модель инновационно объединяет исходные вложения слов из текстового кодировщика UMT5 со своими скрытыми состояниями верхнего уровня. Это компенсирует фонетические детали, утраченные в семантических представлениях высокого уровня, значительно повышая разборчивость сгенерированной речи.
Оптимизация инференса: точная коррекция дрейфа голоса
Для дальнейшего повышения качества генерации команда внедрила два важных технических усовершенствования:
Механизм двойного ограничения: эта техника выявляет и исправляет постоянную проблему «несоответствия обучения и вывода» в TTS с согласованием потока. Путем принудительной перезагрузки скрытых переменных в области подсказки во время вывода она полностью решает проблемы дрейфа и нестабильности голоса говорящего.
Адаптивное управление проекцией (APG): APG заменяет традиционное управление без классификатора (CFG). Оно может точно фильтровать полезные компоненты в сигнале управления, подавляя при этом компоненты, вызывающие ухудшение качества звука, что значительно улучшает естественность речи, не вызывая спектральной «перенасыщенности».
Производительность: точность клонирования на уровне SOTA
В тестах на наборе данных Seed LongCat-AudioDiT демонстрирует доминирующую производительность:
Схожесть (SIM): модель 3.5B достигла результата 0,818 на тестовом наборе Seed-ZH и 0,797 на сложном наборе предложений Seed-Hard, превзойдя такие известные модели, как Seed-TTS, CosyVoice3.5 и MiniMax-Speech.
Точность: она входит в число лучших в отрасли по ключевым показателям, включая WER на английском языке 1,50% и CER для сложных предложений на китайском языке 6,04%.
Примечательно, что LongCat-AudioDiT достигает превосходных результатов по сравнению с многоэтапными моделями, используя только одноэтапное обучение на предварительно обработанных данных транскрипции ASR. Соответствующая научная статья, исходный код и веса модели теперь полностью открыты и доступны на GitHub и HuggingFace.
Ссылки по проекту:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Связанная статья
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт
Кубок Суперкубок Alibaba: Qwen3.8-Max дебютирует с улучшенными инструментами для программирования и офисными приложениями
Alibaba официально представила Qwen3.8-Max — новую базовую большую модель с 2,4 триллиона параметров. Это значимое достижение в области искусственного интеллекта обеспечивает существенное улучшение производительности в ключевых областях, таких как пр
Рекомендации по связанным специальным темам
Комментарии (1)
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
В области генерации аудио происходит кардинальный переход от многоступенчатых каскадных архитектур к сквозным моделям. Чтобы преодолеть потерю информации и накопление ошибок, присущие традиционному промежуточному представлению «Мел-спектрограмма», используемому в системах TTS, команда Meituan LongCat официально выпустила и открыла исходный код LongCat-AudioDiT (доступно в версиях с 1 млрд и 3,5 млрд параметров). Эта модель успешно превосходит предыдущие ограничения производительности в области клонирования голоса без обучения (zero-shot) за счет прямого моделирования латентного пространства сигналов.

Основная архитектура: выход за пределы мелодических спектрограмм
LongCat-AudioDiT отказывается от традиционного многоступенчатого конвейера «предсказание акустических признаков + нейронный вокодер», создавая вместо этого оптимизированную минимальную архитектуру, построенную на основе Wav-VAE (вариационного автокодера сигнальных форм) и DiT (диффузионного трансформатора).
Эффективный Wav-VAE: Используя полностью сверточную конструкцию, он сжимает сигналы частотой 24 кГц в 2000 раз до частоты кадров 11,7 Гц. Благодаря непараметрическим ветвям-ярлыкам и многоцелевому состязательному обучению он гарантирует, что восстановленный сигнал сохраняет точную временно-частотную структуру, обеспечивая при этом превосходное естественное качество прослушивания.
DiT с улучшенной семантикой: модель инновационно объединяет исходные вложения слов из текстового кодировщика UMT5 со своими скрытыми состояниями верхнего уровня. Это компенсирует фонетические детали, утраченные в семантических представлениях высокого уровня, значительно повышая разборчивость сгенерированной речи.
Оптимизация инференса: точная коррекция дрейфа голоса
Для дальнейшего повышения качества генерации команда внедрила два важных технических усовершенствования:
Механизм двойного ограничения: эта техника выявляет и исправляет постоянную проблему «несоответствия обучения и вывода» в TTS с согласованием потока. Путем принудительной перезагрузки скрытых переменных в области подсказки во время вывода она полностью решает проблемы дрейфа и нестабильности голоса говорящего.
Адаптивное управление проекцией (APG): APG заменяет традиционное управление без классификатора (CFG). Оно может точно фильтровать полезные компоненты в сигнале управления, подавляя при этом компоненты, вызывающие ухудшение качества звука, что значительно улучшает естественность речи, не вызывая спектральной «перенасыщенности».
Производительность: точность клонирования на уровне SOTA
В тестах на наборе данных Seed LongCat-AudioDiT демонстрирует доминирующую производительность:
Схожесть (SIM): модель 3.5B достигла результата 0,818 на тестовом наборе Seed-ZH и 0,797 на сложном наборе предложений Seed-Hard, превзойдя такие известные модели, как Seed-TTS, CosyVoice3.5 и MiniMax-Speech.
Точность: она входит в число лучших в отрасли по ключевым показателям, включая WER на английском языке 1,50% и CER для сложных предложений на китайском языке 6,04%.
Примечательно, что LongCat-AudioDiT достигает превосходных результатов по сравнению с многоэтапными моделями, используя только одноэтапное обучение на предварительно обработанных данных транскрипции ASR. Соответствующая научная статья, исходный код и веса модели теперь полностью открыты и доступны на GitHub и HuggingFace.
Ссылки по проекту:
GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-AudioDiT
Внутри раскрыты подробности о Gemini следующего поколения: ограниченные вычислительные мощности, внутренние команды не сошлись в вопросах приоритетов разработки и распределения ресурсов
В отчётах указывается, что запуск долгожданной модели Gemini следующего поколения от Google был перенесён. Внутренние разногласия по вопросам приоритетов разработки и распределения ресурсов, в сочетании с ограниченной вычислительной мощностью и сложн
OpenAI отклоняет опасения по поводу замедления роста, заявляя о ускорении работы нескольких бизнес-подразделений
В ответ на внешнюю критику, связанную с замедлением роста продаж и невыполнением внутренних плановых показателей, лидер в области искусственного интеллекта компания OpenAI опубликовала во вторник, 28 апреля, уверенное заявление. Компания уточнила, чт
Кубок Суперкубок Alibaba: Qwen3.8-Max дебютирует с улучшенными инструментами для программирования и офисными приложениями
Alibaba официально представила Qwen3.8-Max — новую базовую большую модель с 2,4 триллиона параметров. Это значимое достижение в области искусственного интеллекта обеспечивает существенное улучшение производительности в ключевых областях, таких как пр
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





Дом






