美团开源语音模型创下语音克隆新标杆
语音生成领域正经历着从多级级联架构向端到端模型的根本性转变。 为克服传统TTS系统中“梅尔频谱图”中间表示形式固有的信息丢失和误差累积问题,美团LongCat团队正式发布了开源模型LongCat-AudioDiT(提供10亿和35亿参数版本)。该模型通过直接波形潜空间建模,成功突破了零样本语音克隆的既有性能瓶颈。

核心架构:突破梅尔频谱图的局限
LongCat-AudioDiT摒弃了“声学特征预测+神经声码器”的传统多阶段管道,转而构建基于Wav-VAE(波形变分自编码器)和DiT(扩散变换器)的精简最小架构。
高效 Wav-VAE:采用全卷积设计,将 24kHz 波形压缩 2000 倍至 11.7Hz 帧率。通过非参数捷径分支和多目标对抗训练,确保重建的波形在保持精确时频结构的同时,呈现出极佳的自然听感。
语义增强型 DiT:该模型创新性地将 UMT5 文本编码器的原始词嵌入与顶层隐藏状态进行融合。这弥补了高层次语义表示中丢失的语音细节,显著提升了生成的语音可懂度。
推理优化:精准校正语音漂移
为进一步提升生成质量,研究团队实现了两项关键的技术改进:
双约束机制:该技术识别并纠正了流匹配TTS中长期存在的“训练-推理不匹配”问题。通过在推理阶段强制重置提示区域的潜在变量,彻底解决了说话人声音漂移和不稳定的问题。
自适应投影引导(APG):APG取代了传统的无分类器引导(CFG)。它能够精确过滤引导信号中的有益成分,同时抑制导致音质退化的成分,从而显著提升语音自然度,且不会引发频谱“过度饱和”。
性能:SOTA级克隆准确率
在Seed数据集的基准测试中,LongCat-AudioDiT展现出领先的性能:
相似度(SIM):该35亿参数模型在Seed-ZH测试集上获得0.818的得分,在难度较高的Seed-Hard句子集上获得0.797的得分,表现优于Seed-TTS、CosyVoice3.5和MiniMax-Speech等知名模型。
准确率:在关键指标上均跻身业界顶尖水平,包括英语词错误率(WER)为1.50%,中文难句错误率(CER)为6.04%。
值得注意的是,LongCat-AudioDiT仅通过单阶段训练预处理后的ASR转录数据,便实现了优于多阶段训练模型的卓越效果。相关研究论文、源代码及模型权重现已完全开源,可在GitHub和HuggingFace上获取。
项目链接:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (1)
0/500
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅
语音生成领域正经历着从多级级联架构向端到端模型的根本性转变。 为克服传统TTS系统中“梅尔频谱图”中间表示形式固有的信息丢失和误差累积问题,美团LongCat团队正式发布了开源模型LongCat-AudioDiT(提供10亿和35亿参数版本)。该模型通过直接波形潜空间建模,成功突破了零样本语音克隆的既有性能瓶颈。

核心架构:突破梅尔频谱图的局限
LongCat-AudioDiT摒弃了“声学特征预测+神经声码器”的传统多阶段管道,转而构建基于Wav-VAE(波形变分自编码器)和DiT(扩散变换器)的精简最小架构。
高效 Wav-VAE:采用全卷积设计,将 24kHz 波形压缩 2000 倍至 11.7Hz 帧率。通过非参数捷径分支和多目标对抗训练,确保重建的波形在保持精确时频结构的同时,呈现出极佳的自然听感。
语义增强型 DiT:该模型创新性地将 UMT5 文本编码器的原始词嵌入与顶层隐藏状态进行融合。这弥补了高层次语义表示中丢失的语音细节,显著提升了生成的语音可懂度。
推理优化:精准校正语音漂移
为进一步提升生成质量,研究团队实现了两项关键的技术改进:
双约束机制:该技术识别并纠正了流匹配TTS中长期存在的“训练-推理不匹配”问题。通过在推理阶段强制重置提示区域的潜在变量,彻底解决了说话人声音漂移和不稳定的问题。
自适应投影引导(APG):APG取代了传统的无分类器引导(CFG)。它能够精确过滤引导信号中的有益成分,同时抑制导致音质退化的成分,从而显著提升语音自然度,且不会引发频谱“过度饱和”。
性能:SOTA级克隆准确率
在Seed数据集的基准测试中,LongCat-AudioDiT展现出领先的性能:
相似度(SIM):该35亿参数模型在Seed-ZH测试集上获得0.818的得分,在难度较高的Seed-Hard句子集上获得0.797的得分,表现优于Seed-TTS、CosyVoice3.5和MiniMax-Speech等知名模型。
准确率:在关键指标上均跻身业界顶尖水平,包括英语词错误率(WER)为1.50%,中文难句错误率(CER)为6.04%。
值得注意的是,LongCat-AudioDiT仅通过单阶段训练预处理后的ASR转录数据,便实现了优于多阶段训练模型的卓越效果。相关研究论文、源代码及模型权重现已完全开源,可在GitHub和HuggingFace上获取。
项目链接:
GitHub:https://github.com/meituan-longcat/LongCat-AudioDiT
HuggingFace:https://huggingface.co/meituan-longcat/LongCat-AudioDiT
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
Honestly, the switch from multi-stage cascades to end-to-end models in audio generation sounds like a huge leap forward. But I'm wondering—how do they ensure the cloned voice doesn't pick up weird artifacts or biases from the training data? Also, open-sourcing it is cool, but I hope they've thought about potential misuse, like deepfake audio scams. 😅





首页






