腾讯、清华大学联合推出误差率为8.55%的SongGeneration 2,给Suno带来更大压力
2026年初,AI音乐领域再次发生重大变革。3月9日,由腾讯与清华大学人机语音交互实验室 联合研发的音乐基础模型SongGeneration2正式发布。 该模型不仅在技术架构上实现了质的飞跃,还在多个核心维度上超越了当前主流的开源模型,其整体质量甚至可与顶尖商业模型相媲美。

三大突破:告别“塑料感”的人工智能音乐
SongGeneration2 的核心优势源于其底层架构的全面升级,解决了困扰早期AI音乐的三大痛点:
高音乐性:不同于简单的旋律堆叠,该模型能够处理具有惊人空间深度的复杂多轨编曲。
高歌词准确率:发音模糊和音高幻觉问题已成为历史。其音素错误率(PER)低至8.55%,显著优于领先的商用模型Suno v5 (12.4%),仅次于MiniMax2.5 。
强大的可控性:无论是通过文本描述还是音频提示,它都能精准遵循指令,实现风格与情感的深度定制。

“双核”驱动:大语言模型与扩散模型的梦幻组合
在架构上,SongGeneration2 采用了一种创新的混合 LLM-扩散架构:
创作大脑(LeLM):负责整体结构规划和声乐细节处理,解决了“如何演唱”这一难题。
高保真渲染器(Diffusion):在语言模型的引导下,合成极其复杂的声学细节。
分层表示:首创采用混合及多轨表示的并行建模,在旋律稳定性与音质优化之间取得平衡。
真正的开源,门槛极低:普通电脑也能“写歌”
最令开发者兴奋的是腾讯展现出的非凡开放性。拥有40亿参数的SongGeneration-v2-large模型现已完全开源,支持包括中文和英语在内的多语言生成。令人惊叹的是,它仅需22GB显存即可在消费级硬件上流畅运行,支持本地化、私密的音乐创作。
为了让用户能立即体验,团队还在HuggingFace上发布了SongGeneration-v2-Fast版本,该版本以音质微幅下降为代价,换取了超快的生成速度——不到一分钟即可生成一首完整的歌曲。
基于 SongGeneration2 的表现,AI 音乐已正式从“极客玩具”进化为“商用级应用”。随着支持 12GB 显存的 Medium 模型及自动化评估框架即将开源,人人皆可成为“作曲家”的时代或许终于来临。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
2026年初,AI音乐领域再次发生重大变革。3月9日,由

三大突破:告别“塑料感”的人工智能音乐
高音乐性:不同于简单的旋律堆叠,该模型能够处理具有惊人空间深度的复杂多轨编曲。
高歌词准确率:发音模糊和音高幻觉问题已成为历史。其音素错误率(PER)低至8.55%,显著优于领先的商用模型
强大的可控性:无论是通过文本描述还是音频提示,它都能精准遵循指令,实现风格与情感的深度定制。

“双核”驱动:大语言模型与扩散模型的梦幻组合
在架构上,
创作大脑(LeLM):负责整体结构规划和声乐细节处理,解决了“如何演唱”这一难题。
高保真渲染器(Diffusion):在语言模型的引导下,合成极其复杂的声学细节。
分层表示:首创采用混合及多轨表示的并行建模,在旋律稳定性与音质优化之间取得平衡。
真正的开源,门槛极低:普通电脑也能“写歌”
最令开发者兴奋的是腾讯展现出的非凡开放性。拥有40亿参数的SongGeneration-v2-large模型现已完全开源,支持包括中文和英语在内的多语言生成。令人惊叹的是,它仅需22GB显存即可在消费级硬件上流畅运行,支持本地化、私密的音乐创作。
为了让用户能立即体验,团队还在HuggingFace上发布了SongGeneration-v2-Fast版本,该版本以音质微幅下降为代价,换取了超快的生成速度——不到一分钟即可生成一首完整的歌曲。
基于
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






