小米的OmniVoice开源语音合成模型支持600多种语言的零样本克隆
近日,小米下一代Kaldi团队(k2-fsa)正式开源了OmniVoice——一款支持600多种语言的大型多语言零样本文本转语音模型。该模型在中文、英语及多语言合成等多项关键基准测试中均取得了业界领先的成绩,标志着该领域取得重大突破。
领先性能:中文WER低至0.84%,多语言测试中超越主流模型
在Seed-TTS中文测试集上,OmniVoice实现了仅0.84%的极低词错误率(WER)。在多语言评估中,其相似度(SIM-o)和WER得分均超越了ElevenLabs v2和MiniMax等知名商用模型,展现出卓越的语音自然度和清晰度。

超快推理:RTF低至0.025,速度比实时快40倍
OmniVoice的实时因子(RTF)低至0.025,这意味着其合成速度远超实时要求。这一巨大的效率提升使得在实际应用中能够快速生成长篇语音,极大提升了用户体验。
核心架构创新:受扩散模型启发的离散非自回归设计
OmniVoice 采用受扩散语言模型启发的创新离散非自回归架构。它通过单一步骤将文本转换为语音,省去了传统的中间语义令牌处理环节。这种精简设计在保持高输出质量的同时简化了处理流程。结合预训练大语言模型(LLM)的初始化,全码本随机掩码策略进一步提升了训练效率,并改善了最终语音的清晰度和可懂度。
灵活的语音克隆与定制:仅需 3-10 秒音频即可实现
该模型仅需3-10秒的参考音频,即可实现高质量的零样本语音克隆。用户还可通过自然语言提示自定义语音属性,指定性别、年龄、音高、口音、方言,甚至包括耳语等特殊效果。
支持非语言符号与精细发音控制
OmniVoice 能处理 [笑声] 等非语言符号,并支持通过拼音或音标进行发音校正。这使其特别适合中文及各类方言的精准合成。
支持 600 多种语言:助力少数民族语言和濒危语言的数字保存
OmniVoice 的核心亮点在于其广泛的语言覆盖范围,既能高效支持主流语言,也能支持大量资源匮乏的语言。对于少数民族语言和濒危语言,它仅需极少的样本数据即可生成高质量语音,为数字语言保存和文化保护提供了巨大潜力。
OmniVoice的源代码和预训练模型现已开源至GitHub和Hugging Face,开发者可将其部署在本地或集成到应用程序中。AIbase将持续关注社区反馈和实际应用案例,并鼓励开发者分享使用体验。
项目链接:https://github.com/k2-fsa/OmniVoice
相关文章
印度科技巨头投资3000万美元,打造微软Office的AI竞争对手
连续创业者 Bhavin Turakhia 正投入 3000 万美元自有资金,押注企业 AI 领域仍有新玩家的空间。他最新的创业项目 Neo 基于一个核心信念:传统的职场软件不能仅靠聊天机器人进行修补,而需要进行彻底的架构重构。46 岁的 Turakhia 有着支持雄心勃勃的企业科技项目的历史。在过去二十年中,他联合创立了 Directi、Radix、Titan 和 Zeta,在寻求外部投资之前,主要使用个人资本为这些项目提供资金。他正将同样的自力更生策略应用于 Neo。Turakhia 向
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
相关专题推荐
评论 (0)
0/500
近日,小米下一代Kaldi团队(k2-fsa)正式开源了OmniVoice——一款支持600多种语言的大型多语言零样本文本转语音模型。该模型在中文、英语及多语言合成等多项关键基准测试中均取得了业界领先的成绩,标志着该领域取得重大突破。
领先性能:中文WER低至0.84%,多语言测试中超越主流模型
在Seed-TTS中文测试集上,OmniVoice实现了仅0.84%的极低词错误率(WER)。在多语言评估中,其相似度(SIM-o)和WER得分均超越了ElevenLabs v2和MiniMax等知名商用模型,展现出卓越的语音自然度和清晰度。

超快推理:RTF低至0.025,速度比实时快40倍
OmniVoice的实时因子(RTF)低至0.025,这意味着其合成速度远超实时要求。这一巨大的效率提升使得在实际应用中能够快速生成长篇语音,极大提升了用户体验。
核心架构创新:受扩散模型启发的离散非自回归设计
OmniVoice 采用受扩散语言模型启发的创新离散非自回归架构。它通过单一步骤将文本转换为语音,省去了传统的中间语义令牌处理环节。这种精简设计在保持高输出质量的同时简化了处理流程。结合预训练大语言模型(LLM)的初始化,全码本随机掩码策略进一步提升了训练效率,并改善了最终语音的清晰度和可懂度。
灵活的语音克隆与定制:仅需 3-10 秒音频即可实现
该模型仅需3-10秒的参考音频,即可实现高质量的零样本语音克隆。用户还可通过自然语言提示自定义语音属性,指定性别、年龄、音高、口音、方言,甚至包括耳语等特殊效果。
支持非语言符号与精细发音控制
OmniVoice 能处理 [笑声] 等非语言符号,并支持通过拼音或音标进行发音校正。这使其特别适合中文及各类方言的精准合成。
支持 600 多种语言:助力少数民族语言和濒危语言的数字保存
OmniVoice 的核心亮点在于其广泛的语言覆盖范围,既能高效支持主流语言,也能支持大量资源匮乏的语言。对于少数民族语言和濒危语言,它仅需极少的样本数据即可生成高质量语音,为数字语言保存和文化保护提供了巨大潜力。
OmniVoice的源代码和预训练模型现已开源至GitHub和Hugging Face,开发者可将其部署在本地或集成到应用程序中。AIbase将持续关注社区反馈和实际应用案例,并鼓励开发者分享使用体验。
项目链接:https://github.com/k2-fsa/OmniVoice
印度科技巨头投资3000万美元,打造微软Office的AI竞争对手
连续创业者 Bhavin Turakhia 正投入 3000 万美元自有资金,押注企业 AI 领域仍有新玩家的空间。他最新的创业项目 Neo 基于一个核心信念:传统的职场软件不能仅靠聊天机器人进行修补,而需要进行彻底的架构重构。46 岁的 Turakhia 有着支持雄心勃勃的企业科技项目的历史。在过去二十年中,他联合创立了 Directi、Radix、Titan 和 Zeta,在寻求外部投资之前,主要使用个人资本为这些项目提供资金。他正将同样的自力更生策略应用于 Neo。Turakhia 向
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统





首页






