小米的 OmniVoice 開源 TTS 模型實現了橫跨 600 多種語言的零樣本克隆
近日,小米的下一代 Kaldi 團隊(k2-fsa)正式開源了 OmniVoice,這是一款支援超過 600 種語言的大型多語言零樣本文字轉語音模型。該模型在中文、英文及多語言合成等多項關鍵基準測試中均取得業界領先的成績,標誌著該領域取得重大突破。
領先表現:中文 WER 低至 0.84%,多語言測試中超越主流模型
在 Seed-TTS 中文測試集上,OmniVoice 達到了僅 0.84% 的驚人低詞錯誤率 (WER)。在多語言評估中,其相似度 (SIM-o) 和 WER 分數超越了 ElevenLabs v2 和 MiniMax 等知名商用模型,展現出卓越的語音自然度與清晰度。

超高速推論:RTF 低至 0.025,速度比即時處理快 40 倍
OmniVoice 的即時因子 (RTF) 低至 0.025,意味著其合成速度遠超即時要求。這項巨大的效能提升,使系統能在實際應用中快速生成長篇語音,大幅提升使用者體驗。
核心架構創新:受擴散模型啟發的離散非自迴歸設計
OmniVoice 採用受擴散語言模型啟發的創新離散非自迴歸架構。它能透過單一步驟將文字轉化為語音,省略了傳統的中間語義標記。此精簡設計在維持高輸出品質的同時,也簡化了處理流程。結合預訓練大型語言模型(LLM)的初始化,以及完整的碼本隨機遮罩策略,進一步提升了訓練效率,並改善了最終語音的清晰度與可懂度。
靈活的聲音複製與自訂功能:僅需 3 至 10 秒的音訊即可運作
該模型僅需 3 至 10 秒的參考音訊,即可實現高品質的零樣本語音克隆。使用者還能透過自然語言提示自訂語音屬性,指定性別、年齡、音高、口音、方言,甚至包括耳語等特殊效果。
支援非語言符號與細緻發音控制
OmniVoice 能處理非語言符號(如 [笑聲]),並支援透過拼音或音標進行發音修正。這使其特別適合用於中文及各類方言的精準合成。
支援 600 多種語言:協助少數民族語言與瀕危語言的數位保存
OmniVoice 的關鍵亮點在於其廣泛的語言覆蓋範圍,能高效支援主要語言及眾多資源匱乏的語言。對於少數民族語言及瀕危語言,它僅需極少的數據樣本即可生成高品質語音,為數位語言保存與文化保護提供了巨大潛力。
OmniVoice 的原始碼與預訓練模型現已於 GitHub 和 Hugging Face 開源,開發者可自行部署或整合至應用程式中。AIbase 將持續關注社群回饋與實際應用案例,並鼓勵開發者分享使用經驗。
專案連結:https://github.com/k2-fsa/OmniVoice
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
近日,小米的下一代 Kaldi 團隊(k2-fsa)正式開源了 OmniVoice,這是一款支援超過 600 種語言的大型多語言零樣本文字轉語音模型。該模型在中文、英文及多語言合成等多項關鍵基準測試中均取得業界領先的成績,標誌著該領域取得重大突破。
領先表現:中文 WER 低至 0.84%,多語言測試中超越主流模型
在 Seed-TTS 中文測試集上,OmniVoice 達到了僅 0.84% 的驚人低詞錯誤率 (WER)。在多語言評估中,其相似度 (SIM-o) 和 WER 分數超越了 ElevenLabs v2 和 MiniMax 等知名商用模型,展現出卓越的語音自然度與清晰度。

超高速推論:RTF 低至 0.025,速度比即時處理快 40 倍
OmniVoice 的即時因子 (RTF) 低至 0.025,意味著其合成速度遠超即時要求。這項巨大的效能提升,使系統能在實際應用中快速生成長篇語音,大幅提升使用者體驗。
核心架構創新:受擴散模型啟發的離散非自迴歸設計
OmniVoice 採用受擴散語言模型啟發的創新離散非自迴歸架構。它能透過單一步驟將文字轉化為語音,省略了傳統的中間語義標記。此精簡設計在維持高輸出品質的同時,也簡化了處理流程。結合預訓練大型語言模型(LLM)的初始化,以及完整的碼本隨機遮罩策略,進一步提升了訓練效率,並改善了最終語音的清晰度與可懂度。
靈活的聲音複製與自訂功能:僅需 3 至 10 秒的音訊即可運作
該模型僅需 3 至 10 秒的參考音訊,即可實現高品質的零樣本語音克隆。使用者還能透過自然語言提示自訂語音屬性,指定性別、年齡、音高、口音、方言,甚至包括耳語等特殊效果。
支援非語言符號與細緻發音控制
OmniVoice 能處理非語言符號(如 [笑聲]),並支援透過拼音或音標進行發音修正。這使其特別適合用於中文及各類方言的精準合成。
支援 600 多種語言:協助少數民族語言與瀕危語言的數位保存
OmniVoice 的關鍵亮點在於其廣泛的語言覆蓋範圍,能高效支援主要語言及眾多資源匱乏的語言。對於少數民族語言及瀕危語言,它僅需極少的數據樣本即可生成高品質語音,為數位語言保存與文化保護提供了巨大潛力。
OmniVoice 的原始碼與預訓練模型現已於 GitHub 和 Hugging Face 開源,開發者可自行部署或整合至應用程式中。AIbase 將持續關注社群回饋與實際應用案例,並鼓勵開發者分享使用經驗。
專案連結:https://github.com/k2-fsa/OmniVoice
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






