選項
首頁
新聞
小米的 OmniVoice 開源 TTS 模型實現了橫跨 600 多種語言的零樣本克隆

小米的 OmniVoice 開源 TTS 模型實現了橫跨 600 多種語言的零樣本克隆

2026-05-08
92

近日,小米的下一代 Kaldi 團隊(k2-fsa)正式開源了 OmniVoice,這是一款支援超過 600 種語言的大型多語言零樣本文字轉語音模型。該模型在中文、英文及多語言合成等多項關鍵基準測試中均取得業界領先的成績,標誌著該領域取得重大突破。

領先表現:中文 WER 低至 0.84%,多語言測試中超越主流模型

在 Seed-TTS 中文測試集上,OmniVoice 達到了僅 0.84% 的驚人低詞錯誤率 (WER)。在多語言評估中,其相似度 (SIM-o) 和 WER 分數超越了 ElevenLabs v2 和 MiniMax 等知名商用模型,展現出卓越的語音自然度與清晰度。

image.png

超高速推論:RTF 低至 0.025,速度比即時處理快 40 倍

OmniVoice 的即時因子 (RTF) 低至 0.025,意味著其合成速度遠超即時要求。這項巨大的效能提升,使系統能在實際應用中快速生成長篇語音,大幅提升使用者體驗。

核心架構創新:受擴散模型啟發的離散非自迴歸設計

OmniVoice 採用受擴散語言模型啟發的創新離散非自迴歸架構。它能透過單一步驟將文字轉化為語音,省略了傳統的中間語義標記。此精簡設計在維持高輸出品質的同時,也簡化了處理流程。結合預訓練大型語言模型(LLM)的初始化,以及完整的碼本隨機遮罩策略,進一步提升了訓練效率,並改善了最終語音的清晰度與可懂度。

靈活的聲音複製與自訂功能:僅需 3 至 10 秒的音訊即可運作

該模型僅需 3 至 10 秒的參考音訊,即可實現高品質的零樣本語音克隆。使用者還能透過自然語言提示自訂語音屬性,指定性別、年齡、音高、口音、方言,甚至包括耳語等特殊效果。

支援非語言符號與細緻發音控制

OmniVoice 能處理非語言符號(如 [笑聲]),並支援透過拼音或音標進行發音修正。這使其特別適合用於中文及各類方言的精準合成。

支援 600 多種語言:協助少數民族語言與瀕危語言的數位保存

OmniVoice 的關鍵亮點在於其廣泛的語言覆蓋範圍,能高效支援主要語言及眾多資源匱乏的語言。對於少數民族語言及瀕危語言,它僅需極少的數據樣本即可生成高品質語音,為數位語言保存與文化保護提供了巨大潛力。

OmniVoice 的原始碼與預訓練模型現已於 GitHub 和 Hugging Face 開源,開發者可自行部署或整合至應用程式中。AIbase 將持續關注社群回饋與實際應用案例,並鼓勵開發者分享使用經驗。

專案連結:https://github.com/k2-fsa/OmniVoice

相關文章
解讀新的 ETSI 人工智慧安全標準 解讀新的 ETSI 人工智慧安全標準 ETSI EN 304 223 制定了人工智慧的基礎安全要求,各組織應將其納入其治理架構之中。隨著企業將機器學習整合至核心工作流程,這項歐洲標準針對保護 AI 模型與系統提供了具體規範。這是首項適用於全球的 AI 網路安全歐洲標準,並已獲各國國家標準組織正式批准,這進一步鞏固了其在國際市場上的公信力。作為《歐盟人工智慧法案》的補充性基準,本標準承認人工智慧系統存在獨特風險——包括資料中毒、模型混淆
Gmail 推出個人化 AI 收件匣、搜尋中的 AI 摘要等功能 Gmail 推出個人化 AI 收件匣、搜尋中的 AI 摘要等功能 Google 為 Gmail 推出了一款由 AI 驅動的新收件匣,能為您提供任務的個人化概覽,並讓您隨時掌握重要更新。此外,Gmail 還將在搜尋功能中推出 AI 概覽,並推出一款類似 Grammarly 的校對工具。先前僅限付費訂閱者使用的多項 AI 功能,現已開放給所有使用者使用。新的 AI 收件匣分頁包含兩個區塊:「建議待辦事項」與「待追蹤主題」。 第一個區塊會顯示需要採取行動的高優先級電子
首個山東百度AI漫畫劇集創作基地在淄博正式啟動 首個山東百度AI漫畫劇集創作基地在淄博正式啟動 4月27日,山東省在淄博師範學院正式啟動了該省首個「百度AI漫畫劇創作基地」,標誌著該省在數位文化創作領域邁出了重要一步。該基地開啟了校企合作的新篇章,旨在透過AI技術與文化創作教育的深度融合,探索培育數位文化創作人才的創新模式。在揭牌儀式上,校方代表強調,該基地將作為創新人才培育及深化政校企合作的重要平台。 展望未來,該校計劃將真實的專案案例引入課堂,擺脫傳統教學方法,建立一個完整的專案式教學循
相關專題推薦
漫畫創作 AI角色建立工具:為漫畫主角生成詳細的背景故事及視覺參考資料
AI角色建立工具:為漫畫主角生成詳細的背景故事及視覺參考資料

2026年最新最佳AI角色建立工具:發現那些備受好評的工具,它們能夠幫助你為漫畫角色生成詳細的背景故事和視覺素材。我們精心整理的這份每週更新的列表會根據實際測試結果,對比免費與付費選項的優劣。找到這些強大且能改變創作流程的工具,幫助你塑造引人入勝的角色,提升創作效率。立即訪問XIX.AI檢視排名,找到最適合你的故事創作助手吧。

10 個工具
xix.ai
健康與養生 AI 孕期輔助系統:生成安全且按孕期分階段的運動與營養計畫
AI 孕期輔助系統:生成安全且按孕期分階段的運動與營養計畫

探索 2026 年最佳 AI 孕期輔助工具,為您量身打造安全且針對各孕期的運動與營養計畫。獲取精選的高評分推薦,包含免費與付費方案的比較,以及實用經驗分享。透過 XIX.AI 的專家指南,開啟您最健康的孕期旅程。立即探索。

10 個工具
xix.ai
寫作 最佳免費且無法被偵測的 AI 寫手:將機械化的草稿轉化為自然、類人化的散文
最佳免費且無法被偵測的 AI 寫手:將機械化的草稿轉化為自然、類人化的散文

立即前往 XIX.AI,探索 2026 年最頂尖的免費且難以被察覺的 AI 寫手。我們精心篩選的頂級清單,能協助您將生硬的草稿轉化為自然流暢、宛如人類撰寫的文字。透過實際測試與每週更新的排行榜,比較免費與付費選項的優劣。立即解鎖您的 AI 寫作優勢。

10 個工具
xix.ai
圖像編輯 用於短劇故事板的AI藝術生成工具:幻想與都市浪漫題材的角色設計
用於短劇故事板的AI藝術生成工具:幻想與都市浪漫題材的角色設計

2026最新推薦:探索最適合用於短劇故事板製作的AI藝術生成工具。我們精心挑選了眾多頂級工具,幫助您創作出引人入勝的幻想角色和都市浪漫角色。您可以對比免費與付費選項,檢視實際測試結果,從而找到最適合自己的創意工具。XIX.AI還會每週更新排名並提供專家分析,讓您立即開始將故事視覺化呈現吧!

10 個工具
xix.ai
寫作 最適合廣播和播客使用的AI指令碼編寫工具:幫助您創作引人入勝的音訊廣告
最適合廣播和播客使用的AI指令碼編寫工具:幫助您創作引人入勝的音訊廣告

在XIX.AI上,發現2026年最適合用於廣播和播客製作的AI指令碼工具。我們精心挑選的這些高評分工具能夠提供強大的功能,幫助您快速製作出引人入勝的音訊廣告。透過實際測試和每週更新的排名,您可以瞭解免費選項與付費選項之間的差異。今天就釋放您的創造力吧!

10 個工具
xix.ai
商業 最佳 AI 合約審查軟體:即時發現法律漏洞與合規風險
最佳 AI 合約審查軟體:即時發現法律漏洞與合規風險

立即在 XIX.AI 探索 2026 年最佳 AI 合約審查軟體。我們精心挑選的頂級清單收錄了多款強大工具,能即時偵測法律漏洞與合規風險。透過實際測試與每週更新的排行榜,比較免費與付費方案的差異。為您找到能徹底改變遊戲規則的解決方案,實現安全且高效的合約分析。立即探索這份權威指南。

10 個工具
xix.ai
評論 (0)
0/500
OR