微軟的 VibeVoice AI 系列開放原始碼,可處理長達 90 分鐘的對話,GitHub 星標數突破 27,000 顆
微軟最近開源了一套名為VibeVoice 的尖端語音 AI 模型系列,具備自動語音辨識(ASR)和文字轉語音(TTS)等功能。 憑藉其強大的長音訊處理能力、自然的多發言人對話生成功能,以及即時、低延遲的表現,該專案迅速引起開發者社群的關注,目前在 GitHub 上已累積約 27,000 顆星。
VibeVoice 作為採用 MIT 授權的開源研究框架發布,支援本地部署且無需支付雲端訂閱費用,旨在促進語音合成領域的合作與創新。該模型系列包含三個核心成員,各自針對傳統語音 AI 中的特定挑戰進行優化,例如長序列處理、發言人一致性及自然流暢度。

VibeVoice-ASR-7B:強大的結構化語音轉文字工具,可處理長達 60 分鐘的音訊
VibeVoice-ASR-7B是一款統一的語音轉文字模型,能夠在單次處理中處理長達 60 分鐘的音訊檔案,並直接輸出結構化文字記錄。輸出結果會識別說話者、提供精確的時間戳記,並詳述語音內容,同時支援自訂熱詞以提升專有名詞或技術術語的辨識準確度。 支援超過 50 種語言,非常適合用於長篇會議錄音和播客轉錄等複雜情境。
社群開發者已基於此模型開發出實用工具,例如適用於 macOS 和 Windows 的語音輸入法「Vibing」。使用者反饋顯示其在速度與準確度方面表現優異,顯著提升了日常語音輸入的效率。
VibeVoice-TTS-1.5B:支援多達 90 分鐘、多名講者的生動語音生成
VibeVoice-TTS-1.5B是核心文字轉語音模型,能一次生成長達 90 分鐘的連續音訊,並支援多達四位不同講者,以模擬自然的對話。合成語音極具表現力,聽起來自然流暢,並具備真實的停頓、重音和情緒變化,非常適合播客、長篇敘事、有聲書或多角色對話。
有別於許多僅限 1 至 2 名發言者的傳統 TTS 模型,VibeVoice-TTS 在長篇內容與多發言者的一致性方面實現了重大突破。其架構結合了連續語音分詞器(包含聲學與語義分析)與低幀率(7.5Hz),大幅提升了長序列的運算效率。
VibeVoice-Realtime-0.5B:延遲約 300 毫秒的即時語音合成
VibeVoice-Realtime-0.5B專為即時應用設計,支援串流文字輸入,首音延遲約 300 毫秒,同時仍能生成長達 10 分鐘的音訊。此模型特別適合需要即時回饋的互動式應用,例如即時語音助理或直播配音。
此外,該專案還引入了實驗性的發音者支援功能,包含多國語言發音及多種英語風格變體,為開發者提供更豐富的自訂選項。
AIbase 評析:微軟將 VibeVoice 開源,不僅降低了高性能語音 AI 的入門門檻,更提供了一套完整的本地部署解決方案。該專案曾因潛在的濫用風險而短暫下架,但在實施音訊水印和可聽見的免責聲明等安全措施後重新上線,體現了負責任的 AI 開發原則。開發者現在可從 GitHub 和 Hugging Face 取得模型權重,並透過 Colab 等平台快速進行測試。
隨著開源社群持續貢獻(包括針對 Apple Silicon 的優化),VibeVoice 勢將加速在內容創作、輔助技術工具及語音互動領域的應用。有興趣的開發者可造訪微軟的官方專案頁面進行進一步探索。
專案網址:https://github.com/microsoft/VibeVoice
相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
評論 (0)
0/500
微軟最近開源了一套名為VibeVoice 的尖端語音 AI 模型系列,具備自動語音辨識(ASR)和文字轉語音(TTS)等功能。 憑藉其強大的長音訊處理能力、自然的多發言人對話生成功能,以及即時、低延遲的表現,該專案迅速引起開發者社群的關注,目前在 GitHub 上已累積約 27,000 顆星。
VibeVoice 作為採用 MIT 授權的開源研究框架發布,支援本地部署且無需支付雲端訂閱費用,旨在促進語音合成領域的合作與創新。該模型系列包含三個核心成員,各自針對傳統語音 AI 中的特定挑戰進行優化,例如長序列處理、發言人一致性及自然流暢度。

VibeVoice-ASR-7B:強大的結構化語音轉文字工具,可處理長達 60 分鐘的音訊
VibeVoice-ASR-7B是一款統一的語音轉文字模型,能夠在單次處理中處理長達 60 分鐘的音訊檔案,並直接輸出結構化文字記錄。輸出結果會識別說話者、提供精確的時間戳記,並詳述語音內容,同時支援自訂熱詞以提升專有名詞或技術術語的辨識準確度。 支援超過 50 種語言,非常適合用於長篇會議錄音和播客轉錄等複雜情境。
社群開發者已基於此模型開發出實用工具,例如適用於 macOS 和 Windows 的語音輸入法「Vibing」。使用者反饋顯示其在速度與準確度方面表現優異,顯著提升了日常語音輸入的效率。
VibeVoice-TTS-1.5B:支援多達 90 分鐘、多名講者的生動語音生成
VibeVoice-TTS-1.5B是核心文字轉語音模型,能一次生成長達 90 分鐘的連續音訊,並支援多達四位不同講者,以模擬自然的對話。合成語音極具表現力,聽起來自然流暢,並具備真實的停頓、重音和情緒變化,非常適合播客、長篇敘事、有聲書或多角色對話。
有別於許多僅限 1 至 2 名發言者的傳統 TTS 模型,VibeVoice-TTS 在長篇內容與多發言者的一致性方面實現了重大突破。其架構結合了連續語音分詞器(包含聲學與語義分析)與低幀率(7.5Hz),大幅提升了長序列的運算效率。
VibeVoice-Realtime-0.5B:延遲約 300 毫秒的即時語音合成
VibeVoice-Realtime-0.5B專為即時應用設計,支援串流文字輸入,首音延遲約 300 毫秒,同時仍能生成長達 10 分鐘的音訊。此模型特別適合需要即時回饋的互動式應用,例如即時語音助理或直播配音。
此外,該專案還引入了實驗性的發音者支援功能,包含多國語言發音及多種英語風格變體,為開發者提供更豐富的自訂選項。
AIbase 評析:微軟將 VibeVoice 開源,不僅降低了高性能語音 AI 的入門門檻,更提供了一套完整的本地部署解決方案。該專案曾因潛在的濫用風險而短暫下架,但在實施音訊水印和可聽見的免責聲明等安全措施後重新上線,體現了負責任的 AI 開發原則。開發者現在可從 GitHub 和 Hugging Face 取得模型權重,並透過 Colab 等平台快速進行測試。
隨著開源社群持續貢獻(包括針對 Apple Silicon 的優化),VibeVoice 勢將加速在內容創作、輔助技術工具及語音互動領域的應用。有興趣的開發者可造訪微軟的官方專案頁面進行進一步探索。
專案網址:https://github.com/microsoft/VibeVoice
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強





首頁






