阿里巴巴 Tongyi 推出具備「自由風格」自然語言控制功能的語音模型
今日,阿里巴巴同義實驗室語音團隊推出兩款突破性語音生成模型:Fun-CosyVoice3.5 與 Fun-AudioGen-VD。其核心特色在於支援「自由風格」指令,使用者無需繁複參數調整,僅需透過自然語言描述,即可精準操控聲線表現風格,或從零構建複雜音頻場景。

兩款模型各具特色:
Fun-CosyVoice3.5:多語種複製與細粒度控制
此為CosyVoice的強化版本,在理解語音細微表達方面實現核心突破。
指令驅動生成:使用者可輸入「語氣更自信」、「放慢語速並加入情感變化」等指令,實現即時聲線調整。
語言擴展:新增泰語、印尼語、葡萄牙語及越南語支援,於13種語言中維持業界領先的轉錄準確度(WER)與語音相似度表現。
罕見字元優化:透過專項訓練,罕見字元錯誤率從15.2%降至5.3%。
效能提升:首封封包延遲降低35%,顯著強化即時互動流暢度。
Fun-AudioGen-VD:全方位音效設計
此模型扮演「音效導演」角色,能整合生成「角色+環境」的沉浸式音效。
語音客製化:可指定性別、年齡、口音及「沙啞、低沉、低音」等細部特徵。
情緒與角色扮演:模擬客服專員、播音員、孩童等角色,甚至能傳達「外表平靜內心緊繃」等複雜狀態。
沉浸式環境:添加背景音效(戰場喧囂、咖啡廳低語)與空間特效(教堂混響、水下聲學),實現完整空間模擬。
統一實驗室指出,這些模型將使高品質語音創作普及化,為播客製作、遊戲開發及電影後期製作提供強大的AI支援。
相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
評論 (0)
0/500
今日,阿里巴巴同義實驗室語音團隊推出兩款突破性語音生成模型:Fun-CosyVoice3.5 與 Fun-AudioGen-VD。其核心特色在於支援「自由風格」指令,使用者無需繁複參數調整,僅需透過自然語言描述,即可精準操控聲線表現風格,或從零構建複雜音頻場景。

兩款模型各具特色:
Fun-CosyVoice3.5:多語種複製與細粒度控制
此為CosyVoice的強化版本,在理解語音細微表達方面實現核心突破。
指令驅動生成:使用者可輸入「語氣更自信」、「放慢語速並加入情感變化」等指令,實現即時聲線調整。
語言擴展:新增泰語、印尼語、葡萄牙語及越南語支援,於13種語言中維持業界領先的轉錄準確度(WER)與語音相似度表現。
罕見字元優化:透過專項訓練,罕見字元錯誤率從15.2%降至5.3%。
效能提升:首封封包延遲降低35%,顯著強化即時互動流暢度。
Fun-AudioGen-VD:全方位音效設計
此模型扮演「音效導演」角色,能整合生成「角色+環境」的沉浸式音效。
語音客製化:可指定性別、年齡、口音及「沙啞、低沉、低音」等細部特徵。
情緒與角色扮演:模擬客服專員、播音員、孩童等角色,甚至能傳達「外表平靜內心緊繃」等複雜狀態。
沉浸式環境:添加背景音效(戰場喧囂、咖啡廳低語)與空間特效(教堂混響、水下聲學),實現完整空間模擬。
統一實驗室指出,這些模型將使高品質語音創作普及化,為播客製作、遊戲開發及電影後期製作提供強大的AI支援。
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強





首頁






