阿里巴巴的通一實驗室將 Fun-CineForge 開源,解決多發言人配音的難題
在電影和動畫等高規格製作中,傳統的 AI 配音技術往往難以勝任,因為精準捕捉細膩的情感高潮與完美同步的嘴型動畫至關重要。為解決這一核心產業挑戰,同益實驗室正式推出並開源了這款開創性的電影級多場景多模態配音模型——Fun-CineForge 。
彌合視聽鴻溝:實現無縫同步的四大支柱框架
Fun-CineForge 並非僅依賴基礎的文字轉語音技術,而是專為掌握專業配音的四大關鍵維度而設計:
口型同步:確保合成語音與螢幕角色嘴型動作以極高精度對齊。
情感表達:透過分析面部線索與情境指令,為聲音注入真實的人類情感。
聲音一致性:在複雜的多角色對話場景中,為特定角色維持穩定且可辨識的聲音特徵。
時間對齊:即使發言者不在畫面中或部分被遮擋,也能以毫秒級精準度插入對白。
核心創新:開創性的「時間模態」與高保真資料集
Fun-CineForge 的技術飛躍源自其獨特的「數據+模型」協同設計哲學:

CineDub 高品質資料集:同益實驗室亦已開源自動化的 CineDub 資料集建構管線。透過「思維鏈」錯誤修正機制,將中英文文字的轉錄錯誤率降低至約 1% 至 2%,並將發言人標定錯誤率大幅削減至低至 1.2%。
四模態融合架構:該模型首創整合「時間模態」,共同建模視覺輸入(唇形與表情)、文字(對白與情感語境)及音訊(語音參考)。此融合技術能在具挑戰性的場景中實現精準同步,包括沒有可見臉部的場景。
卓越表現:開創真實的多角色對話配音
基準測試結果顯示,Fun-CineForge 在關鍵指標上(包括單字錯誤率(WER/CER)、唇形同步(LSE-C/D)及聲音相似度)均大幅超越 DeepDubber-V1 等基準模型。其里程碑式的成就在於首創精準處理二重唱與多人對話的能力,並在長達 30 秒的影片片段中展現出卓越的穩健性。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
相關文章
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
相關專題推薦
評論 (0)
0/500
在電影和動畫等高規格製作中,傳統的 AI 配音技術往往難以勝任,因為精準捕捉細膩的情感高潮與完美同步的嘴型動畫至關重要。為解決這一核心產業挑戰,同益實驗室正式推出並開源了這款開創性的電影級多場景多模態配音模型——
彌合視聽鴻溝:實現無縫同步的四大支柱框架
Fun-CineForge 並非僅依賴基礎的文字轉語音技術,而是專為掌握專業配音的四大關鍵維度而設計:
口型同步:確保合成語音與螢幕角色嘴型動作以極高精度對齊。
情感表達:透過分析面部線索與情境指令,為聲音注入真實的人類情感。
聲音一致性:在複雜的多角色對話場景中,為特定角色維持穩定且可辨識的聲音特徵。
時間對齊:即使發言者不在畫面中或部分被遮擋,也能以毫秒級精準度插入對白。
核心創新:開創性的「時間模態」與高保真資料集
Fun-CineForge 的技術飛躍源自其獨特的「數據+模型」協同設計哲學:

CineDub 高品質資料集:同益實驗室亦已開源自動化的 CineDub 資料集建構管線。透過「思維鏈」錯誤修正機制,將中英文文字的轉錄錯誤率降低至約 1% 至 2%,並將發言人標定錯誤率大幅削減至低至 1.2%。
四模態融合架構:該模型首創整合「時間模態」,共同建模視覺輸入(唇形與表情)、文字(對白與情感語境)及音訊(語音參考)。此融合技術能在具挑戰性的場景中實現精準同步,包括沒有可見臉部的場景。
卓越表現:開創真實的多角色對話配音
基準測試結果顯示,Fun-CineForge 在關鍵指標上(包括單字錯誤率(WER/CER)、唇形同步(LSE-C/D)及聲音相似度)均大幅超越 DeepDubber-V1 等基準模型。其里程碑式的成就在於首創精準處理二重唱與多人對話的能力,並在長達 30 秒的影片片段中展現出卓越的穩健性。
GitHub:https://github.com/FunAudioLLM/FunCineForge
HuggingFace:https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope:https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統





首頁






