Tongyi Lab 推出 PrismAudio,實現雙向音視訊分離
在人工智慧影片生成技術迅速發展的時代,影像與音訊之間的脫節——通常表現為靜音或音訊與畫面不匹配——仍是影響觀眾沉浸感的重大障礙。 為解決此一挑戰,阿里巴巴的通一實驗室(Tongyi Lab)推出了名為「PrismAudio」的創新影片轉音訊框架。這項研究已獲頂尖人工智慧會議 ICLR 2026 錄用,其重點在於自動將影片內容與精準的環境音效進行同步。

生成前的推理:「思維鏈」掌握音訊
傳統的音訊生成模型通常基於「直覺」運作,經常產生脫節的結果——例如馬蹄聲聽起來像鳥鳴,或是音訊滯後於視覺動作。PrismAudio 的獨特之處在於採用「先規劃,再生成」的方法。
「思維鏈」的分解過程:在生成音訊之前,模型會逐幀分析影片:識別場景元素、確定聲音起始時間、評估音訊特徵(例如清晰度或深度),並在空間上定位聲源。
多維度評估:為確保輸出品質,開發團隊整合了強化學習技術,運用四個「虛擬評估者」針對語義一致性、時間同步性、美學品質及空間精準度等面向對結果進行評分。這種多面向的回饋循環,解決了先前模型常有的問題——即僅針對某一方面進行優化,卻忽略了其他面向。
輕量且高效:0.6 秒內處理 9 秒影片
除了準確度之外,PrismAudio 還具備卓越的速度。透過其專有的Fast-GRPO訓練演算法,該模型在維持運作效率的同時,實現了顯著的性能提升:
精簡架構,強大效能:該模型僅含 5.18 億個參數,遠小於通常需要數百億個參數的同類系統。
快速響應:為一段 9 秒的影片片段生成高品質音訊,僅需0.63 秒,已接近即時處理水準。
產業觀點:真實環境音效的崛起
PrismAudio 的推出不僅為電影後期製作和短片創作提供了強大的自動化工具,更啟發了多物件生成的新方法。隨著 AI 在平衡音頻質感與空間定位方面的能力不斷提升,未來的影片製作將越來越能實現真正的「所見即所聞」保真度。
論文連結:arXiv:2511.18833
開源連結:https://prismaudio-project.github.io/
相關文章
Neros Technologies 獲得 2.5 億美元融資,計劃到 2026 年部署防禦無人機
Neros Archer:一款專為模組化有效載荷和彈性通訊鏈路設計的FPV無人機。| 來源:NerosNeros Inc.已完成2.5億美元的C輪融資,將該國防無人機承包商的估值提升至25億美元。“這筆最新的資金注入加速了Neros向多能力無人機制造商的轉型,”聯合創始人兼執行長Soren Monroe-Anderson表示。“雖然我們每年生產100萬架無人機的目標保持不變,但我們能夠支援的平臺範圍和任務型別正在迅速擴充套件。自去年11月上一輪融資以來,核心業務增長迅猛。這筆資金使我們能夠以決定
宇樹科技,A股首個人形機器人概念股,定於8月19日上市,估值約610億元人民幣
定於8月19日在科創板上市的越數科技,將以每股150.80元的價格上市,發行後市值約為609.93億元。其市盈率高達219.23,估值顯著高於行業平均水平。該公司計劃發行4044.64萬股新股,佔發行後總股本的10%,預計募集資金約60.99億元。網上發行中籤率僅為0.01809759%,成為科創板歷史上競爭最為激烈的IPO之一。財務預測顯示,2025年營收約為17億元,扣除非經常性損益後歸屬於股東的淨利潤為5.91億元。按發行後市值計算,靜態市盈率超過100倍,反映出市場對其高增長的預期。
阿里玄元M890 Ultra節點現已相容Qwen3.8,可在百鍊平臺進行推理
阿里雲於7月23日確認,其“玄武M890”超級節點已成功整合最新旗艦大模型Qwen3.8,使其在阿里雲百鍊平臺上線模型推理服務。這一里程碑事件確立了玄武M890作為中國首個支援萬億引數以上大模型穩定執行的超級節點系統,標誌著國內大模型計算排程軟硬體協同方面取得重大突破。Qwen3.8是阿里雲最新推出的超大規模旗艦模型,擁有高達2.4萬億引數。傳統AI叢集在處理高吞吐、低延遲和高併發推理需求時,常因節點間通訊頻寬受限而面臨效能瓶頸。為確保如此規模下的穩定高效執行,模型引數通常需拆分並分佈在數十甚
相關專題推薦
評論 (0)
0/500
在人工智慧影片生成技術迅速發展的時代,影像與音訊之間的脫節——通常表現為靜音或音訊與畫面不匹配——仍是影響觀眾沉浸感的重大障礙。 為解決此一挑戰,阿里巴巴的通一實驗室(Tongyi Lab)推出了名為「PrismAudio」的創新影片轉音訊框架。這項研究已獲頂尖人工智慧會議 ICLR 2026 錄用,其重點在於自動將影片內容與精準的環境音效進行同步。

生成前的推理:「思維鏈」掌握音訊
傳統的音訊生成模型通常基於「直覺」運作,經常產生脫節的結果——例如馬蹄聲聽起來像鳥鳴,或是音訊滯後於視覺動作。PrismAudio 的獨特之處在於採用「先規劃,再生成」的方法。
「思維鏈」的分解過程:在生成音訊之前,模型會逐幀分析影片:識別場景元素、確定聲音起始時間、評估音訊特徵(例如清晰度或深度),並在空間上定位聲源。
多維度評估:為確保輸出品質,開發團隊整合了強化學習技術,運用四個「虛擬評估者」針對語義一致性、時間同步性、美學品質及空間精準度等面向對結果進行評分。這種多面向的回饋循環,解決了先前模型常有的問題——即僅針對某一方面進行優化,卻忽略了其他面向。
輕量且高效:0.6 秒內處理 9 秒影片
除了準確度之外,PrismAudio 還具備卓越的速度。透過其專有的Fast-GRPO訓練演算法,該模型在維持運作效率的同時,實現了顯著的性能提升:
精簡架構,強大效能:該模型僅含 5.18 億個參數,遠小於通常需要數百億個參數的同類系統。
快速響應:為一段 9 秒的影片片段生成高品質音訊,僅需0.63 秒,已接近即時處理水準。
產業觀點:真實環境音效的崛起
PrismAudio 的推出不僅為電影後期製作和短片創作提供了強大的自動化工具,更啟發了多物件生成的新方法。隨著 AI 在平衡音頻質感與空間定位方面的能力不斷提升,未來的影片製作將越來越能實現真正的「所見即所聞」保真度。
論文連結:arXiv:2511.18833
開源連結:https://prismaudio-project.github.io/
宇樹科技,A股首個人形機器人概念股,定於8月19日上市,估值約610億元人民幣
定於8月19日在科創板上市的越數科技,將以每股150.80元的價格上市,發行後市值約為609.93億元。其市盈率高達219.23,估值顯著高於行業平均水平。該公司計劃發行4044.64萬股新股,佔發行後總股本的10%,預計募集資金約60.99億元。網上發行中籤率僅為0.01809759%,成為科創板歷史上競爭最為激烈的IPO之一。財務預測顯示,2025年營收約為17億元,扣除非經常性損益後歸屬於股東的淨利潤為5.91億元。按發行後市值計算,靜態市盈率超過100倍,反映出市場對其高增長的預期。
阿里玄元M890 Ultra節點現已相容Qwen3.8,可在百鍊平臺進行推理
阿里雲於7月23日確認,其“玄武M890”超級節點已成功整合最新旗艦大模型Qwen3.8,使其在阿里雲百鍊平臺上線模型推理服務。這一里程碑事件確立了玄武M890作為中國首個支援萬億引數以上大模型穩定執行的超級節點系統,標誌著國內大模型計算排程軟硬體協同方面取得重大突破。Qwen3.8是阿里雲最新推出的超大規模旗艦模型,擁有高達2.4萬億引數。傳統AI叢集在處理高吞吐、低延遲和高併發推理需求時,常因節點間通訊頻寬受限而面臨效能瓶頸。為確保如此規模下的穩定高效執行,模型引數通常需拆分並分佈在數十甚





首頁






