NVIDIA 與清華大學推出「Gamma-World」,突破多代理模擬的極限
影片世界模型正從單一代理的視角,轉向多代理協作。傳統模型通常假設僅存在單一代理,這限制了其處理複雜情境的能力——在這些情境中,多名參與者在同一個虛擬世界中相互作用並觀察彼此。 為克服此架構瓶頸,NVIDIA 攜手清華大學、多倫多大學及 Vector 研究院,共同推出了一種新型多代理世界模型解決方案——Gamma-World (γ-World)。
多代理世界建模的主要挑戰在於維持三種類型的 consistency:時間一致性、跨視角一致性與互動一致性。 早期的研究如 Solaris 雖推動了雙代理協作,卻暴露出兩項關鍵缺陷:破壞置換對稱性的身分編碼,以及隨代理數量增加而導致運算量呈二次方增長的全連接注意力機制,這使得系統無法有效擴展至更多參與者。

Gamma-World 透過全面重新設計來解決這些結構性問題。研究團隊引入了「單純形旋轉代理編碼」(Simplex Rotary Agent Encoding),將所有參與者定位於幾何單純形的頂點上,確保他們之間保持自然的等距關係與平等地位。 此設計不包含可學習參數,並採用隨機座標分配,使模型能夠在雙代理數據上進行訓練,並在無需任何架構變更的情況下直接執行四代理情境——這在泛化能力方面是一大飛躍。
為解決運算吞吐量的瓶頸,Gamma-World 採用了「稀疏樞紐注意力機制」。此方法以一組可學習的樞紐標記取代傳統的成對直接通訊,這些標記作為共享世界狀態的壓縮中繼站,將運算成本降低至線性複雜度。 結合獨立快取機制,該系統實現了每秒 24 幀(24 FPS)的即時動作模擬。
在訓練方面,研究團隊採用三階段的師生蒸餾方法,其中雙向師模型引導因果學生模型,將多步驟採樣壓縮為僅四個步驟。此設計在維持動作可控性的同時,顯著減少了自迴歸推論過程中的誤差累積。
實驗結果顯示,在《Minecraft》多玩家虛擬環境的五種核心情境中——包括記憶與建造任務——Gamma-World 的表現優於現有最先進模型,在視訊品質的 FVD 指標上平均降低了超過 40%。 該框架亦已成功應用於真實的雙臂機器人協作任務,證實了其跨情境的適用性。這項進展不僅提升了多代理模擬的效能,更有潛力成為物理人工智慧領域(如多臂醫療協作、工廠多機器人調度及自動駕駛)的大規模模擬生成基礎架構。
相關文章
深入了解 Claudeforce:將 Salesforce 資料與 Claude AI 整合
Salesforce 與 Anthropic 透過推出「Claudeforce」深化戰略聯盟,此舉將強化企業互聯性與平台參與度。圖片來源:JasonDoiy/Getty ImagesSalesforce 與 Anthropic 擴大戰略合作關係,Shannon Mathews 闡述如何透過安全的企业連接來提升平台參與度Salesforce 與 Anthropic 在擴大合作夥伴關係的過程中,匯聚雙
那些令人毫無食慾的AI生成選單背後的同質化問題
起初,你可能會懷疑自己的理智。你走進一家咖啡館,瀏覽一份擺滿貝果三明治的選單,卻發現每張圖片都完美得令人不安——對稱得無可挑剔,質感過於光滑——這觸發了你本能的感覺:有什麼地方不對勁。你並非在胡思亂想;你的直覺是正確的。生成式人工智慧影象已經滲透進餐飲業,這些影象由訓練有素的模型生成,其美學風格狹窄且“討喜”,即使你無法立即解釋原因,也會讓人覺得 inherently(本質上)是錯誤的。有時,這些影象明顯是偽造的,比如一個芝士氣泡豐富、融化得如同前衛藝術而非食物的墨西哥捲餅。更多時候,它們看起來
IBM報告:AI驅動的攻擊事件佔所有事件的25%,且單次損失高於平均水平20%
IBM與Ponemon Institute的最新研究揭示了一個令人不安的轉變:由人工智慧驅動的惡意資料洩露事件現已佔所有惡意資料洩露事件的25%,同比激增56%。這些事件造成的平均損失為600萬美元,比一般資料洩露的典型成本高出20%。攻擊者正日益將目標集中在高影響力領域。62%的人工智慧驅動網路攻擊針對關鍵基礎設施,其中金融服務和能源行業面臨的風險最高。這種集中性威脅可能引發經濟、供應鏈和基本公共服務的連鎖故障。經濟失衡十分明顯:攻擊成本正在下降,而防禦費用卻在上升IBM安全軟體副總裁S
相關專題推薦
評論 (0)
0/500
影片世界模型正從單一代理的視角,轉向多代理協作。傳統模型通常假設僅存在單一代理,這限制了其處理複雜情境的能力——在這些情境中,多名參與者在同一個虛擬世界中相互作用並觀察彼此。 為克服此架構瓶頸,NVIDIA 攜手清華大學、多倫多大學及 Vector 研究院,共同推出了一種新型多代理世界模型解決方案——Gamma-World (γ-World)。
多代理世界建模的主要挑戰在於維持三種類型的 consistency:時間一致性、跨視角一致性與互動一致性。 早期的研究如 Solaris 雖推動了雙代理協作,卻暴露出兩項關鍵缺陷:破壞置換對稱性的身分編碼,以及隨代理數量增加而導致運算量呈二次方增長的全連接注意力機制,這使得系統無法有效擴展至更多參與者。

Gamma-World 透過全面重新設計來解決這些結構性問題。研究團隊引入了「單純形旋轉代理編碼」(Simplex Rotary Agent Encoding),將所有參與者定位於幾何單純形的頂點上,確保他們之間保持自然的等距關係與平等地位。 此設計不包含可學習參數,並採用隨機座標分配,使模型能夠在雙代理數據上進行訓練,並在無需任何架構變更的情況下直接執行四代理情境——這在泛化能力方面是一大飛躍。
為解決運算吞吐量的瓶頸,Gamma-World 採用了「稀疏樞紐注意力機制」。此方法以一組可學習的樞紐標記取代傳統的成對直接通訊,這些標記作為共享世界狀態的壓縮中繼站,將運算成本降低至線性複雜度。 結合獨立快取機制,該系統實現了每秒 24 幀(24 FPS)的即時動作模擬。
在訓練方面,研究團隊採用三階段的師生蒸餾方法,其中雙向師模型引導因果學生模型,將多步驟採樣壓縮為僅四個步驟。此設計在維持動作可控性的同時,顯著減少了自迴歸推論過程中的誤差累積。
實驗結果顯示,在《Minecraft》多玩家虛擬環境的五種核心情境中——包括記憶與建造任務——Gamma-World 的表現優於現有最先進模型,在視訊品質的 FVD 指標上平均降低了超過 40%。 該框架亦已成功應用於真實的雙臂機器人協作任務,證實了其跨情境的適用性。這項進展不僅提升了多代理模擬的效能,更有潛力成為物理人工智慧領域(如多臂醫療協作、工廠多機器人調度及自動駕駛)的大規模模擬生成基礎架構。
深入了解 Claudeforce:將 Salesforce 資料與 Claude AI 整合
Salesforce 與 Anthropic 透過推出「Claudeforce」深化戰略聯盟,此舉將強化企業互聯性與平台參與度。圖片來源:JasonDoiy/Getty ImagesSalesforce 與 Anthropic 擴大戰略合作關係,Shannon Mathews 闡述如何透過安全的企业連接來提升平台參與度Salesforce 與 Anthropic 在擴大合作夥伴關係的過程中,匯聚雙
那些令人毫無食慾的AI生成選單背後的同質化問題
起初,你可能會懷疑自己的理智。你走進一家咖啡館,瀏覽一份擺滿貝果三明治的選單,卻發現每張圖片都完美得令人不安——對稱得無可挑剔,質感過於光滑——這觸發了你本能的感覺:有什麼地方不對勁。你並非在胡思亂想;你的直覺是正確的。生成式人工智慧影象已經滲透進餐飲業,這些影象由訓練有素的模型生成,其美學風格狹窄且“討喜”,即使你無法立即解釋原因,也會讓人覺得 inherently(本質上)是錯誤的。有時,這些影象明顯是偽造的,比如一個芝士氣泡豐富、融化得如同前衛藝術而非食物的墨西哥捲餅。更多時候,它們看起來
IBM報告:AI驅動的攻擊事件佔所有事件的25%,且單次損失高於平均水平20%
IBM與Ponemon Institute的最新研究揭示了一個令人不安的轉變:由人工智慧驅動的惡意資料洩露事件現已佔所有惡意資料洩露事件的25%,同比激增56%。這些事件造成的平均損失為600萬美元,比一般資料洩露的典型成本高出20%。攻擊者正日益將目標集中在高影響力領域。62%的人工智慧驅動網路攻擊針對關鍵基礎設施,其中金融服務和能源行業面臨的風險最高。這種集中性威脅可能引發經濟、供應鏈和基本公共服務的連鎖故障。經濟失衡十分明顯:攻擊成本正在下降,而防禦費用卻在上升IBM安全軟體副總裁S





首頁






