OpenAI 與 NVIDIA 攜手打造 MRC 協定,以革新 AI 訓練網路
OpenAI 已正式宣布與五家業界龍頭——AMD、博通(Broadcom)、英特爾(Intel)、微軟(Microsoft)及 NVIDIA——合作,共同推出「多路徑可靠連接」(MRC)協定。這項透過開放運算計畫(OCP)發布的開源協定,旨在解決大規模 AI 訓練中常見的網路延遲與故障問題。

消除「單點故障」:從三層架構轉向雙層架構
在傳統的 AI 模型訓練中,網路擁塞或單一鏈路的輕微故障可能像多米諾骨牌般引發連鎖反應,迫使數萬顆 GPU 進入閒置狀態,導致巨大的運算資源浪費。
為從根本上提升系統韌性,MRC 協定引入了多平面網路設計。它能將單一 800Gb/s 介面智慧地分割為多個較小的鏈路。此結構優化使系統僅需兩個交換機層,即可支援多達約 131,000 顆 GPU 的大型叢集。 相較於傳統的兩層或四層架構,此變革不僅大幅減少了實體元件數量與能源消耗,更顯著降低了建置成本。
進階流量管理:封包「噴灑」與微秒級恢復
除了架構簡化之外,MRC 還引入了一種嶄新的流量分配方法。它採用自適應封包噴灑技術,擺脫了傳統的單路徑傳輸模式。此方法將任務封包拆解,並將其分散至數百條平行路徑上。即使封包抵達順序錯亂,接收端仍能準確地將其重新組裝,有效防止核心網路中的局部擁塞。
在網路控制方面,MRC 以SRv6 來源路由技術取代複雜的動態路由協定(如 BGP)。這使發送方能直接指定路徑,而交換機僅執行簡單的靜態轉發。此設計將網路故障恢復時間從數秒縮短至微秒級,使系統在面對鏈路不穩定時,能實現近乎「無縫的自我修復」。
實務驗證:超級電腦「穩定器」
MRC 協定已部署於 NVIDIA 的 GB200 超級電腦及 Oracle 的雲端基礎架構中。測試數據證實,即使在活躍的訓練情境下,MRC 也能自動繞過干擾(例如突發的鏈路抖動或交換機重新啟動),確保複雜的訓練任務得以不中斷地持續進行。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
OpenAI 已正式宣布與五家業界龍頭——AMD、博通(Broadcom)、英特爾(Intel)、微軟(Microsoft)及 NVIDIA——合作,共同推出「多路徑可靠連接」(MRC)協定。這項透過開放運算計畫(OCP)發布的開源協定,旨在解決大規模 AI 訓練中常見的網路延遲與故障問題。

消除「單點故障」:從三層架構轉向雙層架構
在傳統的 AI 模型訓練中,網路擁塞或單一鏈路的輕微故障可能像多米諾骨牌般引發連鎖反應,迫使數萬顆 GPU 進入閒置狀態,導致巨大的運算資源浪費。
為從根本上提升系統韌性,MRC 協定引入了多平面網路設計。它能將單一 800Gb/s 介面智慧地分割為多個較小的鏈路。此結構優化使系統僅需兩個交換機層,即可支援多達約 131,000 顆 GPU 的大型叢集。 相較於傳統的兩層或四層架構,此變革不僅大幅減少了實體元件數量與能源消耗,更顯著降低了建置成本。
進階流量管理:封包「噴灑」與微秒級恢復
除了架構簡化之外,MRC 還引入了一種嶄新的流量分配方法。它採用自適應封包噴灑技術,擺脫了傳統的單路徑傳輸模式。此方法將任務封包拆解,並將其分散至數百條平行路徑上。即使封包抵達順序錯亂,接收端仍能準確地將其重新組裝,有效防止核心網路中的局部擁塞。
在網路控制方面,MRC 以SRv6 來源路由技術取代複雜的動態路由協定(如 BGP)。這使發送方能直接指定路徑,而交換機僅執行簡單的靜態轉發。此設計將網路故障恢復時間從數秒縮短至微秒級,使系統在面對鏈路不穩定時,能實現近乎「無縫的自我修復」。
實務驗證:超級電腦「穩定器」
MRC 協定已部署於 NVIDIA 的 GB200 超級電腦及 Oracle 的雲端基礎架構中。測試數據證實,即使在活躍的訓練情境下,MRC 也能自動繞過干擾(例如突發的鏈路抖動或交換機重新啟動),確保複雜的訓練任務得以不中斷地持續進行。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






