OpenAI 與 NVIDIA 攜手打造 MRC 協定,以革新 AI 訓練網路
OpenAI 已正式宣布與五家業界龍頭——AMD、博通(Broadcom)、英特爾(Intel)、微軟(Microsoft)及 NVIDIA——合作,共同推出「多路徑可靠連接」(MRC)協定。這項透過開放運算計畫(OCP)發布的開源協定,旨在解決大規模 AI 訓練中常見的網路延遲與故障問題。

消除「單點故障」:從三層架構轉向雙層架構
在傳統的 AI 模型訓練中,網路擁塞或單一鏈路的輕微故障可能像多米諾骨牌般引發連鎖反應,迫使數萬顆 GPU 進入閒置狀態,導致巨大的運算資源浪費。
為從根本上提升系統韌性,MRC 協定引入了多平面網路設計。它能將單一 800Gb/s 介面智慧地分割為多個較小的鏈路。此結構優化使系統僅需兩個交換機層,即可支援多達約 131,000 顆 GPU 的大型叢集。 相較於傳統的兩層或四層架構,此變革不僅大幅減少了實體元件數量與能源消耗,更顯著降低了建置成本。
進階流量管理:封包「噴灑」與微秒級恢復
除了架構簡化之外,MRC 還引入了一種嶄新的流量分配方法。它採用自適應封包噴灑技術,擺脫了傳統的單路徑傳輸模式。此方法將任務封包拆解,並將其分散至數百條平行路徑上。即使封包抵達順序錯亂,接收端仍能準確地將其重新組裝,有效防止核心網路中的局部擁塞。
在網路控制方面,MRC 以SRv6 來源路由技術取代複雜的動態路由協定(如 BGP)。這使發送方能直接指定路徑,而交換機僅執行簡單的靜態轉發。此設計將網路故障恢復時間從數秒縮短至微秒級,使系統在面對鏈路不穩定時,能實現近乎「無縫的自我修復」。
實務驗證:超級電腦「穩定器」
MRC 協定已部署於 NVIDIA 的 GB200 超級電腦及 Oracle 的雲端基礎架構中。測試數據證實,即使在活躍的訓練情境下,MRC 也能自動繞過干擾(例如突發的鏈路抖動或交換機重新啟動),確保複雜的訓練任務得以不中斷地持續進行。
相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
評論 (0)
0/500
OpenAI 已正式宣布與五家業界龍頭——AMD、博通(Broadcom)、英特爾(Intel)、微軟(Microsoft)及 NVIDIA——合作,共同推出「多路徑可靠連接」(MRC)協定。這項透過開放運算計畫(OCP)發布的開源協定,旨在解決大規模 AI 訓練中常見的網路延遲與故障問題。

消除「單點故障」:從三層架構轉向雙層架構
在傳統的 AI 模型訓練中,網路擁塞或單一鏈路的輕微故障可能像多米諾骨牌般引發連鎖反應,迫使數萬顆 GPU 進入閒置狀態,導致巨大的運算資源浪費。
為從根本上提升系統韌性,MRC 協定引入了多平面網路設計。它能將單一 800Gb/s 介面智慧地分割為多個較小的鏈路。此結構優化使系統僅需兩個交換機層,即可支援多達約 131,000 顆 GPU 的大型叢集。 相較於傳統的兩層或四層架構,此變革不僅大幅減少了實體元件數量與能源消耗,更顯著降低了建置成本。
進階流量管理:封包「噴灑」與微秒級恢復
除了架構簡化之外,MRC 還引入了一種嶄新的流量分配方法。它採用自適應封包噴灑技術,擺脫了傳統的單路徑傳輸模式。此方法將任務封包拆解,並將其分散至數百條平行路徑上。即使封包抵達順序錯亂,接收端仍能準確地將其重新組裝,有效防止核心網路中的局部擁塞。
在網路控制方面,MRC 以SRv6 來源路由技術取代複雜的動態路由協定(如 BGP)。這使發送方能直接指定路徑,而交換機僅執行簡單的靜態轉發。此設計將網路故障恢復時間從數秒縮短至微秒級,使系統在面對鏈路不穩定時,能實現近乎「無縫的自我修復」。
實務驗證:超級電腦「穩定器」
MRC 協定已部署於 NVIDIA 的 GB200 超級電腦及 Oracle 的雲端基礎架構中。測試數據證實,即使在活躍的訓練情境下,MRC 也能自動繞過干擾(例如突發的鏈路抖動或交換機重新啟動),確保複雜的訓練任務得以不中斷地持續進行。
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業





首頁






