OpenAI 与 NVIDIA 携手打造 MRC 协议,以革新 AI 训练网络
OpenAI 已正式宣布与五家行业领军企业——AMD、博通、英特尔、微软和英伟达——展开合作,共同推出“多路径可靠连接”(MRC)协议。该开源协议通过开放计算项目(OCP)发布,旨在解决大规模人工智能训练中常见的网络延迟和故障问题。

消除“单点故障”:从三层架构到双层架构
在传统的人工智能模型训练中,网络拥塞或单个链路的轻微故障会像多米诺骨牌一样引发连锁反应,导致数万块 GPU 陷入空闲状态,造成巨大的计算资源浪费。
为从根本上提升系统韧性,MRC协议引入了多平面网络设计。它将单个800Gb/s接口智能地划分为多个较小的链路。这种结构优化使系统仅需两层交换机,即可支持多达约131,000个GPU的大型集群。 与传统的两层或四层架构相比,这种转变不仅大幅减少了物理组件数量和能耗,还显著降低了建设成本。
高级流量管理:数据包“喷洒”与微秒级恢复
除了架构简化,MRC还引入了一种创新的流量分配方法。它采用自适应数据包喷洒技术,摒弃了传统的单路径传输模式。该方法将任务数据包拆分,并将其分布在数百条并行路径上。即使数据包到达顺序混乱,接收方也能准确地将其重组,从而有效防止核心网络中的局部拥塞。
在网络控制方面,MRC用SRv6源路由技术取代了复杂的动态路由协议(如BGP)。这使得发送方能够直接指定路径,而交换机仅执行简单的静态转发。这种设计将网络故障恢复时间从秒级缩短至微秒级,使系统在链路不稳定时能够实现近乎“无缝的自愈”能力。
现实世界验证:超级计算机“稳定器”
MRC协议已部署于NVIDIA的GB200超级计算机和Oracle的云基础设施中。测试数据证实,即使在活跃的训练场景中,MRC也能自动绕过突发性链路抖动或交换机重启等干扰,确保复杂的训练任务持续不中断。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (0)
0/500
OpenAI 已正式宣布与五家行业领军企业——AMD、博通、英特尔、微软和英伟达——展开合作,共同推出“多路径可靠连接”(MRC)协议。该开源协议通过开放计算项目(OCP)发布,旨在解决大规模人工智能训练中常见的网络延迟和故障问题。

消除“单点故障”:从三层架构到双层架构
在传统的人工智能模型训练中,网络拥塞或单个链路的轻微故障会像多米诺骨牌一样引发连锁反应,导致数万块 GPU 陷入空闲状态,造成巨大的计算资源浪费。
为从根本上提升系统韧性,MRC协议引入了多平面网络设计。它将单个800Gb/s接口智能地划分为多个较小的链路。这种结构优化使系统仅需两层交换机,即可支持多达约131,000个GPU的大型集群。 与传统的两层或四层架构相比,这种转变不仅大幅减少了物理组件数量和能耗,还显著降低了建设成本。
高级流量管理:数据包“喷洒”与微秒级恢复
除了架构简化,MRC还引入了一种创新的流量分配方法。它采用自适应数据包喷洒技术,摒弃了传统的单路径传输模式。该方法将任务数据包拆分,并将其分布在数百条并行路径上。即使数据包到达顺序混乱,接收方也能准确地将其重组,从而有效防止核心网络中的局部拥塞。
在网络控制方面,MRC用SRv6源路由技术取代了复杂的动态路由协议(如BGP)。这使得发送方能够直接指定路径,而交换机仅执行简单的静态转发。这种设计将网络故障恢复时间从秒级缩短至微秒级,使系统在链路不稳定时能够实现近乎“无缝的自愈”能力。
现实世界验证:超级计算机“稳定器”
MRC协议已部署于NVIDIA的GB200超级计算机和Oracle的云基础设施中。测试数据证实,即使在活跃的训练场景中,MRC也能自动绕过突发性链路抖动或交换机重启等干扰,确保复杂的训练任务持续不中断。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






