Maison
OpenAI et NVIDIA s'associent pour développer le protocole MRC afin de transformer les réseaux d'entraînement en IA
OpenAI a officiellement annoncé une collaboration avec cinq leaders du secteur — AMD, Broadcom, Intel, Microsoft et NVIDIA — en vue du lancement du protocole MRC (Multipath Reliable Connection). Ce protocole open source, publié dans le cadre de l'Open Compute Project (OCP), est conçu pour remédier aux problèmes de latence et aux pannes réseau fréquemment rencontrés lors de l'entraînement de l'IA à grande échelle.

Éliminer le « point de défaillance unique » : passer d'une architecture à trois niveaux à une architecture à deux niveaux
Dans l'entraînement traditionnel des modèles d'IA, la congestion du réseau ou une défaillance mineure sur une seule liaison peut se propager en cascade, comme des dominos, forçant des dizaines de milliers de GPU à passer en état d'inactivité et entraînant un gaspillage informatique considérable.
Afin d’améliorer fondamentalement la résilience du système, le protocole MRC introduit une conception de réseau multiplan. Il divise intelligemment une interface unique de 800 Gb/s en plusieurs liaisons plus petites. Cette optimisation structurelle permet au système de prendre en charge des clusters massifs comptant jusqu’à environ 131 000 GPU en utilisant seulement deux couches de commutation. Par rapport aux architectures traditionnelles à deux ou quatre niveaux, cette évolution réduit non seulement de manière drastique le nombre de composants physiques et la consommation d'énergie, mais diminue également considérablement les coûts de construction.
Gestion avancée du trafic : « pulvérisation » de paquets et récupération à l'échelle de la microseconde
Au-delà de la simplification architecturale, le MRC introduit une approche novatrice de la distribution du trafic. Il utilise une technologie de « pulvérisation » adaptative des paquets, s'éloignant de la transmission traditionnelle à chemin unique. Cette méthode décompose les paquets de tâches et les distribue sur des centaines de chemins parallèles. Même si les paquets arrivent dans le désordre, le récepteur peut les réassembler avec précision, empêchant ainsi efficacement la congestion localisée au sein du réseau central.
Pour le contrôle du réseau, le MRC remplace les protocoles de routage dynamique complexes (tels que le BGP) par la technologie de routage par source SRv6. Cela permet à l’expéditeur de spécifier directement le chemin, tandis que les commutateurs n’effectuent qu’un simple transfert statique. Cette conception réduit le temps de récupération en cas de défaillance du réseau de quelques secondes à quelques microsecondes, permettant au système d’atteindre une « auto-réparation quasi transparente » face à l’instabilité des liaisons.
Validation en conditions réelles : le « stabilisateur » du supercalculateur
Le protocole MRC est déjà déployé dans le supercalculateur GB200 de NVIDIA et l'infrastructure cloud d'Oracle. Les données de test confirment que même lors de scénarios d'entraînement actifs, le MRC peut automatiquement contourner les perturbations — telles que la gigue soudaine des liaisons ou les redémarrages de commutateurs —, garantissant ainsi la poursuite sans interruption des tâches d'entraînement complexes.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
OpenAI a officiellement annoncé une collaboration avec cinq leaders du secteur — AMD, Broadcom, Intel, Microsoft et NVIDIA — en vue du lancement du protocole MRC (Multipath Reliable Connection). Ce protocole open source, publié dans le cadre de l'Open Compute Project (OCP), est conçu pour remédier aux problèmes de latence et aux pannes réseau fréquemment rencontrés lors de l'entraînement de l'IA à grande échelle.

Éliminer le « point de défaillance unique » : passer d'une architecture à trois niveaux à une architecture à deux niveaux
Dans l'entraînement traditionnel des modèles d'IA, la congestion du réseau ou une défaillance mineure sur une seule liaison peut se propager en cascade, comme des dominos, forçant des dizaines de milliers de GPU à passer en état d'inactivité et entraînant un gaspillage informatique considérable.
Afin d’améliorer fondamentalement la résilience du système, le protocole MRC introduit une conception de réseau multiplan. Il divise intelligemment une interface unique de 800 Gb/s en plusieurs liaisons plus petites. Cette optimisation structurelle permet au système de prendre en charge des clusters massifs comptant jusqu’à environ 131 000 GPU en utilisant seulement deux couches de commutation. Par rapport aux architectures traditionnelles à deux ou quatre niveaux, cette évolution réduit non seulement de manière drastique le nombre de composants physiques et la consommation d'énergie, mais diminue également considérablement les coûts de construction.
Gestion avancée du trafic : « pulvérisation » de paquets et récupération à l'échelle de la microseconde
Au-delà de la simplification architecturale, le MRC introduit une approche novatrice de la distribution du trafic. Il utilise une technologie de « pulvérisation » adaptative des paquets, s'éloignant de la transmission traditionnelle à chemin unique. Cette méthode décompose les paquets de tâches et les distribue sur des centaines de chemins parallèles. Même si les paquets arrivent dans le désordre, le récepteur peut les réassembler avec précision, empêchant ainsi efficacement la congestion localisée au sein du réseau central.
Pour le contrôle du réseau, le MRC remplace les protocoles de routage dynamique complexes (tels que le BGP) par la technologie de routage par source SRv6. Cela permet à l’expéditeur de spécifier directement le chemin, tandis que les commutateurs n’effectuent qu’un simple transfert statique. Cette conception réduit le temps de récupération en cas de défaillance du réseau de quelques secondes à quelques microsecondes, permettant au système d’atteindre une « auto-réparation quasi transparente » face à l’instabilité des liaisons.
Validation en conditions réelles : le « stabilisateur » du supercalculateur
Le protocole MRC est déjà déployé dans le supercalculateur GB200 de NVIDIA et l'infrastructure cloud d'Oracle. Les données de test confirment que même lors de scénarios d'entraînement actifs, le MRC peut automatiquement contourner les perturbations — telles que la gigue soudaine des liaisons ou les redémarrages de commutateurs —, garantissant ainsi la poursuite sans interruption des tâches d'entraînement complexes.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











