Maison
Zigong et l'université de Tsinghua dévoilent l'architecture réseau ZCube, qui permet d'augmenter de 15 % le débit d'inférence des grands modèles tout en réduisant les coûts réseau d'un tiers
L'inférence sur des modèles de grande taille est en train de redéfinir l'infrastructure de l'IA, et les innovations en matière d'architecture réseau sont désormais essentielles pour exploiter pleinement le potentiel du matériel. En septembre 2025, Zhipu, Yuchen Network et l'université de Tsinghua ont présenté leurs travaux de recherche sur l'architecture réseau ZCube lors de l'ACM SIGCOMM 2025, une conférence de référence dans le domaine des réseaux.
Le 21 mai 2026, Zhipu a annoncé le déploiement réussi de l’architecture ZCube dans l’environnement de production de codage GLM-5.1, ce qui a permis d’obtenir des gains de performances substantiels. Des tests de performance, réalisés avec un matériel GPU, une pile logicielle et des applications inchangés, ont montré que ZCube réduisait les dépenses d’investissement en commutateurs et modules optiques de 33 %, augmentait le débit moyen d’inférence des GPU de 15 % et réduisait la latence du premier token (TTFT P99) de 40,6 %. Cette avancée au niveau du système établit un équilibre entre une grande efficacité économique et des performances élevées.

Actuellement, alors que l’inférence à long contexte et le déploiement avec séparation Prefill-Decode (PD) deviennent des normes du secteur, la transmission inter-nœuds du cache KV présente une asymétrie significative. Les architectures ROFT (Rail-Optimized Fat-Tree) traditionnelles, qui reposent sur l’empilement de commutateurs multicouches, sont limitées par une topologie statique, ce qui les rend sujettes aux points chauds locaux et à la contre-pression PFC. Cela crée un goulot d’étranglement structurel où la bande passante totale est suffisante mais où la congestion locale est fréquente.

Pour remédier à ce problème, l’architecture ZCube s’éloigne de l’empilement hiérarchique des conceptions Clos traditionnelles. Elle élimine les commutateurs de la couche « spine » et utilise à la place deux groupes de commutateurs entièrement plats dans une interconnexion de type graphe biparti, combinée au mécanisme d’accès hybride mono/multipiste d’une carte réseau à double port. Grâce à sa stratégie de routage unique, ZCube garantit un chemin optimal dédié pour chaque paire de GPU, permettant ainsi un équilibrage parfait de la charge de trafic au niveau structurel et prenant en charge une expansion à très grande échelle pouvant atteindre des dizaines, voire des centaines de milliers de GPU.
Au cours de la transformation de l’environnement de production, l’équipe de Yuchen Network a relevé avec succès les défis liés au câblage et à la reconstruction de la stratégie de routage à l’aide d’outils automatisés de contrôle et de vérification, garantissant ainsi une mise à niveau rapide et stable du cluster. Le cluster actuel, composé de mille cartes, fonctionne de manière stable depuis plus de deux semaines. Le déploiement réussi de ZCube marque une évolution de l’infrastructure de calcul intelligent, passant d’une interconnexion générale à une collaboration entre systèmes pilotée par le trafic des modèles. À l’avenir, l’intégration profonde de la topologie réseau, des bibliothèques de communication et des stratégies d’ordonnancement deviendra le moteur principal permettant d’améliorer encore l’efficacité de la production de jetons et de réduire les coûts globaux du MaaS.
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)
L'inférence sur des modèles de grande taille est en train de redéfinir l'infrastructure de l'IA, et les innovations en matière d'architecture réseau sont désormais essentielles pour exploiter pleinement le potentiel du matériel. En septembre 2025, Zhipu, Yuchen Network et l'université de Tsinghua ont présenté leurs travaux de recherche sur l'architecture réseau ZCube lors de l'ACM SIGCOMM 2025, une conférence de référence dans le domaine des réseaux.
Le 21 mai 2026, Zhipu a annoncé le déploiement réussi de l’architecture ZCube dans l’environnement de production de codage GLM-5.1, ce qui a permis d’obtenir des gains de performances substantiels. Des tests de performance, réalisés avec un matériel GPU, une pile logicielle et des applications inchangés, ont montré que ZCube réduisait les dépenses d’investissement en commutateurs et modules optiques de 33 %, augmentait le débit moyen d’inférence des GPU de 15 % et réduisait la latence du premier token (TTFT P99) de 40,6 %. Cette avancée au niveau du système établit un équilibre entre une grande efficacité économique et des performances élevées.

Actuellement, alors que l’inférence à long contexte et le déploiement avec séparation Prefill-Decode (PD) deviennent des normes du secteur, la transmission inter-nœuds du cache KV présente une asymétrie significative. Les architectures ROFT (Rail-Optimized Fat-Tree) traditionnelles, qui reposent sur l’empilement de commutateurs multicouches, sont limitées par une topologie statique, ce qui les rend sujettes aux points chauds locaux et à la contre-pression PFC. Cela crée un goulot d’étranglement structurel où la bande passante totale est suffisante mais où la congestion locale est fréquente.

Pour remédier à ce problème, l’architecture ZCube s’éloigne de l’empilement hiérarchique des conceptions Clos traditionnelles. Elle élimine les commutateurs de la couche « spine » et utilise à la place deux groupes de commutateurs entièrement plats dans une interconnexion de type graphe biparti, combinée au mécanisme d’accès hybride mono/multipiste d’une carte réseau à double port. Grâce à sa stratégie de routage unique, ZCube garantit un chemin optimal dédié pour chaque paire de GPU, permettant ainsi un équilibrage parfait de la charge de trafic au niveau structurel et prenant en charge une expansion à très grande échelle pouvant atteindre des dizaines, voire des centaines de milliers de GPU.
Au cours de la transformation de l’environnement de production, l’équipe de Yuchen Network a relevé avec succès les défis liés au câblage et à la reconstruction de la stratégie de routage à l’aide d’outils automatisés de contrôle et de vérification, garantissant ainsi une mise à niveau rapide et stable du cluster. Le cluster actuel, composé de mille cartes, fonctionne de manière stable depuis plus de deux semaines. Le déploiement réussi de ZCube marque une évolution de l’infrastructure de calcul intelligent, passant d’une interconnexion générale à une collaboration entre systèmes pilotée par le trafic des modèles. À l’avenir, l’intégration profonde de la topologie réseau, des bibliothèques de communication et des stratégies d’ordonnancement deviendra le moteur principal permettant d’améliorer encore l’efficacité de la production de jetons et de réduire les coûts globaux du MaaS.
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











