Hogar
Zigong y la Universidad de Tsinghua presentan la arquitectura de red ZCube, que aumenta el rendimiento de la inferencia de modelos de gran tamaño en un 15 % y reduce los costes de red en un tercio
La inferencia de modelos a gran escala está transformando la infraestructura de la IA, y las innovaciones en la arquitectura de redes son ahora fundamentales para aprovechar al máximo el potencial del hardware. En septiembre de 2025, Zhipu, Yuchen Network y la Universidad de Tsinghua presentaron su investigación sobre la arquitectura de red ZCube en ACM SIGCOMM 2025, una conferencia líder en el ámbito de las redes.
El 21 de mayo de 2026, Zhipu anunció el éxito en la implementación de la arquitectura ZCube en el entorno de producción de codificación GLM-5.1, lo que se tradujo en una mejora sustancial del rendimiento. Las pruebas de rendimiento, realizadas sin modificar el hardware de la GPU, la pila de software ni las aplicaciones, demostraron que ZCube redujo el gasto de capital en conmutadores y módulos ópticos en un 33 %, aumentó el rendimiento medio de inferencia de la GPU en un 15 % y redujo la latencia del primer token (TTFT P99) en un 40,6 %. Este avance a nivel de sistema logra un equilibrio entre una alta eficiencia económica y un alto rendimiento.

Actualmente, dado que la inferencia de contexto largo y la separación entre Prefill y Decode (PD) se están convirtiendo en estándares del sector, la transmisión entre nodos de la caché KV presenta una asimetría significativa. Las arquitecturas ROFT (Rail-Optimized Fat-Tree) tradicionales, que se basan en el apilamiento de conmutadores multicapa, se ven limitadas por una topología estática, lo que las hace propensas a la aparición de puntos de congestión locales y a la contrapresión del PFC. Esto crea un cuello de botella estructural en el que el ancho de banda total es suficiente, pero la congestión local es frecuente.

Para abordar este punto débil, la arquitectura ZCube se aleja del apilamiento jerárquico de los diseños Clos tradicionales. Elimina los conmutadores de la capa «Spine» y, en su lugar, utiliza dos grupos de conmutadores totalmente planos en una interconexión de grafo bipartito, combinada con el mecanismo de acceso híbrido de una o varias vías de una tarjeta de red de doble puerto. Gracias a su estrategia de enrutamiento única, ZCube garantiza una ruta óptima dedicada para cualquier par de GPU, logrando un equilibrio perfecto de la carga de tráfico a nivel estructural y permitiendo una expansión a gran escala hasta decenas de miles o incluso cientos de miles de GPU.
Durante la transformación del entorno de producción, el equipo de Yuchen Network superó con éxito los retos del cableado y la reconstrucción de la estrategia de rutas mediante herramientas automatizadas de control y verificación, lo que garantizó una actualización rápida y estable del clúster. El clúster actual, compuesto por mil tarjetas, lleva más de dos semanas funcionando de forma estable. El éxito en la implementación de ZCube marca un cambio en la infraestructura de computación inteligente, que pasa de una interconexión general a una colaboración entre sistemas impulsada por el tráfico de modelos. En el futuro, la profunda integración de la topología de red, las bibliotecas de comunicación y las estrategias de programación se convertirá en el motor principal para seguir mejorando la eficiencia en la producción de tokens y reducir los costes generales del MaaS.
Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
La inferencia de modelos a gran escala está transformando la infraestructura de la IA, y las innovaciones en la arquitectura de redes son ahora fundamentales para aprovechar al máximo el potencial del hardware. En septiembre de 2025, Zhipu, Yuchen Network y la Universidad de Tsinghua presentaron su investigación sobre la arquitectura de red ZCube en ACM SIGCOMM 2025, una conferencia líder en el ámbito de las redes.
El 21 de mayo de 2026, Zhipu anunció el éxito en la implementación de la arquitectura ZCube en el entorno de producción de codificación GLM-5.1, lo que se tradujo en una mejora sustancial del rendimiento. Las pruebas de rendimiento, realizadas sin modificar el hardware de la GPU, la pila de software ni las aplicaciones, demostraron que ZCube redujo el gasto de capital en conmutadores y módulos ópticos en un 33 %, aumentó el rendimiento medio de inferencia de la GPU en un 15 % y redujo la latencia del primer token (TTFT P99) en un 40,6 %. Este avance a nivel de sistema logra un equilibrio entre una alta eficiencia económica y un alto rendimiento.

Actualmente, dado que la inferencia de contexto largo y la separación entre Prefill y Decode (PD) se están convirtiendo en estándares del sector, la transmisión entre nodos de la caché KV presenta una asimetría significativa. Las arquitecturas ROFT (Rail-Optimized Fat-Tree) tradicionales, que se basan en el apilamiento de conmutadores multicapa, se ven limitadas por una topología estática, lo que las hace propensas a la aparición de puntos de congestión locales y a la contrapresión del PFC. Esto crea un cuello de botella estructural en el que el ancho de banda total es suficiente, pero la congestión local es frecuente.

Para abordar este punto débil, la arquitectura ZCube se aleja del apilamiento jerárquico de los diseños Clos tradicionales. Elimina los conmutadores de la capa «Spine» y, en su lugar, utiliza dos grupos de conmutadores totalmente planos en una interconexión de grafo bipartito, combinada con el mecanismo de acceso híbrido de una o varias vías de una tarjeta de red de doble puerto. Gracias a su estrategia de enrutamiento única, ZCube garantiza una ruta óptima dedicada para cualquier par de GPU, logrando un equilibrio perfecto de la carga de tráfico a nivel estructural y permitiendo una expansión a gran escala hasta decenas de miles o incluso cientos de miles de GPU.
Durante la transformación del entorno de producción, el equipo de Yuchen Network superó con éxito los retos del cableado y la reconstrucción de la estrategia de rutas mediante herramientas automatizadas de control y verificación, lo que garantizó una actualización rápida y estable del clúster. El clúster actual, compuesto por mil tarjetas, lleva más de dos semanas funcionando de forma estable. El éxito en la implementación de ZCube marca un cambio en la infraestructura de computación inteligente, que pasa de una interconexión general a una colaboración entre sistemas impulsada por el tráfico de modelos. En el futuro, la profunda integración de la topología de red, las bibliotecas de comunicación y las estrategias de programación se convertirá en el motor principal para seguir mejorando la eficiencia en la producción de tokens y reducir los costes generales del MaaS.
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t











