opção
AlbertJones
AlbertJones
21 de Maio de 2026

A Zhipu AI e seus parceiros implementaram a arquitetura de rede ZCube em seu ambiente de produção de codificação GLM-5.1, alcançando um avanço em nível de sistema. A nova arquitetura reduziu os custos de capital para switches e módulos ópticos em 33%, aumentou a taxa média de processamento por GPU em 15% e diminuiu o tempo de espera para o primeiro token em 40,6%. Ela resolve os gargalos estruturais na inferência de modelos grandes, substituindo os designs hierárquicos tradicionais por uma interconexão baseada em grafos bipartidos planos, o que permite um equilíbrio perfeito no distribuição da carga de trabalho.

A Zhipu AI e seus parceiros implementaram a arquitetura de rede ZCube em seu ambiente de produção de codificação GLM-5.1, alcançando um avanço em nível de sistema. A nova arquitetura reduziu os custos de capital para switches e módulos ópticos em 33%, aumentou a taxa média de processamento por GPU em 15% e diminuiu o tempo de espera para o primeiro token em 40,6%. Ela resolve os gargalos estruturais na inferência de modelos grandes, substituindo os designs hierárquicos tradicionais por uma interconexão baseada em grafos bipartidos planos, o que permite um equilíbrio perfeito no distribuição da carga de trabalho. A Zhipu AI e seus parceiros implementaram a arquitetura de rede ZCube em seu ambiente de produção de codificação GLM-5.1, alcançando um avanço em nível de sistema. A nova arquitetura reduziu os custos de capital para switches e módulos ópticos em 33%, aumentou a taxa média de processamento por GPU em 15% e diminuiu o tempo de espera para o primeiro token em 40,6%. Ela resolve os gargalos estruturais na inferência de modelos grandes, substituindo os designs hierárquicos tradicionais por uma interconexão baseada em grafos bipartidos planos, o que permite um equilíbrio perfeito no distribuição da carga de trabalho.
Comentários (0)
0/300
OR