Lar
Zigong e a Universidade de Tsinghua apresentam a arquitetura de rede ZCube, que aumenta a taxa de processamento de inferência de modelos de grande porte em 15% e, ao mesmo tempo, reduz os custos de rede em um terço
A inferência de modelos de grande porte está remodelando a infraestrutura de IA, e as inovações na arquitetura de rede são agora fundamentais para explorar o potencial do hardware. Em setembro de 2025, a Zhipu, a Yuchen Network e a Universidade de Tsinghua apresentaram sua pesquisa sobre a arquitetura de rede ZCube na ACM SIGCOMM 2025, uma das principais conferências na área de redes.
Em 21 de maio de 2026, a Zhipu anunciou a implantação bem-sucedida da arquitetura ZCube no ambiente de produção de codificação GLM-5.1, resultando em ganhos substanciais de desempenho. Testes de benchmark, realizados com hardware de GPU, pilha de software e aplicativos inalterados, mostraram que o ZCube reduziu os gastos de capital com switches e módulos ópticos em 33%, aumentou a taxa de processamento média de inferência da GPU em 15% e reduziu a latência do primeiro token (TTFT P99) em 40,6%. Essa inovação em nível de sistema alcança um equilíbrio entre alta eficiência econômica e alto desempenho.

Atualmente, com a inferência de contexto longo e a implantação da separação Prefill-Decode (PD) se tornando padrões do setor, a transmissão entre nós do cache KV apresenta uma assimetria significativa. As arquiteturas ROFT (Rail-Optimized Fat-Tree) tradicionais, que dependem do empilhamento de switches em múltiplas camadas, são limitadas pela topologia estática, tornando-as propensas a pontos de congestionamento locais e contrapressão do PFC. Isso cria um gargalo estrutural em que a largura de banda total é suficiente, mas o congestionamento local é frequente.

Para resolver esse ponto crítico, a arquitetura ZCube se afasta do empilhamento hierárquico dos projetos Clos tradicionais. Ela elimina os switches da camada Spine e, em vez disso, utiliza dois grupos de switches totalmente planos em uma interconexão de grafo bipartido, combinada com o mecanismo de acesso híbrido de trilha única/múltipla de uma placa de rede (NIC) de porta dupla. Por meio de sua estratégia de roteamento exclusiva, o ZCube garante um caminho ideal dedicado para qualquer par de GPUs, alcançando um balanceamento de carga de tráfego perfeito no nível estrutural e suportando expansão em escala ultragrande para dezenas de milhares ou até centenas de milhares de GPUs.
Durante a transformação do ambiente de produção, a equipe da Yuchen Network superou com sucesso os desafios de recabeamento e reconstrução da estratégia de rotas utilizando ferramentas automatizadas de controle e verificação, garantindo uma atualização rápida e estável do cluster. O atual cluster de mil placas vem operando de forma estável há mais de duas semanas. A implantação bem-sucedida do ZCube marca uma mudança na infraestrutura de computação inteligente, passando da interconexão geral para a colaboração entre sistemas impulsionada pelo tráfego de modelos. No futuro, a integração profunda entre topologia de rede, bibliotecas de comunicação e estratégias de agendamento se tornará o principal impulsionador para melhorar ainda mais a eficiência na produção de tokens e reduzir os custos gerais do MaaS.
Artigo relacionado
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
Recomendações de tópicos especiais relacionados
Comentários (0)
A inferência de modelos de grande porte está remodelando a infraestrutura de IA, e as inovações na arquitetura de rede são agora fundamentais para explorar o potencial do hardware. Em setembro de 2025, a Zhipu, a Yuchen Network e a Universidade de Tsinghua apresentaram sua pesquisa sobre a arquitetura de rede ZCube na ACM SIGCOMM 2025, uma das principais conferências na área de redes.
Em 21 de maio de 2026, a Zhipu anunciou a implantação bem-sucedida da arquitetura ZCube no ambiente de produção de codificação GLM-5.1, resultando em ganhos substanciais de desempenho. Testes de benchmark, realizados com hardware de GPU, pilha de software e aplicativos inalterados, mostraram que o ZCube reduziu os gastos de capital com switches e módulos ópticos em 33%, aumentou a taxa de processamento média de inferência da GPU em 15% e reduziu a latência do primeiro token (TTFT P99) em 40,6%. Essa inovação em nível de sistema alcança um equilíbrio entre alta eficiência econômica e alto desempenho.

Atualmente, com a inferência de contexto longo e a implantação da separação Prefill-Decode (PD) se tornando padrões do setor, a transmissão entre nós do cache KV apresenta uma assimetria significativa. As arquiteturas ROFT (Rail-Optimized Fat-Tree) tradicionais, que dependem do empilhamento de switches em múltiplas camadas, são limitadas pela topologia estática, tornando-as propensas a pontos de congestionamento locais e contrapressão do PFC. Isso cria um gargalo estrutural em que a largura de banda total é suficiente, mas o congestionamento local é frequente.

Para resolver esse ponto crítico, a arquitetura ZCube se afasta do empilhamento hierárquico dos projetos Clos tradicionais. Ela elimina os switches da camada Spine e, em vez disso, utiliza dois grupos de switches totalmente planos em uma interconexão de grafo bipartido, combinada com o mecanismo de acesso híbrido de trilha única/múltipla de uma placa de rede (NIC) de porta dupla. Por meio de sua estratégia de roteamento exclusiva, o ZCube garante um caminho ideal dedicado para qualquer par de GPUs, alcançando um balanceamento de carga de tráfego perfeito no nível estrutural e suportando expansão em escala ultragrande para dezenas de milhares ou até centenas de milhares de GPUs.
Durante a transformação do ambiente de produção, a equipe da Yuchen Network superou com sucesso os desafios de recabeamento e reconstrução da estratégia de rotas utilizando ferramentas automatizadas de controle e verificação, garantindo uma atualização rápida e estável do cluster. O atual cluster de mil placas vem operando de forma estável há mais de duas semanas. A implantação bem-sucedida do ZCube marca uma mudança na infraestrutura de computação inteligente, passando da interconexão geral para a colaboração entre sistemas impulsionada pelo tráfego de modelos. No futuro, a integração profunda entre topologia de rede, bibliotecas de comunicação e estratégias de agendamento se tornará o principal impulsionador para melhorar ainda mais a eficiência na produção de tokens e reduzir os custos gerais do MaaS.
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n











