Lar
Black Tech, de Ali: modelo de 0,6 bilhão atualizado para 17 bilhões de MoE com 5% de parâmetros ativos, rodando na CPU a 30 tokens por segundo
A equipe de Comércio Digital da Ali International apresentou o Marco-Mini-Instruct, a mais recente adição à série Marco-MoE, demonstrando como “escalas menores podem gerar grandes resultados”. Com um total de 17,3 bilhões de parâmetros, apenas 0,86 bilhão estão ativos (aproximadamente 5%), permitindo uma velocidade de inferência excepcional que funciona perfeitamente até mesmo em CPUs padrão.

Ultraleve: otimizado para desempenho da CPU
De acordo com dados oficiais, utilizando quantização de 8 bits com quatro módulos de memória DDR4 2400, o modelo atinge uma velocidade de inferência de aproximadamente 30 tokens por segundo. Essa eficiência aproxima a arquitetura Mixture-of-Experts (MoE) da acessibilidade generalizada, reduzindo significativamente as barreiras à implantação local.
Inovação-chave: a tecnologia de upcycling transforma o potencial
A característica que mais se destaca no Marco-Mini-Instruct não é seu tamanho ou velocidade, mas seu método de criação exclusivo. Em vez de ser treinado do zero, esse modelo foi desenvolvido a partir do modelo Qwen3-0.6B-Base usando a tecnologia de upcycling.

Esse processo envolve dividir ou copiar componentes de um modelo pequeno e denso em múltiplos especialistas, introduzindo um mecanismo de roteamento. Ele também integra o particionamento refinado de submatrizes e estratégias de “Drop-Upcycling” — descartando aleatoriamente certos especialistas ou caminhos de roteamento durante o treinamento para adicionar regularização e melhorar a robustez. Essa abordagem transforma com sucesso um modelo Dense puro em uma arquitetura MoE, oferecendo ao setor um caminho novo, econômico e eficiente para o treinamento MoE.
Comprimento do contexto e configuração do treinamento
A configuração do modelo expande o `max_position_embeddings` para 32K, embora a fase de Ajuste Fino Supervisionado (SFT) utilize um contexto de 8.192 tokens. Consequentemente, o comprimento padrão do contexto é adequado para a maioria dos cenários práticos de aplicação.
Avanço pós-treinamento: destilação em cascata baseada na política
A fase pós-treinamento é igualmente impressionante: ela começa com o pré-aquecimento do SFT, seguido por uma estratégia de destilação on-policy em cascata. Inicialmente, a destilação utiliza o Qwen3-30B-A3B-Instruct como modelo professor e, em seguida, muda para o Qwen3-Next-80B-A3B-Instruct, que é mais potente. Os dados de destilação abrangem o cumprimento de instruções, raciocínio complexo, segurança de alinhamento e capacidades matemáticas, garantindo que o modelo mantenha a eficiência ao mesmo tempo em que aumenta significativamente a inteligência geral.
Resultados de benchmark: 0,86 bilhão de parâmetros ativos superam modelos densos de 4 bilhões
O Marco-Mini-Instruct final supera muitos modelos densos, como o Qwen3-4B, na maioria dos benchmarks convencionais. Com apenas 0,86 bilhão de parâmetros ativos, ele valida plenamente o vasto potencial da arquitetura MoE em oferecer um desempenho “pequeno, mas poderoso”.
Impacto no setor: um novo paradigma de treinamento MoE de código aberto
A AIbase acredita que o maior valor dessa conquista reside na abertura de novas oportunidades para os desenvolvedores. Não há mais necessidade de treinar modelos MoE em grande escala a partir do zero; em vez disso, as equipes podem selecionar um modelo denso pequeno adequado e reproduzir rigorosamente os processos de upcycling e Drop-Upcycling descritos no artigo. O custo total do treinamento permanece administrável: a fase SFT requer 64 GPUs por 24 horas, e a fase de destilação precisa de 64 GPUs por 110 horas, reduzindo significativamente o limiar para que equipes de pequeno e médio porte experimentem o MoE.
A mais recente “modificação” da Alibaba prova mais uma vez que avanços na eficiência dos modelos não dependem necessariamente do empilhamento de parâmetros; paradigmas inovadores de treinamento também podem impulsionar saltos qualitativos. O lançamento do Marco-Mini-Instruct, sem dúvida, acelerará a adoção da tecnologia MoE em dispositivos de borda e em cenários de desenvolvimento pessoal, tornando-o um avanço fundamental a ser acompanhado por todo o setor.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
A equipe de Comércio Digital da Ali International apresentou o Marco-Mini-Instruct, a mais recente adição à série Marco-MoE, demonstrando como “escalas menores podem gerar grandes resultados”. Com um total de 17,3 bilhões de parâmetros, apenas 0,86 bilhão estão ativos (aproximadamente 5%), permitindo uma velocidade de inferência excepcional que funciona perfeitamente até mesmo em CPUs padrão.

Ultraleve: otimizado para desempenho da CPU
De acordo com dados oficiais, utilizando quantização de 8 bits com quatro módulos de memória DDR4 2400, o modelo atinge uma velocidade de inferência de aproximadamente 30 tokens por segundo. Essa eficiência aproxima a arquitetura Mixture-of-Experts (MoE) da acessibilidade generalizada, reduzindo significativamente as barreiras à implantação local.
Inovação-chave: a tecnologia de upcycling transforma o potencial
A característica que mais se destaca no Marco-Mini-Instruct não é seu tamanho ou velocidade, mas seu método de criação exclusivo. Em vez de ser treinado do zero, esse modelo foi desenvolvido a partir do modelo Qwen3-0.6B-Base usando a tecnologia de upcycling.

Esse processo envolve dividir ou copiar componentes de um modelo pequeno e denso em múltiplos especialistas, introduzindo um mecanismo de roteamento. Ele também integra o particionamento refinado de submatrizes e estratégias de “Drop-Upcycling” — descartando aleatoriamente certos especialistas ou caminhos de roteamento durante o treinamento para adicionar regularização e melhorar a robustez. Essa abordagem transforma com sucesso um modelo Dense puro em uma arquitetura MoE, oferecendo ao setor um caminho novo, econômico e eficiente para o treinamento MoE.
Comprimento do contexto e configuração do treinamento
A configuração do modelo expande o `max_position_embeddings` para 32K, embora a fase de Ajuste Fino Supervisionado (SFT) utilize um contexto de 8.192 tokens. Consequentemente, o comprimento padrão do contexto é adequado para a maioria dos cenários práticos de aplicação.
Avanço pós-treinamento: destilação em cascata baseada na política
A fase pós-treinamento é igualmente impressionante: ela começa com o pré-aquecimento do SFT, seguido por uma estratégia de destilação on-policy em cascata. Inicialmente, a destilação utiliza o Qwen3-30B-A3B-Instruct como modelo professor e, em seguida, muda para o Qwen3-Next-80B-A3B-Instruct, que é mais potente. Os dados de destilação abrangem o cumprimento de instruções, raciocínio complexo, segurança de alinhamento e capacidades matemáticas, garantindo que o modelo mantenha a eficiência ao mesmo tempo em que aumenta significativamente a inteligência geral.
Resultados de benchmark: 0,86 bilhão de parâmetros ativos superam modelos densos de 4 bilhões
O Marco-Mini-Instruct final supera muitos modelos densos, como o Qwen3-4B, na maioria dos benchmarks convencionais. Com apenas 0,86 bilhão de parâmetros ativos, ele valida plenamente o vasto potencial da arquitetura MoE em oferecer um desempenho “pequeno, mas poderoso”.
Impacto no setor: um novo paradigma de treinamento MoE de código aberto
A AIbase acredita que o maior valor dessa conquista reside na abertura de novas oportunidades para os desenvolvedores. Não há mais necessidade de treinar modelos MoE em grande escala a partir do zero; em vez disso, as equipes podem selecionar um modelo denso pequeno adequado e reproduzir rigorosamente os processos de upcycling e Drop-Upcycling descritos no artigo. O custo total do treinamento permanece administrável: a fase SFT requer 64 GPUs por 24 horas, e a fase de destilação precisa de 64 GPUs por 110 horas, reduzindo significativamente o limiar para que equipes de pequeno e médio porte experimentem o MoE.
A mais recente “modificação” da Alibaba prova mais uma vez que avanços na eficiência dos modelos não dependem necessariamente do empilhamento de parâmetros; paradigmas inovadores de treinamento também podem impulsionar saltos qualitativos. O lançamento do Marco-Mini-Instruct, sem dúvida, acelerará a adoção da tecnologia MoE em dispositivos de borda e em cenários de desenvolvimento pessoal, tornando-o um avanço fundamental a ser acompanhado por todo o setor.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











