O modelo compacto Qwen 3.5 da Alibaba desafia o GPT-4o

Modelo com 4 bilhões de parâmetros comprova que “menos é mais”, inaugurando uma nova era para a implantação local de IA na China
O campo da IA há muito opera sob a crença de que mais parâmetros equivalem a maior inteligência. No entanto, a série Qwen 3.5 de modelos pequenos, lançada recentemente pela Alibaba, apresentou um caso clássico de “o pequeno vencendo o grande”. Em testes no mundo real, o modelo Qwen 3.5-4B, com apenas 4 bilhões de parâmetros, enfrentou o modelo GPT-4o, que supostamente tem mais de 100 bilhões de parâmetros, e não só se saiu bem quanto ficou ligeiramente à frente.
Esse desafio entre níveis foi conduzido pela entidade terceirizada N8 Programs. Os testadores selecionaram aleatoriamente 1.000 perguntas do mundo real do conjunto de dados WildChat, colocando o Qwen 3.5-4B contra o GPT-4o no mesmo palco, com o Opus 4.6 — atualmente reconhecido como o juiz mais poderoso — supervisionando a competição. Os resultados foram surpreendentes: ao longo dessa arena de perguntas e respostas de 1.000 rodadas, o Qwen 3.5-4B alcançou 499 vitórias, 431 derrotas e 70 empates, superando o GPT-4o no final das contas.
O dado mais impressionante é que especula-se que o GPT-4o possua até 200 bilhões de parâmetros, enquanto o Qwen 3.5-4B tem apenas 2% desse número. Isso demonstra a conquista da Alibaba de resultados de raciocínio lógico de alto nível com gasto mínimo de recursos.
Além de seu desempenho formidável, o principal atrativo da série Qwen 3.5 reside em sua excepcional adequação para implantação local. O lançamento oficial inclui quatro tamanhos — 0,8B, 2B, 4B e 9B — cobrindo cenários que vão desde dispositivos de borda de IoT até servidores. A versão 4B é particularmente digna de nota, exigindo teoricamente apenas 8 GB de VRAM para rodar, com 16 GB recomendados para uma operação suave.
Para usuários comuns e desenvolvedores, isso representa uma forma de “liberação do poder de computação”. Não há mais necessidade de placas de computação profissionais que custam dezenas de milhares; agora você pode ter um “assistente pessoal” com desempenho que rivaliza com os grandes modelos de ponta diretamente no seu próprio computador — ou até mesmo no smartphone.
Como a equipe do Qwen demonstrou: maior nem sempre é melhor. Uma IA capaz de rodar nos próprios dispositivos dos usuários é o verdadeiro divisor de águas para a produtividade futura. Com a versão 9B competindo diretamente com o desempenho de grandes modelos da classe 120B, os grandes modelos chineses estão demonstrando a capacidade inovadora única da China por meio dessa abordagem de “otimização”, revelando à comunidade global de desenvolvedores a força da IA “Made in China”.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (2)
Alibaba's Qwen 3.5 with just 4B params taking on GPT-4o? That's hilarious — reminds me of David vs Goliath but with neural nets. "Less is more" might be true for local deployment, but I bet real benchmarks will tell a different story. Still, props for challenging the parameter arms race. 🍵

Modelo com 4 bilhões de parâmetros comprova que “menos é mais”, inaugurando uma nova era para a implantação local de IA na China
O campo da IA há muito opera sob a crença de que mais parâmetros equivalem a maior inteligência. No entanto, a série
Esse desafio entre níveis foi conduzido pela entidade terceirizada N8 Programs. Os testadores selecionaram aleatoriamente 1.000 perguntas do mundo real do conjunto de dados WildChat, colocando o Qwen 3.5-4B contra o GPT-4o no mesmo palco, com o Opus 4.6 — atualmente reconhecido como o juiz mais poderoso — supervisionando a competição. Os resultados foram surpreendentes: ao longo dessa arena de perguntas e respostas de 1.000 rodadas, o Qwen 3.5-4B alcançou 499 vitórias, 431 derrotas e 70 empates, superando o GPT-4o no final das contas.
O dado mais impressionante é que especula-se que o GPT-4o possua até 200 bilhões de parâmetros, enquanto o Qwen 3.5-4B tem apenas 2% desse número. Isso demonstra a conquista da Alibaba de resultados de raciocínio lógico de alto nível com gasto mínimo de recursos.
Além de seu desempenho formidável, o principal atrativo da série Qwen 3.5 reside em sua excepcional adequação para implantação local. O lançamento oficial inclui quatro tamanhos — 0,8B, 2B, 4B e 9B — cobrindo cenários que vão desde dispositivos de borda de IoT até servidores. A versão 4B é particularmente digna de nota, exigindo teoricamente apenas 8 GB de VRAM para rodar, com 16 GB recomendados para uma operação suave.
Para usuários comuns e desenvolvedores, isso representa uma forma de “liberação do poder de computação”. Não há mais necessidade de placas de computação profissionais que custam dezenas de milhares; agora você pode ter um “assistente pessoal” com desempenho que rivaliza com os grandes modelos de ponta diretamente no seu próprio computador — ou até mesmo no smartphone.
Como a equipe
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Alibaba's Qwen 3.5 with just 4B params taking on GPT-4o? That's hilarious — reminds me of David vs Goliath but with neural nets. "Less is more" might be true for local deployment, but I bet real benchmarks will tell a different story. Still, props for challenging the parameter arms race. 🍵





Lar






