Google revela a arquitetura Gemma 4 E2B para um avanço na IA no próprio dispositivo

O ecossistema de modelos de grande porte de código aberto alcançou um grande avanço em sua arquitetura subjacente. O Google DeepMind lançou recentemente seu modelo aberto mais poderoso até o momento, o Gemma4. Embora o número de parâmetros do modelo permaneça semelhante ao de seu antecessor, em torno de 30 bilhões, sua “inteligência por parâmetro” deu um salto significativo. Seu desempenho em várias tarefas essenciais agora rivaliza com o dos principais modelos de grande porte de código fechado de um ano e meio atrás.
A inovação tecnológica mais notável do Gemma4 é a introdução da nova arquitetura “E2B” (descarregamento de parâmetros). Nos projetos tradicionais do Transformer, a grande camada de embedding normalmente consome uma quantidade significativa de memória da GPU. A nova arquitetura adiciona de forma inteligente uma tabela de embedding em cada camada, substituindo a pesada multiplicação de matrizes completas por um mecanismo de tabela de consulta. Por exemplo, com um modelo de 50 bilhões de parâmetros na arquitetura E2B, apenas 20 bilhões de parâmetros precisam ser carregados na memória da GPU, enquanto os 30 bilhões restantes podem ser transferidos com segurança para a CPU ou até mesmo para o disco. Isso permite que o modelo realize inferências rápidas usando apenas 2 GB de memória da GPU, superando gargalos de implantação em dispositivos de borda, como celulares e Raspberry Pi.
Por se tratar de um lançamento altamente ambicioso e complexo, a equipe do Google DeepMind coordenou-se com quase 50 parceiros externos, incluindo Hugging Face, llama.cpp, Ollama, NVIDIA e AMD. Atualmente, o Gemma4 está profundamente integrado ao Android Studio. Os desenvolvedores podem invocar a IA com segurança para escrever código Android localmente em ambientes offline, sem enviar nenhum código para uma API na nuvem no modo Agent. Isso atende amplamente à forte demanda por privacidade de dados e trabalho offline no ambiente de trabalho.
Em termos de recursos multimodais e experiência central, o Gemma4 herda as conquistas de pesquisa do Gemini3. Mesmo pequenos modelos de borda com 2 bilhões ou 4 bilhões de parâmetros oferecem excelente suporte multilíngue (140 idiomas) e compreensão multimodal, lidando facilmente com reconhecimento de fala, consultas por voz e análise de vídeo de 30 a 60 segundos. Embora o modelo ainda fique atrás de modelos maiores em capacidade absoluta de conhecimento e enfrente desafios reconhecidos pelo setor em áreas experimentais de ponta, como difusão de texto (Diffusion Transformer) e ajuste fino por mistura de especialistas (MoE), sua inteligência de alta densidade não é mais desprezível.
À medida que os recursos prontos para uso dos grandes modelos continuam a melhorar, o ecossistema de desenvolvimento de domínios verticais passa por uma profunda reestruturação, e a popularidade do ajuste fino tradicional puro está gradualmente diminuindo. Olhando para o futuro, o Google DeepMind fez uma previsão marcante: nos próximos um a dois anos, os smartphones dos usuários serão capazes de executar modelos poderosos, equivalentes ao desempenho do Gemini3Pro, diretamente no dispositivo. Nesse momento, a maioria das tarefas complexas de agentes inteligentes será concluída localmente, sem depender do poder de computação em nuvem, o que, sem dúvida, trará mudanças revolucionárias para a próxima geração de integração de aplicativos de consumo e para a experiência do usuário.
Artigo relacionado
O departamento de RH da Uber deve esgotar o orçamento anual em quatro meses e cortar pessoal; representante nega relação com IA
A Uber deu início a uma reformulação significativa de sua divisão de recursos humanos, liderada pela nova presidente Jill Hazelbaker. A reestruturação envolve uma redução de 23% do quadro de funcionár
Ex-executivos do TikTok lançam aplicativo baseado em IA para aperfeiçoar poses fotográficas
As empresas estão cada vez mais utilizando a geração de imagens por IA para ensinar técnicas fotográficas aos usuários. No ano passado, o Google lançou o Camera Coach nos dispositivos Pixel para auxil
Setor de inteligência artificial do mercado de ações de Hong Kong sobe, com ganhos expressivos da MiniMax e da Zhipu
Em 27 de maio, o setor de conceitos de grandes modelos no mercado de ações de Hong Kong demonstrou um impulso robusto. Até o meio-dia, a MINIMAX-W (00100.HK) subiu mais de 8%, enquanto a Zhipu (02513.HK) também registrou ganhos fortes de quase 5%.1.
Recomendações de tópicos especiais relacionados
Comentários (0)

O ecossistema de modelos de grande porte de código aberto alcançou um grande avanço em sua arquitetura subjacente. O Google DeepMind lançou recentemente seu modelo aberto mais poderoso até o momento, o Gemma4. Embora o número de parâmetros do modelo permaneça semelhante ao de seu antecessor, em torno de 30 bilhões, sua “inteligência por parâmetro” deu um salto significativo. Seu desempenho em várias tarefas essenciais agora rivaliza com o dos principais modelos de grande porte de código fechado de um ano e meio atrás.
A inovação tecnológica mais notável do Gemma4 é a introdução da nova arquitetura “E2B” (descarregamento de parâmetros). Nos projetos tradicionais do Transformer, a grande camada de embedding normalmente consome uma quantidade significativa de memória da GPU. A nova arquitetura adiciona de forma inteligente uma tabela de embedding em cada camada, substituindo a pesada multiplicação de matrizes completas por um mecanismo de tabela de consulta. Por exemplo, com um modelo de 50 bilhões de parâmetros na arquitetura E2B, apenas 20 bilhões de parâmetros precisam ser carregados na memória da GPU, enquanto os 30 bilhões restantes podem ser transferidos com segurança para a CPU ou até mesmo para o disco. Isso permite que o modelo realize inferências rápidas usando apenas 2 GB de memória da GPU, superando gargalos de implantação em dispositivos de borda, como celulares e Raspberry Pi.
Por se tratar de um lançamento altamente ambicioso e complexo, a equipe do Google DeepMind coordenou-se com quase 50 parceiros externos, incluindo Hugging Face, llama.cpp, Ollama, NVIDIA e AMD. Atualmente, o Gemma4 está profundamente integrado ao Android Studio. Os desenvolvedores podem invocar a IA com segurança para escrever código Android localmente em ambientes offline, sem enviar nenhum código para uma API na nuvem no modo Agent. Isso atende amplamente à forte demanda por privacidade de dados e trabalho offline no ambiente de trabalho.
Em termos de recursos multimodais e experiência central, o Gemma4 herda as conquistas de pesquisa do Gemini3. Mesmo pequenos modelos de borda com 2 bilhões ou 4 bilhões de parâmetros oferecem excelente suporte multilíngue (140 idiomas) e compreensão multimodal, lidando facilmente com reconhecimento de fala, consultas por voz e análise de vídeo de 30 a 60 segundos. Embora o modelo ainda fique atrás de modelos maiores em capacidade absoluta de conhecimento e enfrente desafios reconhecidos pelo setor em áreas experimentais de ponta, como difusão de texto (Diffusion Transformer) e ajuste fino por mistura de especialistas (MoE), sua inteligência de alta densidade não é mais desprezível.
À medida que os recursos prontos para uso dos grandes modelos continuam a melhorar, o ecossistema de desenvolvimento de domínios verticais passa por uma profunda reestruturação, e a popularidade do ajuste fino tradicional puro está gradualmente diminuindo. Olhando para o futuro, o Google DeepMind fez uma previsão marcante: nos próximos um a dois anos, os smartphones dos usuários serão capazes de executar modelos poderosos, equivalentes ao desempenho do Gemini3Pro, diretamente no dispositivo. Nesse momento, a maioria das tarefas complexas de agentes inteligentes será concluída localmente, sem depender do poder de computação em nuvem, o que, sem dúvida, trará mudanças revolucionárias para a próxima geração de integração de aplicativos de consumo e para a experiência do usuário.
O departamento de RH da Uber deve esgotar o orçamento anual em quatro meses e cortar pessoal; representante nega relação com IA
A Uber deu início a uma reformulação significativa de sua divisão de recursos humanos, liderada pela nova presidente Jill Hazelbaker. A reestruturação envolve uma redução de 23% do quadro de funcionár
Ex-executivos do TikTok lançam aplicativo baseado em IA para aperfeiçoar poses fotográficas
As empresas estão cada vez mais utilizando a geração de imagens por IA para ensinar técnicas fotográficas aos usuários. No ano passado, o Google lançou o Camera Coach nos dispositivos Pixel para auxil
Setor de inteligência artificial do mercado de ações de Hong Kong sobe, com ganhos expressivos da MiniMax e da Zhipu
Em 27 de maio, o setor de conceitos de grandes modelos no mercado de ações de Hong Kong demonstrou um impulso robusto. Até o meio-dia, a MINIMAX-W (00100.HK) subiu mais de 8%, enquanto a Zhipu (02513.HK) também registrou ganhos fortes de quase 5%.1.





Lar






