Lar
Google e NVIDIA tornam o DiffusionGemma de código aberto, acelerando a inferência com uma única placa em 4 vezes
Em 10 de junho de 2026, o Google lançou o DiffusionGemma, um modelo de linguagem experimental de código aberto que rompe com o paradigma autorregressivo tradicional de geração de texto, palavra por palavra. Ele é pioneiro no uso de mecanismos de difusão da IA de imagens na geração de texto, partindo de ruído aleatório e refinando-se iterativamente para produzir blocos de 256 tokens em paralelo a cada etapa.

Em termos de desempenho de hardware, as otimizações profundas da NVIDIA permitem que o modelo seja executado quase quatro vezes mais rápido do que modelos tradicionais comparáveis no modo de usuário único com uma única GPU. Em uma GPU H100, ele atinge velocidades de saída de até 1.000 tokens por segundo para uma única solicitação e, mesmo em GPUs de consumo de ponta, como a RTX 5090, pode ultrapassar 700 tokens por segundo.
O DiffusionGemma possui 26 bilhões de parâmetros e utiliza uma arquitetura de mistura de especialistas (MoE), ativando apenas 3,8 bilhões de parâmetros por etapa. Embora sua qualidade e precisão na geração de texto fiquem ligeiramente atrás dos modelos tradicionais da série Gemma4 em benchmarks padrão, sua exclusiva “consciência de bloco completo” supera a limitação de processamento apenas retroativo dos modelos autorregressivos. Como todos os tokens podem fazer referência uns aos outros durante a geração, ele se destaca em tarefas que envolvem dados não lineares e estruturados, como preenchimento de texto, preenchimento de código, resolução de Sudoku e processamento de sequências de aminoácidos.

Os pesos do modelo agora estão disponíveis em código aberto no Hugging Face sob a licença Apache 2.0 e funcionam perfeitamente com estruturas de inferência convencionais, como vLLM e MLX. Essa exploração não apenas elimina as restrições de largura de banda de memória no poder de computação da GPU, mas também abre um novo caminho técnico para futuras aplicações de IA em lógica complexa e geração de texto não linear.
Artigo relacionado
iFLYTEK Apresenta o Modelo Grande Geral Spark X2.5
Em 1º de setembro, a iFlytek lançará como código aberto dois modelos de linguagem de grande escala focados em dispositivos de borda, o Xinghuo X2.5-4B e o Xinghuo X2.5-1.7B, conforme o mais recente anúncio oficial. Ambos os modelos suportam nativamen
Meta Remove Funcionalidade de Edição de Fotos por IA Após Reação Negativa dos Usuários
A Meta, gigante das redes sociais, está novamente envolvida em um debate público sobre o delicado equilíbrio entre inteligência artificial e privacidade dos usuários. De acordo com a TechCrunch, o Superintelligence Labs da Meta apresentou um novo ger
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 10 de junho de 2026, o Google lançou o DiffusionGemma, um modelo de linguagem experimental de código aberto que rompe com o paradigma autorregressivo tradicional de geração de texto, palavra por palavra. Ele é pioneiro no uso de mecanismos de difusão da IA de imagens na geração de texto, partindo de ruído aleatório e refinando-se iterativamente para produzir blocos de 256 tokens em paralelo a cada etapa.

Em termos de desempenho de hardware, as otimizações profundas da NVIDIA permitem que o modelo seja executado quase quatro vezes mais rápido do que modelos tradicionais comparáveis no modo de usuário único com uma única GPU. Em uma GPU H100, ele atinge velocidades de saída de até 1.000 tokens por segundo para uma única solicitação e, mesmo em GPUs de consumo de ponta, como a RTX 5090, pode ultrapassar 700 tokens por segundo.
O DiffusionGemma possui 26 bilhões de parâmetros e utiliza uma arquitetura de mistura de especialistas (MoE), ativando apenas 3,8 bilhões de parâmetros por etapa. Embora sua qualidade e precisão na geração de texto fiquem ligeiramente atrás dos modelos tradicionais da série Gemma4 em benchmarks padrão, sua exclusiva “consciência de bloco completo” supera a limitação de processamento apenas retroativo dos modelos autorregressivos. Como todos os tokens podem fazer referência uns aos outros durante a geração, ele se destaca em tarefas que envolvem dados não lineares e estruturados, como preenchimento de texto, preenchimento de código, resolução de Sudoku e processamento de sequências de aminoácidos.

Os pesos do modelo agora estão disponíveis em código aberto no Hugging Face sob a licença Apache 2.0 e funcionam perfeitamente com estruturas de inferência convencionais, como vLLM e MLX. Essa exploração não apenas elimina as restrições de largura de banda de memória no poder de computação da GPU, mas também abre um novo caminho técnico para futuras aplicações de IA em lógica complexa e geração de texto não linear.
iFLYTEK Apresenta o Modelo Grande Geral Spark X2.5
Em 1º de setembro, a iFlytek lançará como código aberto dois modelos de linguagem de grande escala focados em dispositivos de borda, o Xinghuo X2.5-4B e o Xinghuo X2.5-1.7B, conforme o mais recente anúncio oficial. Ambos os modelos suportam nativamen
Meta Remove Funcionalidade de Edição de Fotos por IA Após Reação Negativa dos Usuários
A Meta, gigante das redes sociais, está novamente envolvida em um debate público sobre o delicado equilíbrio entre inteligência artificial e privacidade dos usuários. De acordo com a TechCrunch, o Superintelligence Labs da Meta apresentou um novo ger
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab











