Lar
TIPSv2 do Google DeepMind: uma IA que realmente compreende imagens, e não apenas as analisa superficialmente
Atualmente, a compreensão de imagens por IA apresenta uma limitação fundamental.
Quando questionada com “O que há nesta imagem?”, ela pode fornecer uma resposta detalhada. No entanto, perguntar “Onde está a pata traseira esquerda do panda?” leva a respostas vagas. Isso não é uma falha em nenhum modelo específico, mas uma questão persistente em todo o domínio dos grandes modelos de linguagem visual: forte compreensão global, mas fraca localização local.
O Google DeepMind apresentou o TIPSv2 em seu artigo mais recente, projetado especificamente para lidar com esse problema desafiador.

A equipe de pesquisa observou uma descoberta contraintuitiva: em tarefas de segmentação refinada, modelos alunos menores frequentemente superam os modelos professores maiores. Isso ocorre porque a destilação remove o mecanismo de mascaramento, obrigando o modelo a aprender cada detalhe da imagem inteira, criando uma forma de “supervisão de área total”. Motivado por essa percepção, o TIPSv2 introduziu três melhorias principais.
Primeiro, o iBOT++. O pré-treinamento tradicional calcula a perda apenas para regiões mascaradas, deixando as áreas visíveis em um estado negligenciado que causa o desvio da semântica local. O iBOT++ exige que o modelo forneça supervisão precisa sobre todas as áreas visíveis, efetivamente elevando a tarefa de um “jogo de quebra-cabeça” para “ler cuidadosamente o texto inteiro”. Essa única melhoria impulsionou o desempenho da segmentação zero-shot em 14,1 pontos percentuais.
Segundo, EMA apenas para a cabeça. O treinamento auto-supervisionado tradicional exige manter dois modelos grandes quase idênticos na memória, o que consome muitos recursos. O TIPSv2 descobriu que a perda contrastiva imagem-texto por si só é suficiente para estabilizar a rede backbone, de modo que o EMA precisa ser aplicado apenas à cabeça de projeção final, eliminando a necessidade de duplicar a backbone. Isso reduz a contagem de parâmetros de treinamento em cerca de 42%, tornando-o mais rápido quase sem perda de desempenho.
Terceiro, emparelhamento de texto com granularidade múltipla. Durante o treinamento, descrições curtas da web, descrições de detalhe médio e descrições longas geradas pelo Gemini são misturadas aleatoriamente e alimentadas no modelo, alternando entre tarefas fáceis e difíceis. Isso impede que o modelo se acomode em tarefas simples, ao mesmo tempo em que garante que nenhum detalhe seja negligenciado.
Os resultados finais são impressionantes. O TIPSv2 passou por uma avaliação congelada em nove tarefas e 20 conjuntos de dados de referência. A segmentação semântica zero-shot alcançou um novo benchmark do setor, enquanto a recuperação e classificação de imagem-texto superaram os modelos de comparação com 56% mais parâmetros. Tarefas puramente visuais também se destacaram entre as de melhor desempenho.
O código e os pesos do modelo do TIPSv2 são totalmente de código aberto. Para equipes que trabalham com imagens médicas, direção autônoma, inspeção industrial e outros domínios que exigem compreensão de imagens de alta precisão, vale a pena dar uma olhada mais de perto nessa solução.
Artigo: https://www.alphaxiv.org/abs/2604.12012
Artigo relacionado
Óculos Inteligentes da Apple Podem Estrear na WWDC27, Destacando a Proteção de Privacidade
O repórter da Bloomberg, Mark Gurman, informa que os óculos inteligentes da Apple, com o codinome N50, estão previstos para estrear na WWDC27 em junho de 2027, com um lançamento no varejo esperado para o outono de 2027. Originalmente direcionados par
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Recomendações de tópicos especiais relacionados
Comentários (0)
Atualmente, a compreensão de imagens por IA apresenta uma limitação fundamental.
Quando questionada com “O que há nesta imagem?”, ela pode fornecer uma resposta detalhada. No entanto, perguntar “Onde está a pata traseira esquerda do panda?” leva a respostas vagas. Isso não é uma falha em nenhum modelo específico, mas uma questão persistente em todo o domínio dos grandes modelos de linguagem visual: forte compreensão global, mas fraca localização local.
O Google DeepMind apresentou o TIPSv2 em seu artigo mais recente, projetado especificamente para lidar com esse problema desafiador.

A equipe de pesquisa observou uma descoberta contraintuitiva: em tarefas de segmentação refinada, modelos alunos menores frequentemente superam os modelos professores maiores. Isso ocorre porque a destilação remove o mecanismo de mascaramento, obrigando o modelo a aprender cada detalhe da imagem inteira, criando uma forma de “supervisão de área total”. Motivado por essa percepção, o TIPSv2 introduziu três melhorias principais.
Primeiro, o iBOT++. O pré-treinamento tradicional calcula a perda apenas para regiões mascaradas, deixando as áreas visíveis em um estado negligenciado que causa o desvio da semântica local. O iBOT++ exige que o modelo forneça supervisão precisa sobre todas as áreas visíveis, efetivamente elevando a tarefa de um “jogo de quebra-cabeça” para “ler cuidadosamente o texto inteiro”. Essa única melhoria impulsionou o desempenho da segmentação zero-shot em 14,1 pontos percentuais.
Segundo, EMA apenas para a cabeça. O treinamento auto-supervisionado tradicional exige manter dois modelos grandes quase idênticos na memória, o que consome muitos recursos. O TIPSv2 descobriu que a perda contrastiva imagem-texto por si só é suficiente para estabilizar a rede backbone, de modo que o EMA precisa ser aplicado apenas à cabeça de projeção final, eliminando a necessidade de duplicar a backbone. Isso reduz a contagem de parâmetros de treinamento em cerca de 42%, tornando-o mais rápido quase sem perda de desempenho.
Terceiro, emparelhamento de texto com granularidade múltipla. Durante o treinamento, descrições curtas da web, descrições de detalhe médio e descrições longas geradas pelo Gemini são misturadas aleatoriamente e alimentadas no modelo, alternando entre tarefas fáceis e difíceis. Isso impede que o modelo se acomode em tarefas simples, ao mesmo tempo em que garante que nenhum detalhe seja negligenciado.
Os resultados finais são impressionantes. O TIPSv2 passou por uma avaliação congelada em nove tarefas e 20 conjuntos de dados de referência. A segmentação semântica zero-shot alcançou um novo benchmark do setor, enquanto a recuperação e classificação de imagem-texto superaram os modelos de comparação com 56% mais parâmetros. Tarefas puramente visuais também se destacaram entre as de melhor desempenho.
O código e os pesos do modelo do TIPSv2 são totalmente de código aberto. Para equipes que trabalham com imagens médicas, direção autônoma, inspeção industrial e outros domínios que exigem compreensão de imagens de alta precisão, vale a pena dar uma olhada mais de perto nessa solução.
Artigo: https://www.alphaxiv.org/abs/2604.12012
Óculos Inteligentes da Apple Podem Estrear na WWDC27, Destacando a Proteção de Privacidade
O repórter da Bloomberg, Mark Gurman, informa que os óculos inteligentes da Apple, com o codinome N50, estão previstos para estrear na WWDC27 em junho de 2027, com um lançamento no varejo esperado para o outono de 2027. Originalmente direcionados par
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu











