Lar
O Ant Group torna o LingBot-Vision de código aberto, proporcionando aos robôs percepção espacial
No campo da inteligência incorporada, permitir que os robôs percebam o espaço físico com precisão semelhante à humana continua sendo um desafio fundamental. A Robbyant, subsidiária do Ant Group especializada em IA incorporada, tornou oficialmente de código aberto a família de modelos LingBot-Vision. Esse conjunto de Transformers de visão auto-supervisionados alcança resultados excepcionais na percepção espacial densa por meio de uma estratégia inovadora de “modelagem de limites”, superando modelos maiores em vários benchmarks, apesar de possuir menos parâmetros.
A maioria dos modelos visuais de base atuais prioriza o “reconhecimento de objetos”, concentrando-se em identificar o que está em uma imagem, enquanto muitas vezes ignora pistas críticas de interação física, como limites, contornos e profundidade dos objetos. O LingBot-Vision inverte essa abordagem ao tratar os “limites” como sinais primários de pré-treinamento. Ao utilizar a modelagem de limites por máscara, o modelo identifica as regiões mais densas em informações em uma imagem e concentra seu treinamento nelas. Esse método permite que o modelo adquira compreensão semântica e, ao mesmo tempo, desenvolva uma percepção espacial geométrica robusta.

Em relação ao desempenho, o modelo principal do LingBot-Vision, o ViT-g/16, contém apenas 1,1 bilhão de parâmetros, mas alcança resultados de ponta em tarefas de estimativa de profundidade, incluindo o NYU-Depth v2. Ele supera o DINOv3, que possui 7 bilhões de parâmetros, embora utilize um conjunto de dados de treinamento com cerca de um terço do tamanho. Para cenários de implantação com recursos limitados, a série oferece versões destiladas que variam de 3 bilhões de parâmetros até tamanhos menores, garantindo desempenho de ponta em previsão densa em diversas configurações de hardware.
Para demonstrar o valor prático da tecnologia, a equipe de desenvolvimento também atualizou o sistema de preenchimento de profundidade para o LingBot-Depth 2.0. Testes indicam melhorias significativas na precisão ao lidar com objetos transparentes, um tradicional ponto cego da percepção. À medida que o volume de dados aumenta, o desempenho do LingBot-Vision continua a escalar sem a saturação típica dos modelos tradicionais, validando ainda mais o potencial de sua arquitetura de percepção espacial centrada em limites em ambientes complexos do mundo real.
O LingBot-Vision agora está totalmente disponível como código aberto no Hugging Face sob a licença Apache-2.0, incluindo pesos e código de inferência para quatro tamanhos de modelo, do maior ao menor. Essa tecnologia permite que os desenvolvedores equipem robôs com capacidades de percepção física mais sensíveis a custos computacionais mais baixos, abrindo caminho para um futuro mais preciso e interativo na inteligência incorporada.
Artigo relacionado
Óculos Inteligentes da Apple Podem Estrear na WWDC27, Destacando a Proteção de Privacidade
O repórter da Bloomberg, Mark Gurman, informa que os óculos inteligentes da Apple, com o codinome N50, estão previstos para estrear na WWDC27 em junho de 2027, com um lançamento no varejo esperado para o outono de 2027. Originalmente direcionados par
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Recomendações de tópicos especiais relacionados
Comentários (0)
No campo da inteligência incorporada, permitir que os robôs percebam o espaço físico com precisão semelhante à humana continua sendo um desafio fundamental. A Robbyant, subsidiária do Ant Group especializada em IA incorporada, tornou oficialmente de código aberto a família de modelos LingBot-Vision. Esse conjunto de Transformers de visão auto-supervisionados alcança resultados excepcionais na percepção espacial densa por meio de uma estratégia inovadora de “modelagem de limites”, superando modelos maiores em vários benchmarks, apesar de possuir menos parâmetros.
A maioria dos modelos visuais de base atuais prioriza o “reconhecimento de objetos”, concentrando-se em identificar o que está em uma imagem, enquanto muitas vezes ignora pistas críticas de interação física, como limites, contornos e profundidade dos objetos. O LingBot-Vision inverte essa abordagem ao tratar os “limites” como sinais primários de pré-treinamento. Ao utilizar a modelagem de limites por máscara, o modelo identifica as regiões mais densas em informações em uma imagem e concentra seu treinamento nelas. Esse método permite que o modelo adquira compreensão semântica e, ao mesmo tempo, desenvolva uma percepção espacial geométrica robusta.

Em relação ao desempenho, o modelo principal do LingBot-Vision, o ViT-g/16, contém apenas 1,1 bilhão de parâmetros, mas alcança resultados de ponta em tarefas de estimativa de profundidade, incluindo o NYU-Depth v2. Ele supera o DINOv3, que possui 7 bilhões de parâmetros, embora utilize um conjunto de dados de treinamento com cerca de um terço do tamanho. Para cenários de implantação com recursos limitados, a série oferece versões destiladas que variam de 3 bilhões de parâmetros até tamanhos menores, garantindo desempenho de ponta em previsão densa em diversas configurações de hardware.
Para demonstrar o valor prático da tecnologia, a equipe de desenvolvimento também atualizou o sistema de preenchimento de profundidade para o LingBot-Depth 2.0. Testes indicam melhorias significativas na precisão ao lidar com objetos transparentes, um tradicional ponto cego da percepção. À medida que o volume de dados aumenta, o desempenho do LingBot-Vision continua a escalar sem a saturação típica dos modelos tradicionais, validando ainda mais o potencial de sua arquitetura de percepção espacial centrada em limites em ambientes complexos do mundo real.
O LingBot-Vision agora está totalmente disponível como código aberto no Hugging Face sob a licença Apache-2.0, incluindo pesos e código de inferência para quatro tamanhos de modelo, do maior ao menor. Essa tecnologia permite que os desenvolvedores equipem robôs com capacidades de percepção física mais sensíveis a custos computacionais mais baixos, abrindo caminho para um futuro mais preciso e interativo na inteligência incorporada.
Óculos Inteligentes da Apple Podem Estrear na WWDC27, Destacando a Proteção de Privacidade
O repórter da Bloomberg, Mark Gurman, informa que os óculos inteligentes da Apple, com o codinome N50, estão previstos para estrear na WWDC27 em junho de 2027, com um lançamento no varejo esperado para o outono de 2027. Originalmente direcionados par
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu











