Lar
O Ant Group lança o modelo de percepção espacial LingBot-Depth 2.0, promovendo avanços na visão robótica.
Em 7 de julho, a Lingbo Technology, uma empresa de inteligência incorporada do Ant Group, lançou o modelo de percepção espacial LingBot-Depth 2.0. Treinado com um conjunto de dados de 150 milhões de amostras, ele oferece melhorias abrangentes na nitidez das bordas, no reconhecimento de objetos finos, na estimativa de profundidade de longo alcance e na robustez em cenários complexos.
O LingBot-Depth é um modelo de percepção espacial desenvolvido de forma independente pela Lingbo, que funciona como os olhos dos robôs no mundo físico. A primeira versão abordou os desafios de percepção espacial em cenários difíceis, como superfícies transparentes e reflexivas. Em comparação com a versão 1.0, os dados de treinamento do LingBot-Depth 2.0 passaram de 3 milhões para 150 milhões de amostras, com ganhos gerais de desempenho: ele alcançou 12 primeiros lugares em 16 itens de avaliação em benchmarks de preenchimento de profundidade. No cenário interno mais desafiador, com grandes lacunas de profundidade, o erro de profundidade foi reduzido pela metade em comparação com a geração anterior (o RMSE caiu de 0,132 para 0,062). Ele tem um desempenho particularmente bom em situações em que as câmeras de profundidade tradicionais costumam falhar, como vidros, espelhos e objetos transparentes.
Ao mesmo tempo, o LingBot-Depth 2.0 introduziu seu modelo de base visual, o LingBot-Vision, construindo uma cadeia de capacidades que vai da “compreensão” à “percepção precisa”. O objetivo é abordar os principais desafios da visão robótica, incluindo percepção espacial, reconhecimento preciso e adaptação a ambientes complexos.

(Figura 1: O LingBot-Depth 2.0 reconstrói uma estrutura 3D completa e plana em cenários difíceis, como espelhos e vidros)
O avanço do LingBot-Depth 2.0 baseia-se nas excelentes capacidades de representação visual do LingBot-Vision. Como modelo visual de uso geral, o LingBot-Vision é o primeiro modelo visual de base do setor a utilizar a “estrutura de limites” como objetivo de pré-treinamento, alcançando um avanço no paradigma de treinamento da percepção espacial. Ele oferece posicionamento de limites em nível subpixel e compreensão da estrutura espacial, proporcionando maior precisão e uma percepção espacial mais estável.
O corpus de pré-treinamento do LingBot-Vision consiste em apenas 160 milhões de imagens, uma ordem de magnitude menor que o DINOv3, mas sua precisão na estimativa de profundidade supera a do DINOv3. Além disso, a avaliação dos limites dos objetos pelo LingBot-Vision é suficientemente estável para permitir o rastreamento contínuo de limites em vídeos. Esta versão inclui quatro versões: ViT-G, ViT-L, ViT-B e ViT-S.
De acordo com as informações disponíveis, o LingBot-Vision não apenas suporta o treinamento do LingBot-Depth 2.0, mas também pode ser utilizado de diversas outras maneiras.

(Figura 2: O LingBot-Depth 2.0 apresenta bom desempenho em testes reais de preenchimento de profundidade com sensores)

(Figura 3: Em comparação com os principais modelos de base visual, o LingBot-Vision identifica os limites dos objetos e as estruturas espaciais de forma mais clara e estável)
Atualmente, o LingBot-Depth 2.0 foi aprovado na certificação profissional do Orbbec Depth Vision Lab. Testes em cenários práticos mostram que, com base nos dados brutos 3D no nível do chip fornecidos pela câmera 3D estéreo da série Gemini330 da Orbbec, o LingBot-Depth 2.0 melhora significativamente a nitidez das bordas, a integridade dos contornos dos objetos, o reconhecimento de objetos finos, a estimativa de profundidade de longo alcance e a robustez em cenários complexos de iluminação e materiais.

(Figura 4: O LingBot Depth 2.0 foi aprovado na avaliação profissional do Orbbec Depth Vision Lab, demonstrando precisão e estabilidade extremamente altas em tarefas de estimativa de profundidade espacial e temporal em vários tipos de sensores)
Em termos de comercialização, a Ant Lingbo tem mantido uma cooperação profunda com a Orbbec em diversas áreas. De acordo com as informações, a versão RGB-D mais recente do dispositivo EGO, parte da nova matriz de produtos de aquisição de dados “no-body” da Orbbec, será adaptada à versão do LingBot-Depth otimizada pela Lingbo para cenários de aquisição de dados. No futuro, haverá uma integração ainda maior com versões comerciais de nível superior, preenchendo continuamente lacunas de profundidade, otimizando bordas de objetos e detalhes da estrutura espacial, e fornecendo bases de dados do mundo real mais precisas, estáveis e utilizáveis para o treinamento de modelos de inteligência incorporada.
Além disso, a Orbbec lançará um produto SDK que integra os recursos mais recentes do modelo LingBot-Depth, disponível para uso por clientes de robótica na borda, permitindo que robôs que utilizam a câmera da série Gemini330 alcancem melhores efeitos de profundidade. Eles também planejam lançar um produto de câmera integrada com a versão comercial do LingBot-Depth até o final do ano, concretizando a integração de “câmera 3D + recursos de percepção espacial”. Com o lançamento dos dois modelos, espera-se que a colaboração entre as duas empresas se expanda para mais áreas.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 7 de julho, a Lingbo Technology, uma empresa de inteligência incorporada do Ant Group, lançou o modelo de percepção espacial LingBot-Depth 2.0. Treinado com um conjunto de dados de 150 milhões de amostras, ele oferece melhorias abrangentes na nitidez das bordas, no reconhecimento de objetos finos, na estimativa de profundidade de longo alcance e na robustez em cenários complexos.
O LingBot-Depth é um modelo de percepção espacial desenvolvido de forma independente pela Lingbo, que funciona como os olhos dos robôs no mundo físico. A primeira versão abordou os desafios de percepção espacial em cenários difíceis, como superfícies transparentes e reflexivas. Em comparação com a versão 1.0, os dados de treinamento do LingBot-Depth 2.0 passaram de 3 milhões para 150 milhões de amostras, com ganhos gerais de desempenho: ele alcançou 12 primeiros lugares em 16 itens de avaliação em benchmarks de preenchimento de profundidade. No cenário interno mais desafiador, com grandes lacunas de profundidade, o erro de profundidade foi reduzido pela metade em comparação com a geração anterior (o RMSE caiu de 0,132 para 0,062). Ele tem um desempenho particularmente bom em situações em que as câmeras de profundidade tradicionais costumam falhar, como vidros, espelhos e objetos transparentes.
Ao mesmo tempo, o LingBot-Depth 2.0 introduziu seu modelo de base visual, o LingBot-Vision, construindo uma cadeia de capacidades que vai da “compreensão” à “percepção precisa”. O objetivo é abordar os principais desafios da visão robótica, incluindo percepção espacial, reconhecimento preciso e adaptação a ambientes complexos.

(Figura 1: O LingBot-Depth 2.0 reconstrói uma estrutura 3D completa e plana em cenários difíceis, como espelhos e vidros)
O avanço do LingBot-Depth 2.0 baseia-se nas excelentes capacidades de representação visual do LingBot-Vision. Como modelo visual de uso geral, o LingBot-Vision é o primeiro modelo visual de base do setor a utilizar a “estrutura de limites” como objetivo de pré-treinamento, alcançando um avanço no paradigma de treinamento da percepção espacial. Ele oferece posicionamento de limites em nível subpixel e compreensão da estrutura espacial, proporcionando maior precisão e uma percepção espacial mais estável.
O corpus de pré-treinamento do LingBot-Vision consiste em apenas 160 milhões de imagens, uma ordem de magnitude menor que o DINOv3, mas sua precisão na estimativa de profundidade supera a do DINOv3. Além disso, a avaliação dos limites dos objetos pelo LingBot-Vision é suficientemente estável para permitir o rastreamento contínuo de limites em vídeos. Esta versão inclui quatro versões: ViT-G, ViT-L, ViT-B e ViT-S.
De acordo com as informações disponíveis, o LingBot-Vision não apenas suporta o treinamento do LingBot-Depth 2.0, mas também pode ser utilizado de diversas outras maneiras.

(Figura 2: O LingBot-Depth 2.0 apresenta bom desempenho em testes reais de preenchimento de profundidade com sensores)

(Figura 3: Em comparação com os principais modelos de base visual, o LingBot-Vision identifica os limites dos objetos e as estruturas espaciais de forma mais clara e estável)
Atualmente, o LingBot-Depth 2.0 foi aprovado na certificação profissional do Orbbec Depth Vision Lab. Testes em cenários práticos mostram que, com base nos dados brutos 3D no nível do chip fornecidos pela câmera 3D estéreo da série Gemini330 da Orbbec, o LingBot-Depth 2.0 melhora significativamente a nitidez das bordas, a integridade dos contornos dos objetos, o reconhecimento de objetos finos, a estimativa de profundidade de longo alcance e a robustez em cenários complexos de iluminação e materiais.

(Figura 4: O LingBot Depth 2.0 foi aprovado na avaliação profissional do Orbbec Depth Vision Lab, demonstrando precisão e estabilidade extremamente altas em tarefas de estimativa de profundidade espacial e temporal em vários tipos de sensores)
Em termos de comercialização, a Ant Lingbo tem mantido uma cooperação profunda com a Orbbec em diversas áreas. De acordo com as informações, a versão RGB-D mais recente do dispositivo EGO, parte da nova matriz de produtos de aquisição de dados “no-body” da Orbbec, será adaptada à versão do LingBot-Depth otimizada pela Lingbo para cenários de aquisição de dados. No futuro, haverá uma integração ainda maior com versões comerciais de nível superior, preenchendo continuamente lacunas de profundidade, otimizando bordas de objetos e detalhes da estrutura espacial, e fornecendo bases de dados do mundo real mais precisas, estáveis e utilizáveis para o treinamento de modelos de inteligência incorporada.
Além disso, a Orbbec lançará um produto SDK que integra os recursos mais recentes do modelo LingBot-Depth, disponível para uso por clientes de robótica na borda, permitindo que robôs que utilizam a câmera da série Gemini330 alcancem melhores efeitos de profundidade. Eles também planejam lançar um produto de câmera integrada com a versão comercial do LingBot-Depth até o final do ano, concretizando a integração de “câmera 3D + recursos de percepção espacial”. Com o lançamento dos dois modelos, espera-se que a colaboração entre as duas empresas se expanda para mais áreas.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











