Hogar
Ant Group lanza el modelo de percepción espacial LingBot-Depth 2.0, lo que supone un avance en la visión robótica.
El 7 de julio, Lingbo Technology, una empresa de inteligencia incorporada perteneciente a Ant Group, lanzó el modelo de percepción espacial LingBot-Depth 2.0. Entrenado con un conjunto de datos de 150 millones de muestras, ofrece mejoras generales en la nitidez de los contornos, el reconocimiento de objetos pequeños, la estimación de profundidad a larga distancia y la robustez en escenarios complejos.
LingBot-Depth es un modelo de percepción espacial desarrollado de forma independiente por Lingbo, que actúa como los ojos de los robots en el mundo físico. La primera versión abordaba los retos de la percepción espacial en escenarios difíciles, como superficies transparentes y reflectantes. En comparación con la versión 1.0, los datos de entrenamiento de LingBot-Depth 2.0 se han ampliado de 3 millones a 150 millones de muestras, lo que ha supuesto una mejora general del rendimiento: ha conseguido 12 primeros puestos de un total de 16 criterios de evaluación en las pruebas de referencia de completado de profundidad. En el escenario interior más complejo, con grandes lagunas de profundidad, el error de profundidad se redujo a la mitad en comparación con la generación anterior (el RMSE descendió de 0,132 a 0,062). Ofrece un rendimiento especialmente bueno en situaciones en las que las cámaras de profundidad tradicionales suelen fallar, como en el caso del cristal, los espejos y los objetos transparentes.
Al mismo tiempo, LingBot-Depth 2.0 presentó su modelo visual básico, LingBot-Vision, creando una cadena de capacidades que va desde la «comprensión» hasta la «percepción precisa». El objetivo es abordar los retos fundamentales de la visión robótica, entre los que se incluyen la percepción espacial, el reconocimiento preciso y la adaptación a entornos complejos.

(Figura 1: LingBot-Depth 2.0 reconstruye una estructura 3D completa y plana en escenarios difíciles, como espejos y cristales)
El avance de LingBot-Depth 2.0 se basa en las excepcionales capacidades de representación visual de LingBot-Vision. Como modelo visual de uso general, LingBot-Vision es el primer modelo visual básico del sector que utiliza la «estructura de límites» como objetivo de preentrenamiento, lo que supone un avance en el paradigma de entrenamiento de la percepción espacial. Ofrece un posicionamiento de límites a nivel subpíxel y una comprensión de la estructura espacial, lo que proporciona una mayor precisión y una percepción espacial más estable.
El corpus de preentrenamiento de LingBot-Vision consta de tan solo 160 millones de imágenes, un orden de magnitud menor que el de DINOv3, y, sin embargo, su precisión en la estimación de profundidad supera a la de DINOv3. Además, la identificación de los límites de los objetos por parte de LingBot-Vision es lo suficientemente estable como para permitir el seguimiento continuo de los límites en vídeos. Esta versión incluye cuatro variantes: ViT-G, ViT-L, ViT-B y ViT-S.
Según la información disponible, LingBot-Vision no solo sirve para el entrenamiento de LingBot-Depth 2.0, sino que también puede utilizarse de muchas otras formas.

(Figura 2: LingBot-Depth 2.0 obtiene buenos resultados en pruebas de completado de profundidad con sensores reales)

(Figura 3: En comparación con los principales modelos visuales básicos, LingBot-Vision identifica los límites de los objetos y las estructuras espaciales de forma más clara y estable)
Actualmente, LingBot-Depth 2.0 ha superado la certificación profesional del Orbbec Depth Vision Lab. Las pruebas en escenarios prácticos demuestran que, basándose en los datos 3D sin procesar a nivel de chip proporcionados por la cámara 3D estéreo de la serie Gemini330 de Orbbec, LingBot-Depth 2.0 mejora significativamente la nitidez de los bordes, la integridad de los contornos de los objetos, el reconocimiento de objetos delicados, la estimación de profundidad a larga distancia y la robustez en escenarios con iluminación y materiales complejos.

(Figura 4: LingBot Depth 2.0 ha superado la evaluación profesional del Orbbec Depth Vision Lab, demostrando una precisión y estabilidad extremadamente altas en tareas de estimación de profundidad espacial y temporal con múltiples tipos de sensores)
En cuanto a la comercialización, Ant Lingbo ha establecido una estrecha colaboración con Orbbec en numerosos ámbitos. Según la información disponible, la última versión RGB-D del dispositivo EGO, incluida en la nueva gama de productos de adquisición de datos sin cuerpo de Orbbec, se adaptará a la versión LingBot-Depth optimizada por Lingbo para escenarios de adquisición de datos. En el futuro, se integrarán aún más versiones comerciales de mayor nivel, se seguirán subsanando las lagunas de profundidad, se optimizarán los bordes de los objetos y los detalles de la estructura espacial, y se proporcionarán bases de datos del mundo real más precisas, estables y útiles para el entrenamiento de modelos de inteligencia incorporada.
Además, Orbbec lanzará un producto SDK que integrará las últimas capacidades del modelo LingBot-Depth, disponible para su uso por parte de los clientes de robótica en el borde de la red, lo que permitirá a los robots que utilicen la cámara de la serie Gemini330 lograr mejores efectos de profundidad. También tienen previsto lanzar un producto de cámara integrada con la versión comercial de LingBot-Depth a finales de año, haciendo realidad la integración de «cámara 3D + capacidades de percepción espacial». Con el lanzamiento de estos dos modelos, se espera que su colaboración se amplíe a más campos.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 7 de julio, Lingbo Technology, una empresa de inteligencia incorporada perteneciente a Ant Group, lanzó el modelo de percepción espacial LingBot-Depth 2.0. Entrenado con un conjunto de datos de 150 millones de muestras, ofrece mejoras generales en la nitidez de los contornos, el reconocimiento de objetos pequeños, la estimación de profundidad a larga distancia y la robustez en escenarios complejos.
LingBot-Depth es un modelo de percepción espacial desarrollado de forma independiente por Lingbo, que actúa como los ojos de los robots en el mundo físico. La primera versión abordaba los retos de la percepción espacial en escenarios difíciles, como superficies transparentes y reflectantes. En comparación con la versión 1.0, los datos de entrenamiento de LingBot-Depth 2.0 se han ampliado de 3 millones a 150 millones de muestras, lo que ha supuesto una mejora general del rendimiento: ha conseguido 12 primeros puestos de un total de 16 criterios de evaluación en las pruebas de referencia de completado de profundidad. En el escenario interior más complejo, con grandes lagunas de profundidad, el error de profundidad se redujo a la mitad en comparación con la generación anterior (el RMSE descendió de 0,132 a 0,062). Ofrece un rendimiento especialmente bueno en situaciones en las que las cámaras de profundidad tradicionales suelen fallar, como en el caso del cristal, los espejos y los objetos transparentes.
Al mismo tiempo, LingBot-Depth 2.0 presentó su modelo visual básico, LingBot-Vision, creando una cadena de capacidades que va desde la «comprensión» hasta la «percepción precisa». El objetivo es abordar los retos fundamentales de la visión robótica, entre los que se incluyen la percepción espacial, el reconocimiento preciso y la adaptación a entornos complejos.

(Figura 1: LingBot-Depth 2.0 reconstruye una estructura 3D completa y plana en escenarios difíciles, como espejos y cristales)
El avance de LingBot-Depth 2.0 se basa en las excepcionales capacidades de representación visual de LingBot-Vision. Como modelo visual de uso general, LingBot-Vision es el primer modelo visual básico del sector que utiliza la «estructura de límites» como objetivo de preentrenamiento, lo que supone un avance en el paradigma de entrenamiento de la percepción espacial. Ofrece un posicionamiento de límites a nivel subpíxel y una comprensión de la estructura espacial, lo que proporciona una mayor precisión y una percepción espacial más estable.
El corpus de preentrenamiento de LingBot-Vision consta de tan solo 160 millones de imágenes, un orden de magnitud menor que el de DINOv3, y, sin embargo, su precisión en la estimación de profundidad supera a la de DINOv3. Además, la identificación de los límites de los objetos por parte de LingBot-Vision es lo suficientemente estable como para permitir el seguimiento continuo de los límites en vídeos. Esta versión incluye cuatro variantes: ViT-G, ViT-L, ViT-B y ViT-S.
Según la información disponible, LingBot-Vision no solo sirve para el entrenamiento de LingBot-Depth 2.0, sino que también puede utilizarse de muchas otras formas.

(Figura 2: LingBot-Depth 2.0 obtiene buenos resultados en pruebas de completado de profundidad con sensores reales)

(Figura 3: En comparación con los principales modelos visuales básicos, LingBot-Vision identifica los límites de los objetos y las estructuras espaciales de forma más clara y estable)
Actualmente, LingBot-Depth 2.0 ha superado la certificación profesional del Orbbec Depth Vision Lab. Las pruebas en escenarios prácticos demuestran que, basándose en los datos 3D sin procesar a nivel de chip proporcionados por la cámara 3D estéreo de la serie Gemini330 de Orbbec, LingBot-Depth 2.0 mejora significativamente la nitidez de los bordes, la integridad de los contornos de los objetos, el reconocimiento de objetos delicados, la estimación de profundidad a larga distancia y la robustez en escenarios con iluminación y materiales complejos.

(Figura 4: LingBot Depth 2.0 ha superado la evaluación profesional del Orbbec Depth Vision Lab, demostrando una precisión y estabilidad extremadamente altas en tareas de estimación de profundidad espacial y temporal con múltiples tipos de sensores)
En cuanto a la comercialización, Ant Lingbo ha establecido una estrecha colaboración con Orbbec en numerosos ámbitos. Según la información disponible, la última versión RGB-D del dispositivo EGO, incluida en la nueva gama de productos de adquisición de datos sin cuerpo de Orbbec, se adaptará a la versión LingBot-Depth optimizada por Lingbo para escenarios de adquisición de datos. En el futuro, se integrarán aún más versiones comerciales de mayor nivel, se seguirán subsanando las lagunas de profundidad, se optimizarán los bordes de los objetos y los detalles de la estructura espacial, y se proporcionarán bases de datos del mundo real más precisas, estables y útiles para el entrenamiento de modelos de inteligencia incorporada.
Además, Orbbec lanzará un producto SDK que integrará las últimas capacidades del modelo LingBot-Depth, disponible para su uso por parte de los clientes de robótica en el borde de la red, lo que permitirá a los robots que utilicen la cámara de la serie Gemini330 lograr mejores efectos de profundidad. También tienen previsto lanzar un producto de cámara integrada con la versión comercial de LingBot-Depth a finales de año, haciendo realidad la integración de «cámara 3D + capacidades de percepción espacial». Con el lanzamiento de estos dos modelos, se espera que su colaboración se amplíe a más campos.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











