Hogar
Ant Group publica el código fuente de LingBot-Vision, lo que dota a los robots de percepción espacial
En el ámbito de la inteligencia incorporada, permitir que los robots perciban el espacio físico con una precisión similar a la humana sigue siendo un reto fundamental. Robbyant, una filial de Ant Group especializada en IA incorporada, ha publicado oficialmente en código abierto la familia de modelos LingBot-Vision. Este conjunto de «Transformers» de visión auto-supervisados logra resultados excepcionales en la percepción espacial densa mediante una innovadora estrategia de «modelado de límites», superando a modelos más grandes en múltiples pruebas de rendimiento a pesar de tener menos parámetros.
La mayoría de los modelos visuales básicos actuales dan prioridad al «reconocimiento de objetos», centrándose en identificar lo que hay en una imagen, mientras que a menudo pasan por alto señales críticas de interacción física como los límites de los objetos, los contornos y la profundidad. LingBot-Vision invierte este enfoque al tratar los «límites» como señales principales de preentrenamiento. Al aprovechar el modelado de límites mediante máscaras, el modelo identifica las regiones con mayor densidad de información en una imagen y centra su entrenamiento en ellas. Este método permite al modelo adquirir comprensión semántica al tiempo que desarrolla una percepción espacial geométrica robusta.

En cuanto al rendimiento, el modelo insignia de LingBot-Vision, ViT-g/16, contiene solo 1.1 mil millones de parámetros y, sin embargo, alcanza resultados de vanguardia en tareas de estimación de profundidad, incluida NYU-Depth v2. Supera a DINOv3, que cuenta con 7.000 millones de parámetros, utilizando un conjunto de datos de entrenamiento de aproximadamente un tercio de su tamaño. Para escenarios de implementación con recursos limitados, la serie ofrece versiones destiladas que van desde los 3.000 millones de parámetros hasta tamaños más reducidos, lo que garantiza un rendimiento de predicción densa de primer nivel en diversas configuraciones de hardware.
Para demostrar el valor práctico de la tecnología, el equipo de desarrollo también ha actualizado el sistema de completado de profundidad a LingBot-Depth 2.0. Las pruebas indican mejoras significativas en la precisión al tratar objetos transparentes, un punto ciego tradicional de la percepción. A medida que aumenta el volumen de datos, el rendimiento de LingBot-Vision sigue escalando sin la saturación típica de los modelos tradicionales, lo que valida aún más el potencial de su arquitectura de percepción espacial centrada en los límites en entornos complejos del mundo real.
LingBot-Vision es ahora de código abierto en su totalidad en Hugging Face bajo la licencia Apache-2.0, incluyendo los pesos y el código de inferencia para cuatro tamaños de modelo, desde el más grande hasta el más pequeño. Esta tecnología permite a los desarrolladores dotar a los robots de capacidades de percepción física más sensibles con menores costes computacionales, allanando el camino hacia un futuro más preciso e interactivo en el ámbito de la inteligencia incorporada.
Artículo relacionado
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En el ámbito de la inteligencia incorporada, permitir que los robots perciban el espacio físico con una precisión similar a la humana sigue siendo un reto fundamental. Robbyant, una filial de Ant Group especializada en IA incorporada, ha publicado oficialmente en código abierto la familia de modelos LingBot-Vision. Este conjunto de «Transformers» de visión auto-supervisados logra resultados excepcionales en la percepción espacial densa mediante una innovadora estrategia de «modelado de límites», superando a modelos más grandes en múltiples pruebas de rendimiento a pesar de tener menos parámetros.
La mayoría de los modelos visuales básicos actuales dan prioridad al «reconocimiento de objetos», centrándose en identificar lo que hay en una imagen, mientras que a menudo pasan por alto señales críticas de interacción física como los límites de los objetos, los contornos y la profundidad. LingBot-Vision invierte este enfoque al tratar los «límites» como señales principales de preentrenamiento. Al aprovechar el modelado de límites mediante máscaras, el modelo identifica las regiones con mayor densidad de información en una imagen y centra su entrenamiento en ellas. Este método permite al modelo adquirir comprensión semántica al tiempo que desarrolla una percepción espacial geométrica robusta.

En cuanto al rendimiento, el modelo insignia de LingBot-Vision, ViT-g/16, contiene solo 1.1 mil millones de parámetros y, sin embargo, alcanza resultados de vanguardia en tareas de estimación de profundidad, incluida NYU-Depth v2. Supera a DINOv3, que cuenta con 7.000 millones de parámetros, utilizando un conjunto de datos de entrenamiento de aproximadamente un tercio de su tamaño. Para escenarios de implementación con recursos limitados, la serie ofrece versiones destiladas que van desde los 3.000 millones de parámetros hasta tamaños más reducidos, lo que garantiza un rendimiento de predicción densa de primer nivel en diversas configuraciones de hardware.
Para demostrar el valor práctico de la tecnología, el equipo de desarrollo también ha actualizado el sistema de completado de profundidad a LingBot-Depth 2.0. Las pruebas indican mejoras significativas en la precisión al tratar objetos transparentes, un punto ciego tradicional de la percepción. A medida que aumenta el volumen de datos, el rendimiento de LingBot-Vision sigue escalando sin la saturación típica de los modelos tradicionales, lo que valida aún más el potencial de su arquitectura de percepción espacial centrada en los límites en entornos complejos del mundo real.
LingBot-Vision es ahora de código abierto en su totalidad en Hugging Face bajo la licencia Apache-2.0, incluyendo los pesos y el código de inferencia para cuatro tamaños de modelo, desde el más grande hasta el más pequeño. Esta tecnología permite a los desarrolladores dotar a los robots de capacidades de percepción física más sensibles con menores costes computacionales, allanando el camino hacia un futuro más preciso e interactivo en el ámbito de la inteligencia incorporada.
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa











