Maison
Ant Group met LingBot-Vision en open source, dotant ainsi les robots d'une perception spatiale
Dans le domaine de l'intelligence incarnée, permettre aux robots de percevoir l'espace physique avec une précision comparable à celle des humains reste un défi fondamental. Robbyant, une filiale d’Ant Group spécialisée dans l’IA incarnée, a officiellement mis en open source la famille de modèles LingBot-Vision. Cette suite de Transformers de vision auto-supervisés obtient des résultats exceptionnels en matière de perception spatiale dense grâce à une stratégie innovante de « modélisation des limites », surpassant des modèles plus volumineux sur plusieurs benchmarks malgré un nombre de paramètres inférieur.
La plupart des modèles de base visuels actuels donnent la priorité à la « reconnaissance d’objets », en se concentrant sur l’identification de ce qui se trouve dans une image tout en négligeant souvent des indices d’interaction physique essentiels tels que les limites, les contours et la profondeur des objets. LingBot-Vision renverse cette approche en traitant les « limites » comme des signaux de pré-entraînement primaires. En s'appuyant sur la modélisation des limites par masquage, le modèle identifie les zones les plus riches en informations d'une image et centre son apprentissage sur celles-ci. Cette méthode permet au modèle d'acquérir une compréhension sémantique tout en développant simultanément une perception spatiale géométrique robuste.

En termes de performances, le modèle phare de LingBot-Vision, ViT-g/16, ne contient que 1,1 milliard de paramètres, mais atteint des résultats de pointe dans les tâches d’estimation de profondeur, notamment sur NYU-Depth v2. Il surpasse DINOv3, qui compte 7 milliards de paramètres, tout en utilisant un ensemble de données d’entraînement représentant environ un tiers de sa taille. Pour les scénarios de déploiement aux ressources limitées, la série propose des versions allégées allant de 3 milliards de paramètres à des tailles encore plus réduites, garantissant des performances de prédiction denses de premier ordre sur diverses configurations matérielles.
Afin de mettre en avant la valeur pratique de cette technologie, l’équipe de développement a également mis à niveau le système de complétion de profondeur vers LingBot-Depth 2.0. Les tests indiquent des améliorations significatives en termes de précision lors du traitement d’objets transparents, un angle mort traditionnel de la perception. À mesure que le volume de données augmente, les performances de LingBot-Vision continuent de s’améliorer sans la saturation typique des modèles traditionnels, ce qui confirme encore davantage le potentiel de son architecture de perception spatiale centrée sur les limites dans des environnements réels complexes.
LingBot-Vision est désormais entièrement open source sur Hugging Face sous licence Apache 2.0, y compris les poids et le code d’inférence pour quatre tailles de modèles, du plus grand au plus petit. Cette technologie permet aux développeurs de doter les robots de capacités de perception physique plus sensibles à moindre coût de calcul, ouvrant la voie à un avenir plus précis et interactif dans le domaine de l’intelligence incarnée.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)
Dans le domaine de l'intelligence incarnée, permettre aux robots de percevoir l'espace physique avec une précision comparable à celle des humains reste un défi fondamental. Robbyant, une filiale d’Ant Group spécialisée dans l’IA incarnée, a officiellement mis en open source la famille de modèles LingBot-Vision. Cette suite de Transformers de vision auto-supervisés obtient des résultats exceptionnels en matière de perception spatiale dense grâce à une stratégie innovante de « modélisation des limites », surpassant des modèles plus volumineux sur plusieurs benchmarks malgré un nombre de paramètres inférieur.
La plupart des modèles de base visuels actuels donnent la priorité à la « reconnaissance d’objets », en se concentrant sur l’identification de ce qui se trouve dans une image tout en négligeant souvent des indices d’interaction physique essentiels tels que les limites, les contours et la profondeur des objets. LingBot-Vision renverse cette approche en traitant les « limites » comme des signaux de pré-entraînement primaires. En s'appuyant sur la modélisation des limites par masquage, le modèle identifie les zones les plus riches en informations d'une image et centre son apprentissage sur celles-ci. Cette méthode permet au modèle d'acquérir une compréhension sémantique tout en développant simultanément une perception spatiale géométrique robuste.

En termes de performances, le modèle phare de LingBot-Vision, ViT-g/16, ne contient que 1,1 milliard de paramètres, mais atteint des résultats de pointe dans les tâches d’estimation de profondeur, notamment sur NYU-Depth v2. Il surpasse DINOv3, qui compte 7 milliards de paramètres, tout en utilisant un ensemble de données d’entraînement représentant environ un tiers de sa taille. Pour les scénarios de déploiement aux ressources limitées, la série propose des versions allégées allant de 3 milliards de paramètres à des tailles encore plus réduites, garantissant des performances de prédiction denses de premier ordre sur diverses configurations matérielles.
Afin de mettre en avant la valeur pratique de cette technologie, l’équipe de développement a également mis à niveau le système de complétion de profondeur vers LingBot-Depth 2.0. Les tests indiquent des améliorations significatives en termes de précision lors du traitement d’objets transparents, un angle mort traditionnel de la perception. À mesure que le volume de données augmente, les performances de LingBot-Vision continuent de s’améliorer sans la saturation typique des modèles traditionnels, ce qui confirme encore davantage le potentiel de son architecture de perception spatiale centrée sur les limites dans des environnements réels complexes.
LingBot-Vision est désormais entièrement open source sur Hugging Face sous licence Apache 2.0, y compris les poids et le code d’inférence pour quatre tailles de modèles, du plus grand au plus petit. Cette technologie permet aux développeurs de doter les robots de capacités de perception physique plus sensibles à moindre coût de calcul, ouvrant la voie à un avenir plus précis et interactif dans le domaine de l’intelligence incarnée.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











