Дом
Ant Group открыла исходный код LingBot-Vision, что позволяет роботам ориентироваться в пространстве
В области воплощённого интеллекта одной из основных задач по-прежнему остаётся обеспечение роботам возможности воспринимать физическое пространство с точностью, сравнимой с человеческой. Robbyant, дочерняя компания Ant Group, специализирующаяся на воплощённом искусственном интеллекте, официально открыла исходный код семейства моделей LingBot-Vision. Этот набор самообучаемых трансформеров для обработки изображений достигает исключительных результатов в плотном пространственном восприятии благодаря инновационной стратегии «моделирования границ», превосходя по производительности более крупные модели по многим тестам, несмотря на меньшее количество параметров.
Большинство современных базовых моделей зрительного восприятия уделяют приоритетное внимание «распознаванию объектов», сосредоточиваясь на определении того, что изображено на снимке, при этом зачастую упуская из виду важнейшие признаки физического взаимодействия, такие как границы объектов, контуры и глубина. LingBot-Vision переворачивает этот подход, рассматривая «границы» в качестве основных сигналов для предварительного обучения. Используя моделирование границ с помощью масок, модель выявляет области изображения с наибольшей информационной плотностью и сосредотачивает на них своё обучение. Этот метод позволяет модели приобретать семантическое понимание и одновременно развивать надёжное геометрическое пространственное восприятие.

Что касается производительности, то флагманская модель LingBot-Vision, ViT-g/16, содержит всего 1,1 миллиарда параметров, но при этом достигает передовых результатов в задачах оценки глубины, включая NYU-Depth v2. Она превосходит DINOv3, имеющую 7 миллиардов параметров, при этом используя обучающий набор данных, размер которого составляет примерно одну треть от размера DINOv3. Для сценариев развертывания с ограниченными ресурсами серия предлагает дистиллированные версии с количеством параметров от 3 миллиардов до меньших значений, обеспечивая высочайшую производительность плотного прогнозирования на различных аппаратных конфигурациях.
Чтобы продемонстрировать практическую ценность технологии, команда разработчиков также модернизировала систему восстановления глубины до версии LingBot-Depth 2.0. Тесты показывают значительное повышение точности при обработке прозрачных объектов — традиционного «слепого пятна» систем восприятия. По мере увеличения объема данных производительность LingBot-Vision продолжает масштабироваться без насыщения, характерного для традиционных моделей, что еще раз подтверждает потенциал её архитектуры пространственного восприятия, ориентированной на границы, в сложных реальных средах.
LingBot-Vision теперь полностью доступен с открытым исходным кодом на Hugging Face по лицензии Apache-2.0, включая веса и код инференса для четырёх размеров моделей — от крупных до мелких. Эта технология позволяет разработчикам наделять роботов более чувствительными способностями физического восприятия при меньших вычислительных затратах, прокладывая путь к более точному и интерактивному будущему в области воплощённого интеллекта.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
В области воплощённого интеллекта одной из основных задач по-прежнему остаётся обеспечение роботам возможности воспринимать физическое пространство с точностью, сравнимой с человеческой. Robbyant, дочерняя компания Ant Group, специализирующаяся на воплощённом искусственном интеллекте, официально открыла исходный код семейства моделей LingBot-Vision. Этот набор самообучаемых трансформеров для обработки изображений достигает исключительных результатов в плотном пространственном восприятии благодаря инновационной стратегии «моделирования границ», превосходя по производительности более крупные модели по многим тестам, несмотря на меньшее количество параметров.
Большинство современных базовых моделей зрительного восприятия уделяют приоритетное внимание «распознаванию объектов», сосредоточиваясь на определении того, что изображено на снимке, при этом зачастую упуская из виду важнейшие признаки физического взаимодействия, такие как границы объектов, контуры и глубина. LingBot-Vision переворачивает этот подход, рассматривая «границы» в качестве основных сигналов для предварительного обучения. Используя моделирование границ с помощью масок, модель выявляет области изображения с наибольшей информационной плотностью и сосредотачивает на них своё обучение. Этот метод позволяет модели приобретать семантическое понимание и одновременно развивать надёжное геометрическое пространственное восприятие.

Что касается производительности, то флагманская модель LingBot-Vision, ViT-g/16, содержит всего 1,1 миллиарда параметров, но при этом достигает передовых результатов в задачах оценки глубины, включая NYU-Depth v2. Она превосходит DINOv3, имеющую 7 миллиардов параметров, при этом используя обучающий набор данных, размер которого составляет примерно одну треть от размера DINOv3. Для сценариев развертывания с ограниченными ресурсами серия предлагает дистиллированные версии с количеством параметров от 3 миллиардов до меньших значений, обеспечивая высочайшую производительность плотного прогнозирования на различных аппаратных конфигурациях.
Чтобы продемонстрировать практическую ценность технологии, команда разработчиков также модернизировала систему восстановления глубины до версии LingBot-Depth 2.0. Тесты показывают значительное повышение точности при обработке прозрачных объектов — традиционного «слепого пятна» систем восприятия. По мере увеличения объема данных производительность LingBot-Vision продолжает масштабироваться без насыщения, характерного для традиционных моделей, что еще раз подтверждает потенциал её архитектуры пространственного восприятия, ориентированной на границы, в сложных реальных средах.
LingBot-Vision теперь полностью доступен с открытым исходным кодом на Hugging Face по лицензии Apache-2.0, включая веса и код инференса для четырёх размеров моделей — от крупных до мелких. Эта технология позволяет разработчикам наделять роботов более чувствительными способностями физического восприятия при меньших вычислительных затратах, прокладывая путь к более точному и интерактивному будущему в области воплощённого интеллекта.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











