Дом
Компания Ant Group выпустила модель пространственного восприятия LingBot-Depth 2.0, которая способствует развитию технологий компьютерного зрения для роботов.
7 июля компания Lingbo Technology, занимающаяся разработкой технологий воплощенного интеллекта и входящая в состав Ant Group, представила модель пространственного восприятия LingBot-Depth 2.0. Обученная на наборе данных из 150 миллионов образцов, она обеспечивает значительное улучшение четкости контуров, распознавания мелких объектов, оценки глубины на больших расстояниях, а также устойчивости в сложных сценариях.
LingBot-Depth — это модель пространственного восприятия, независимо разработанная компанией Lingbo, которая служит «глазами» роботов в реальном мире. Первая версия решала задачи пространственного восприятия в сложных сценариях, таких как прозрачные и отражающие поверхности. По сравнению с версией 1.0 объем обучающих данных для LingBot-Depth 2.0 увеличился с 3 миллионов до 150 миллионов образцов, что привело к общему повышению производительности: модель заняла первое место по 12 из 16 оценочных показателей в тестах на восстановление глубины. В наиболее сложном сценарии в помещении с обширными пробелами в данных о глубине погрешность глубины сократилась вдвое по сравнению с предыдущим поколением (среднеквадратичная ошибка RMSE снизилась с 0,132 до 0,062). Система демонстрирует особенно высокую эффективность в ситуациях, в которых традиционные камеры глубины часто дают сбой, например при работе со стеклом, зеркалами и прозрачными объектами.
В то же время в LingBot-Depth 2.0 была внедрена базовая модель визуального восприятия LingBot-Vision, создавшая цепочку способностей от «понимания» до «точного восприятия». Это направлено на решение ключевых задач в области робототехнического зрения, включая пространственное восприятие, точное распознавание и адаптацию к сложным средам.

(Рисунок 1: LingBot-Depth 2.0 воссоздаёт полную и плоскую 3D-структуру в сложных сценариях, таких как зеркала и стекло)
Прорыв LingBot-Depth 2.0 основан на выдающихся возможностях визуального представления LingBot-Vision. Являясь универсальной визуальной моделью, LingBot-Vision стала первой в отрасли базовой визуальной моделью, использующей «структуру границ» в качестве цели предварительного обучения, что позволило добиться прорыва в парадигме обучения пространственному восприятию. Она обеспечивает определение границ на субпиксельном уровне и понимание пространственной структуры, обеспечивая более высокую точность и стабильность пространственного восприятия.
Корпус для предварительного обучения LingBot-Vision состоит всего из 160 миллионов изображений, что на порядок меньше, чем у DINOv3, однако точность оценки глубины превосходит DINOv3. Более того, определение границ объектов в LingBot-Vision достаточно стабильно, что позволяет осуществлять непрерывное отслеживание границ в видео. В этом выпуске представлены четыре версии: ViT-G, ViT-L, ViT-B и ViT-S.
Согласно имеющейся информации, LingBot-Vision не только поддерживает обучение LingBot-Depth 2.0, но и может использоваться множеством других способов.

(Рисунок 2: LingBot-Depth 2.0 демонстрирует хорошие результаты в тестах по восстановлению глубины с использованием реальных датчиков)

(Рисунок 3: По сравнению с основными моделями визуальной основы LingBot-Vision более чётко и стабильно определяет границы объектов и пространственные структуры)
В настоящее время LingBot-Depth 2.0 прошел профессиональную сертификацию в Orbbec Depth Vision Lab. Тесты в реальных сценариях показывают, что на основе исходных 3D-данных на уровне микросхем, предоставляемых стерео-3D-камерой серии Gemini330 от Orbbec, LingBot-Depth 2.0 значительно улучшает четкость краев, целостность контуров объектов, распознавание мелких объектов, оценку глубины на больших расстояниях, а также устойчивость в сложных условиях освещения и при работе с различными материалами.

(Рисунок 4: LingBot Depth 2.0 прошел профессиональную оценку в Orbbec Depth Vision Lab, продемонстрировав чрезвычайно высокую точность и стабильность при решении задач пространственной и временной оценки глубины с использованием различных типов датчиков)
Что касается коммерциализации, компания Ant Lingbo наладила тесное сотрудничество с Orbbec во многих областях. Согласно имеющейся информации, новейшая RGB-D-версия устройства EGO из новой линейки продуктов Orbbec для сбора данных без участия человека будет адаптирована к версии LingBot-Depth, оптимизированной компанией Lingbo для сценариев сбора данных. В будущем планируется дальнейшая интеграция коммерческих версий более высокого уровня, постоянное устранение пробелов в данных о глубине, оптимизация краев объектов и деталей пространственной структуры, а также предоставление более точных, стабильных и пригодных для практического использования баз данных реального мира для обучения моделей воплощённого интеллекта.
Кроме того, Orbbec выпустит SDK-продукт, интегрирующий новейшие возможности модели LingBot-Depth, доступный для использования клиентами-робототехниками на периферии, что позволит роботам, использующим камеры серии Gemini330, достигать лучших результатов в области определения глубины. Кроме того, к концу года планируется выпустить интегрированную камеру с коммерческой версией LingBot-Depth, что позволит реализовать интеграцию «3D-камеры и возможностей пространственного восприятия». Ожидается, что с выпуском этих двух моделей их сотрудничество расширится на новые области.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
7 июля компания Lingbo Technology, занимающаяся разработкой технологий воплощенного интеллекта и входящая в состав Ant Group, представила модель пространственного восприятия LingBot-Depth 2.0. Обученная на наборе данных из 150 миллионов образцов, она обеспечивает значительное улучшение четкости контуров, распознавания мелких объектов, оценки глубины на больших расстояниях, а также устойчивости в сложных сценариях.
LingBot-Depth — это модель пространственного восприятия, независимо разработанная компанией Lingbo, которая служит «глазами» роботов в реальном мире. Первая версия решала задачи пространственного восприятия в сложных сценариях, таких как прозрачные и отражающие поверхности. По сравнению с версией 1.0 объем обучающих данных для LingBot-Depth 2.0 увеличился с 3 миллионов до 150 миллионов образцов, что привело к общему повышению производительности: модель заняла первое место по 12 из 16 оценочных показателей в тестах на восстановление глубины. В наиболее сложном сценарии в помещении с обширными пробелами в данных о глубине погрешность глубины сократилась вдвое по сравнению с предыдущим поколением (среднеквадратичная ошибка RMSE снизилась с 0,132 до 0,062). Система демонстрирует особенно высокую эффективность в ситуациях, в которых традиционные камеры глубины часто дают сбой, например при работе со стеклом, зеркалами и прозрачными объектами.
В то же время в LingBot-Depth 2.0 была внедрена базовая модель визуального восприятия LingBot-Vision, создавшая цепочку способностей от «понимания» до «точного восприятия». Это направлено на решение ключевых задач в области робототехнического зрения, включая пространственное восприятие, точное распознавание и адаптацию к сложным средам.

(Рисунок 1: LingBot-Depth 2.0 воссоздаёт полную и плоскую 3D-структуру в сложных сценариях, таких как зеркала и стекло)
Прорыв LingBot-Depth 2.0 основан на выдающихся возможностях визуального представления LingBot-Vision. Являясь универсальной визуальной моделью, LingBot-Vision стала первой в отрасли базовой визуальной моделью, использующей «структуру границ» в качестве цели предварительного обучения, что позволило добиться прорыва в парадигме обучения пространственному восприятию. Она обеспечивает определение границ на субпиксельном уровне и понимание пространственной структуры, обеспечивая более высокую точность и стабильность пространственного восприятия.
Корпус для предварительного обучения LingBot-Vision состоит всего из 160 миллионов изображений, что на порядок меньше, чем у DINOv3, однако точность оценки глубины превосходит DINOv3. Более того, определение границ объектов в LingBot-Vision достаточно стабильно, что позволяет осуществлять непрерывное отслеживание границ в видео. В этом выпуске представлены четыре версии: ViT-G, ViT-L, ViT-B и ViT-S.
Согласно имеющейся информации, LingBot-Vision не только поддерживает обучение LingBot-Depth 2.0, но и может использоваться множеством других способов.

(Рисунок 2: LingBot-Depth 2.0 демонстрирует хорошие результаты в тестах по восстановлению глубины с использованием реальных датчиков)

(Рисунок 3: По сравнению с основными моделями визуальной основы LingBot-Vision более чётко и стабильно определяет границы объектов и пространственные структуры)
В настоящее время LingBot-Depth 2.0 прошел профессиональную сертификацию в Orbbec Depth Vision Lab. Тесты в реальных сценариях показывают, что на основе исходных 3D-данных на уровне микросхем, предоставляемых стерео-3D-камерой серии Gemini330 от Orbbec, LingBot-Depth 2.0 значительно улучшает четкость краев, целостность контуров объектов, распознавание мелких объектов, оценку глубины на больших расстояниях, а также устойчивость в сложных условиях освещения и при работе с различными материалами.

(Рисунок 4: LingBot Depth 2.0 прошел профессиональную оценку в Orbbec Depth Vision Lab, продемонстрировав чрезвычайно высокую точность и стабильность при решении задач пространственной и временной оценки глубины с использованием различных типов датчиков)
Что касается коммерциализации, компания Ant Lingbo наладила тесное сотрудничество с Orbbec во многих областях. Согласно имеющейся информации, новейшая RGB-D-версия устройства EGO из новой линейки продуктов Orbbec для сбора данных без участия человека будет адаптирована к версии LingBot-Depth, оптимизированной компанией Lingbo для сценариев сбора данных. В будущем планируется дальнейшая интеграция коммерческих версий более высокого уровня, постоянное устранение пробелов в данных о глубине, оптимизация краев объектов и деталей пространственной структуры, а также предоставление более точных, стабильных и пригодных для практического использования баз данных реального мира для обучения моделей воплощённого интеллекта.
Кроме того, Orbbec выпустит SDK-продукт, интегрирующий новейшие возможности модели LingBot-Depth, доступный для использования клиентами-робототехниками на периферии, что позволит роботам, использующим камеры серии Gemini330, достигать лучших результатов в области определения глубины. Кроме того, к концу года планируется выпустить интегрированную камеру с коммерческой версией LingBot-Depth, что позволит реализовать интеграцию «3D-камеры и возможностей пространственного восприятия». Ожидается, что с выпуском этих двух моделей их сотрудничество расширится на новые области.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











