蚂蚁集团开源LingBot-Vision,赋予机器人空间感知能力
在具身智能领域,让机器人能够以接近人类的精度感知物理空间,仍然是一项根本性挑战。 蚂蚁集团旗下专注于具身人工智能的子公司Robbyant已正式开源LingBot-Vision模型系列。这一套自监督视觉Transformer模型通过创新的“边界建模”策略,在密集空间感知方面取得了卓越成果,尽管参数数量较少,但在多个基准测试中表现均优于更大规模的模型。
当前大多数视觉基础模型优先考虑“物体识别”,侧重于识别图像中的内容,却往往忽视了物体边界、轮廓和深度等关键的物理交互线索。 LingBot-Vision 颠覆了这一思路,将“边界”作为主要的预训练信号。通过利用遮罩边界建模,该模型能够识别图像中信息最密集的区域,并以此为核心进行训练。这种方法使模型在获得语义理解的同时,也能发展出强大的几何空间感知能力。

在性能方面,旗舰模型 LingBot-Vision(ViT-g/16)仅包含 11 亿个参数,却在深度估计任务(包括 NYU-Depth v2)中取得了最先进的结果。 它超越了拥有70亿参数的DINOv3,而其使用的训练数据集规模仅为后者的三分之一左右。针对资源受限的部署场景,该系列提供了从30亿参数到更小规模的蒸馏版本,确保在各种硬件配置下都能实现顶级的密集预测性能。
为展示该技术的实际价值,开发团队还将深度补全系统升级为 LingBot-Depth 2.0。测试表明,在处理透明物体(这一传统的感知盲点)时,其准确率有了显著提升。 随着数据量的增加,LingBot-Vision 的性能持续提升,且不会出现传统模型典型的饱和现象,这进一步验证了其以边界为中心空间感知架构在复杂真实世界环境中的潜力。
LingBot-Vision 现已在 Hugging Face 上完全开源,采用 Apache-2.0 许可证,包含从大到小四种模型规格的权重和推理代码。该技术使开发者能够以更低的计算成本为机器人配备更灵敏的物理感知能力,为具身智能领域更精准、更具交互性的未来铺平道路。
相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
评论 (0)
0/500
在具身智能领域,让机器人能够以接近人类的精度感知物理空间,仍然是一项根本性挑战。 蚂蚁集团旗下专注于具身人工智能的子公司Robbyant已正式开源LingBot-Vision模型系列。这一套自监督视觉Transformer模型通过创新的“边界建模”策略,在密集空间感知方面取得了卓越成果,尽管参数数量较少,但在多个基准测试中表现均优于更大规模的模型。
当前大多数视觉基础模型优先考虑“物体识别”,侧重于识别图像中的内容,却往往忽视了物体边界、轮廓和深度等关键的物理交互线索。 LingBot-Vision 颠覆了这一思路,将“边界”作为主要的预训练信号。通过利用遮罩边界建模,该模型能够识别图像中信息最密集的区域,并以此为核心进行训练。这种方法使模型在获得语义理解的同时,也能发展出强大的几何空间感知能力。

在性能方面,旗舰模型 LingBot-Vision(ViT-g/16)仅包含 11 亿个参数,却在深度估计任务(包括 NYU-Depth v2)中取得了最先进的结果。 它超越了拥有70亿参数的DINOv3,而其使用的训练数据集规模仅为后者的三分之一左右。针对资源受限的部署场景,该系列提供了从30亿参数到更小规模的蒸馏版本,确保在各种硬件配置下都能实现顶级的密集预测性能。
为展示该技术的实际价值,开发团队还将深度补全系统升级为 LingBot-Depth 2.0。测试表明,在处理透明物体(这一传统的感知盲点)时,其准确率有了显著提升。 随着数据量的增加,LingBot-Vision 的性能持续提升,且不会出现传统模型典型的饱和现象,这进一步验证了其以边界为中心空间感知架构在复杂真实世界环境中的潜力。
LingBot-Vision 现已在 Hugging Face 上完全开源,采用 Apache-2.0 许可证,包含从大到小四种模型规格的权重和推理代码。该技术使开发者能够以更低的计算成本为机器人配备更灵敏的物理感知能力,为具身智能领域更精准、更具交互性的未来铺平道路。
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业





首页






