螞蟻集團將 LingBot-Vision 開源,賦予機器人空間感知能力
在具身智慧領域中,讓機器人能以類人級的精準度感知實體空間,仍是項根本性的挑戰。 螞蟻集團旗下專注於具身人工智慧的子公司 Robbyant,已正式將 LingBot-Vision 模型系列開源。這套自監督視覺 Transformer 模型透過創新的「邊界建模」策略,在密集空間感知方面取得了卓越成果,儘管參數較少,但在多個基準測試中表現仍優於參數更龐大的模型。
當前多數視覺基礎模型優先考量「物件識別」,著重於辨識影像中的內容,卻往往忽略了物件邊界、輪廓及深度等關鍵的物理互動線索。 LingBot-Vision 顛覆了這種做法,將「邊界」視為主要的預訓練訊號。透過運用遮罩邊界建模,該模型能識別影像中資訊最密集的區域,並將訓練重點集中於此。此方法使模型在獲得語義理解的同時,也能發展出穩健的幾何空間感知能力。

在性能方面,旗艦級 LingBot-Vision 模型 ViT-g/16 僅含 11 億個參數,卻在深度估計任務(包括 NYU-Depth v2)中取得最先進的成果。 其表現超越了擁有 70 億參數的 DINOv3,且僅使用約三分之一規模的訓練資料集。針對資源受限的部署情境,該系列提供從 30 億參數起,逐步縮減至更小規模的蒸餾版本,確保在各種硬體配置下皆能展現頂級的密集預測效能。
為展現該技術的實際價值,開發團隊還將深度補全系統升級至 LingBot-Depth 2.0。測試顯示,在處理透明物體(傳統感知中的盲點)時,準確度有顯著提升。 隨著數據量的增加,LingBot-Vision 的效能持續擴展,且未出現傳統模型常見的效能飽和現象,進一步驗證了其「邊界為中心」的空間感知架構在複雜真實世界環境中的潛力。
LingBot-Vision 現已於 Hugging Face 平台以 Apache-2.0 授權條款全面開源,包含從大到小四種模型尺寸的權重與推論程式碼。這項技術使開發者能夠以更低的運算成本,為機器人配備更靈敏的物理感知能力,為具身智能領域中更精準且互動性更強的未來鋪平道路。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
在具身智慧領域中,讓機器人能以類人級的精準度感知實體空間,仍是項根本性的挑戰。 螞蟻集團旗下專注於具身人工智慧的子公司 Robbyant,已正式將 LingBot-Vision 模型系列開源。這套自監督視覺 Transformer 模型透過創新的「邊界建模」策略,在密集空間感知方面取得了卓越成果,儘管參數較少,但在多個基準測試中表現仍優於參數更龐大的模型。
當前多數視覺基礎模型優先考量「物件識別」,著重於辨識影像中的內容,卻往往忽略了物件邊界、輪廓及深度等關鍵的物理互動線索。 LingBot-Vision 顛覆了這種做法,將「邊界」視為主要的預訓練訊號。透過運用遮罩邊界建模,該模型能識別影像中資訊最密集的區域,並將訓練重點集中於此。此方法使模型在獲得語義理解的同時,也能發展出穩健的幾何空間感知能力。

在性能方面,旗艦級 LingBot-Vision 模型 ViT-g/16 僅含 11 億個參數,卻在深度估計任務(包括 NYU-Depth v2)中取得最先進的成果。 其表現超越了擁有 70 億參數的 DINOv3,且僅使用約三分之一規模的訓練資料集。針對資源受限的部署情境,該系列提供從 30 億參數起,逐步縮減至更小規模的蒸餾版本,確保在各種硬體配置下皆能展現頂級的密集預測效能。
為展現該技術的實際價值,開發團隊還將深度補全系統升級至 LingBot-Depth 2.0。測試顯示,在處理透明物體(傳統感知中的盲點)時,準確度有顯著提升。 隨著數據量的增加,LingBot-Vision 的效能持續擴展,且未出現傳統模型常見的效能飽和現象,進一步驗證了其「邊界為中心」的空間感知架構在複雜真實世界環境中的潛力。
LingBot-Vision 現已於 Hugging Face 平台以 Apache-2.0 授權條款全面開源,包含從大到小四種模型尺寸的權重與推論程式碼。這項技術使開發者能夠以更低的運算成本,為機器人配備更靈敏的物理感知能力,為具身智能領域中更精準且互動性更強的未來鋪平道路。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






