全球首个事件级具身智能世界模型,结束了机器人的逐帧学习
5月29日,Variable Robot团队发布了WALL-WM,这是全球首个基于“事件级预测”构建的具身智能世界模型。 该模型突破了传统具身大型模型逐帧学习动作的局限,将世界模型的预测单元转换为语义事件。这标志着机器人在理解和执行任务方面迈入了一个新阶段。

在当前的具身智能领域,主流的视觉-语言-动作(VLA)模型通常基于当前图像和指令来预测固定长度的动作块。这种逐帧训练方法往往导致机器人专注于细微的肢体动作,却忽视了动作的最终目标。 当面对更换杯子或桌子等场景时,机器人常因缺乏泛化能力而失败。为解决这一行业痛点,Variable团队在其学术论文中指出,文本、视觉和动作信息在现实世界中天然存在于不同的时间尺度和流形几何结构中。 将它们强行置于单一共享空间中,极易破坏预训练的几何先验。
为应对这一挑战,WALL-WM 世界模型引入了一种创新的事件中心化训练与执行机制。它将复杂任务分解为语义清晰的事件节点,例如伸手、抓取和移动。 在运行时,该模型不再机械地计算下一帧图像。相反,它首先模拟世界因下一个事件将如何变化,然后将这种视觉变化精确转化为机械臂的运动轨迹。

为确保这一新架构能在物理世界中可靠部署,Variable Robot团队进行了一系列深度工程改造。该系统支持在同一基础权重上灵活切换“事件模式”(具有可变长度的动作输出)与“统一模式”(具有实时闭环控制)。 该系统还实现了视频模型与动作模型之间的单向耦合,防止来自互联网视频的宝贵动态先验信息过早受到动作数据的偏置。 针对多摄像头间的几何感知,该模型引入了截锥体遮罩和管状遮罩,迫使 AI 建立跨视图的真实三维几何对应关系。为解决决策延迟问题,它采用了一种新的“分步思维链解码”技术,在保持逻辑可解释性的同时,显著降低了解码延迟。

相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (1)
0/500
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
5月29日,Variable Robot团队发布了WALL-WM,这是全球首个基于“事件级预测”构建的具身智能世界模型。 该模型突破了传统具身大型模型逐帧学习动作的局限,将世界模型的预测单元转换为语义事件。这标志着机器人在理解和执行任务方面迈入了一个新阶段。

在当前的具身智能领域,主流的视觉-语言-动作(VLA)模型通常基于当前图像和指令来预测固定长度的动作块。这种逐帧训练方法往往导致机器人专注于细微的肢体动作,却忽视了动作的最终目标。 当面对更换杯子或桌子等场景时,机器人常因缺乏泛化能力而失败。为解决这一行业痛点,Variable团队在其学术论文中指出,文本、视觉和动作信息在现实世界中天然存在于不同的时间尺度和流形几何结构中。 将它们强行置于单一共享空间中,极易破坏预训练的几何先验。
为应对这一挑战,WALL-WM 世界模型引入了一种创新的事件中心化训练与执行机制。它将复杂任务分解为语义清晰的事件节点,例如伸手、抓取和移动。 在运行时,该模型不再机械地计算下一帧图像。相反,它首先模拟世界因下一个事件将如何变化,然后将这种视觉变化精确转化为机械臂的运动轨迹。

为确保这一新架构能在物理世界中可靠部署,Variable Robot团队进行了一系列深度工程改造。该系统支持在同一基础权重上灵活切换“事件模式”(具有可变长度的动作输出)与“统一模式”(具有实时闭环控制)。 该系统还实现了视频模型与动作模型之间的单向耦合,防止来自互联网视频的宝贵动态先验信息过早受到动作数据的偏置。 针对多摄像头间的几何感知,该模型引入了截锥体遮罩和管状遮罩,迫使 AI 建立跨视图的真实三维几何对应关系。为解决决策延迟问题,它采用了一种新的“分步思维链解码”技术,在保持逻辑可解释性的同时,显著降低了解码延迟。

DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics





首页






