Heim
Das weltweit erste auf Ereignisebene basierende Weltmodell für verkörperte Intelligenz macht dem frameweisen Lernen für Roboter ein Ende
Am 29. Mai stellte das Team von Variable Robot WALL-WM vor, das weltweit erste Weltmodell mit verkörperter Intelligenz, das auf „Vorhersagen auf Ereignisebene“ basiert. Dieses Modell löst sich von herkömmlichen großen Modellen der verkörperten Intelligenz, die Aktionen im Laufe der Zeit Frame für Frame lernen, und verlagert stattdessen die Vorhersageeinheit des Weltmodells auf semantische Ereignisse. Es markiert eine neue Etappe in der Art und Weise, wie Roboter Aufgaben verstehen und ausführen.

In der aktuellen Branche der verkörperten Intelligenz verwenden gängige Vision-Language-Action-Modelle (VLA) in der Regel ein aktuelles Bild und eine Anweisung, um einen Aktionsblock fester Länge vorherzusagen. Dieser Frame-für-Frame-Trainingsansatz führt oft dazu, dass sich Roboter auf kleine körperliche Bewegungen konzentrieren und dabei das eigentliche Ziel der Aktion aus den Augen verlieren. In Szenarien wie dem Wechseln von Tassen oder Tischen scheitern Roboter häufig aufgrund mangelnder Generalisierungsfähigkeit. Um diesen Schwachpunkt der Branche anzugehen, wies das Variable-Team in seiner wissenschaftlichen Arbeit darauf hin, dass Text-, Bild- und Handlungsinformationen in der realen Welt naturgemäß auf unterschiedlichen Zeitskalen und in vielfältigen Geometrien existieren. Werden diese in einen einzigen gemeinsamen Raum gezwängt, kann dies leicht die vortrainierte geometrische Priorität beeinträchtigen.
Um diese Herausforderung zu bewältigen, führt das WALL-WM-Weltmodell einen innovativen ereigniszentrierten Trainings- und Ausführungsmechanismus ein. Es zerlegt komplexe Aufgaben in semantisch klare Ereignisverbindungen wie Greifen, Ergreifen und Bewegen. Im Betrieb berechnet das Modell den nächsten Bildframe nicht mehr starr. Stattdessen simuliert es zunächst, wie sich die Welt durch das nächste Ereignis verändern wird, und übersetzt diese visuelle Veränderung dann präzise in die Bewegungsbahn des Roboterarms.

Um sicherzustellen, dass diese neue Architektur zuverlässig in der physischen Welt eingesetzt werden kann, führte das Variable-Robot-Team eine Reihe umfassender technischer Überarbeitungen durch. Das System unterstützt den flexiblen Wechsel zwischen dem „Ereignismodus“ (mit Aktionsausgabe variabler Länge) und dem „Unified-Modus“ (mit Echtzeit-Regelung) auf Basis derselben Grundgewichte. Außerdem erreicht es eine Einwegkopplung zwischen Videomodellen und Aktionsmodellen, wodurch verhindert wird, dass wertvolle dynamische Vorinformationen aus Internetvideos vorzeitig durch Aktionsdaten verzerrt werden. Für die geometrische Wahrnehmung über mehrere Kameras hinweg führt das Modell Frustum-Masken und röhrenförmige Masken ein, wodurch die KI gezwungen wird, eine sichtfeldübergreifende, echte dreidimensionale geometrische Entsprechung zu entwickeln. Um die Entscheidungslatenz zu verringern, wird eine neue „Stepped Chain-of-Thought Decoding“-Technik eingesetzt, die die Dekodierungsverzögerung deutlich reduziert und gleichzeitig die logische Interpretierbarkeit gewährleistet.

Verwandter Artikel
DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Einhaltung der Vorschriften für autonome Fahrzeuge in Kalifornien: Eine neue Ära von Bußgeldern, Geofences und 1 Million Meilen
Guident betreibt einen AuveTech-Shuttle in Südflorida und verwaltet mithilfe seiner Fernüberwachungstechnologie eine vier Meilen lange Strecke in West Palm Beach sowie eine eine Meile lange Strecke in
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
Am 29. Mai stellte das Team von Variable Robot WALL-WM vor, das weltweit erste Weltmodell mit verkörperter Intelligenz, das auf „Vorhersagen auf Ereignisebene“ basiert. Dieses Modell löst sich von herkömmlichen großen Modellen der verkörperten Intelligenz, die Aktionen im Laufe der Zeit Frame für Frame lernen, und verlagert stattdessen die Vorhersageeinheit des Weltmodells auf semantische Ereignisse. Es markiert eine neue Etappe in der Art und Weise, wie Roboter Aufgaben verstehen und ausführen.

In der aktuellen Branche der verkörperten Intelligenz verwenden gängige Vision-Language-Action-Modelle (VLA) in der Regel ein aktuelles Bild und eine Anweisung, um einen Aktionsblock fester Länge vorherzusagen. Dieser Frame-für-Frame-Trainingsansatz führt oft dazu, dass sich Roboter auf kleine körperliche Bewegungen konzentrieren und dabei das eigentliche Ziel der Aktion aus den Augen verlieren. In Szenarien wie dem Wechseln von Tassen oder Tischen scheitern Roboter häufig aufgrund mangelnder Generalisierungsfähigkeit. Um diesen Schwachpunkt der Branche anzugehen, wies das Variable-Team in seiner wissenschaftlichen Arbeit darauf hin, dass Text-, Bild- und Handlungsinformationen in der realen Welt naturgemäß auf unterschiedlichen Zeitskalen und in vielfältigen Geometrien existieren. Werden diese in einen einzigen gemeinsamen Raum gezwängt, kann dies leicht die vortrainierte geometrische Priorität beeinträchtigen.
Um diese Herausforderung zu bewältigen, führt das WALL-WM-Weltmodell einen innovativen ereigniszentrierten Trainings- und Ausführungsmechanismus ein. Es zerlegt komplexe Aufgaben in semantisch klare Ereignisverbindungen wie Greifen, Ergreifen und Bewegen. Im Betrieb berechnet das Modell den nächsten Bildframe nicht mehr starr. Stattdessen simuliert es zunächst, wie sich die Welt durch das nächste Ereignis verändern wird, und übersetzt diese visuelle Veränderung dann präzise in die Bewegungsbahn des Roboterarms.

Um sicherzustellen, dass diese neue Architektur zuverlässig in der physischen Welt eingesetzt werden kann, führte das Variable-Robot-Team eine Reihe umfassender technischer Überarbeitungen durch. Das System unterstützt den flexiblen Wechsel zwischen dem „Ereignismodus“ (mit Aktionsausgabe variabler Länge) und dem „Unified-Modus“ (mit Echtzeit-Regelung) auf Basis derselben Grundgewichte. Außerdem erreicht es eine Einwegkopplung zwischen Videomodellen und Aktionsmodellen, wodurch verhindert wird, dass wertvolle dynamische Vorinformationen aus Internetvideos vorzeitig durch Aktionsdaten verzerrt werden. Für die geometrische Wahrnehmung über mehrere Kameras hinweg führt das Modell Frustum-Masken und röhrenförmige Masken ein, wodurch die KI gezwungen wird, eine sichtfeldübergreifende, echte dreidimensionale geometrische Entsprechung zu entwickeln. Um die Entscheidungslatenz zu verringern, wird eine neue „Stepped Chain-of-Thought Decoding“-Technik eingesetzt, die die Dekodierungsverzögerung deutlich reduziert und gleichzeitig die logische Interpretierbarkeit gewährleistet.

DeepMind-CEO Hassabis: Ich schlafe sechs Stunden pro Tag und fühle mich normalerweise gegen 1 Uhr nachts energiegeladen.
Fortune hat kürzlich ein Interview mit Demis Hassabis, dem CEO von Google DeepMind, veröffentlicht, das seinen unkonventionellen Ansatz zu Erholung und Produktivität offenbart. Hassabis gab bekannt, dass er sehr wenig schläft und seine wachen Stunden
OpenAI und Anthropic kämpfen trotz Umsatzrückgängen um Marktanteile
Obwohl jüngste Berichte darauf hindeuten, dass OpenAI seine Umsatzziele verfehlt hat, was an diesem Dienstag Druck auf die Technologieaktien ausübte, zeigen sich private Investoren in KI-Labore weiter
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











