Heim
Das inländische verkörperte große Modell Wall-OSS-0.5 macht mit Open Source einen großen Eindruck: Zero-Shot-Bereitstellung nach dem Pre-Training
Im Mai 2026 erzielte Chinas Sektors für verkörperte Intelligenz (Embodied Intelligence) einen bedeutenden Meilenstein mit der Open-Source-Veröffentlichung des neuesten Vision-Language-Action (VLA)-Modells Wall-OSS-0.5 durch X Square Robot. Abweichend von der Branchenüblichkeit einer Feinabstimmung vor der Prüfung ermöglicht dieses Modell den Zero-Shot-Einsatz auf physischen Robotern ohne aufgabenbezogene Anpassungen.

Vom maßgeschneiderten Skript zur allgemeinen Intelligenz
Das Feld der verkörperten Intelligenz war lange Zeit mit einer versteckten Einschränkung konfrontiert: Die meisten Modelle erfordern umfangreiche Feinabstimmungen für spezifische Aufgaben vor der Bewertung, was es schwierig macht, zwischen echter Verallgemeinerung und bloßem Skriptverhalten zu unterscheiden.
X Square Robot adressiert dies mit Wall-OSS-0.5. Das Modell wurde auf über 20 Robotertypen, Millionen von Trajektoriendatensätzen und einem multimodalen Korpus mit 90 Millionen Einträgen vortrainiert und ohne aufgabenbezogene Feinabstimmung direkt auf echten Robotern bereitgestellt. Das Team bewertete seine Leistung in 17 komplexen Aufgaben, darunter semantisches Verständnis, das Manipulieren starrer und flexibler Objekte sowie Präzisionsoperationen.
Schlüsselhighlight: Ein großer Sprung in der Vortraining
Testergebnisse zeigen, dass Wall-OSS-0.5 die aktuellen Erwartungen übertrifft:
Zero-Shot-Bereitstellung: Ohne Feinabstimmung erreichte eine Version mit 400.000 Vortrainingsschritten in vier von 17 Zero-Shot-Aufgaben Werte über 80/100. Bemerkenswerterweise erzielte es einen Wert von 82 bei der Aufgabe „Zug festziehen“, eine Herausforderung mit flexiblen Objekten, die während des Vortrainings nicht auftrat.
Verbessertes Feinabstimmungspotenzial: Bei gezielter Feinabstimmung zeigt Wall-OSS-0.5 eine außergewöhnliche Lerneffizienz. Im Vergleich zum Branchenstandard π0.5 führt es mit einem Durchschnitt von 17,5 Punkten unter demselben Datenbudget, wobei Präzisionsaufgaben wie das präzise Einfügen eine fast zehnfache Verbesserung der Erfolgsraten aufweisen.
Fähigkeitsevolution, kein Abbau: Experimente zeigen, dass nach intensivem Aktionstraining die multimodalen Wahrnehmungsfähigkeiten des Modells intakt bleiben und sich in der visuellen Positionsbestimmung und Schlussfolgerung einer „reformierenden“ Evolution unterziehen.
Vier Kerntechnologien schaffen einen Wettbewerbsvorteil
Die Leistung von Wall-OSS-0.5 resultiert aus vier grundlegenden Innovationen:
Gradientenbrücke: Durch das direkte Einbringen von Aktionssupervisionssignalen in den Vortrainings-Backbone vereint das Modell „Sehen, Sprechen und Handeln“ auf der Darstellungsebene.
Visueller Ausrichtungstokenizer: Dies stellt sicher, dass jeder Aktionstoken klare visuelle Semantik trägt und dem Modell echte Fähigkeiten zur Inferenz mit „physischer Bedeutung“ verleiht.
Aktionssraum-Supervision: Das Training konzentriert sich auf die Gesamtstruktur der Trajektorie statt auf triviale hochfrequente Details, was die Konvergenzeffizienz erheblich steigert.
DMuon verteilte Optimierung: Systemoptimierungen auf niedriger Ebene reduzierten die heterogenen Berechnungskosten um das 100-fache und machten diese komplexe Trainingsformel auf großen Clustern praktikabel.
Ein neues Zeitalter der verkörperten Intelligenz
X Square Robot hat die Modellgewichte, den Trainingscode und die Datenschnittstellen für Wall-OSS-0.5 vollständig als Open Source bereitgestellt.
Branchenanalysten weisen darauf hin, dass diese Veröffentlichung das Entwicklungsparadigma der verkörperten Intelligenz neu definiert und den Fokus von „Einzelaufgaben-Erfolgsquoten“ auf „Transfer allgemeiner physischer Intuition“ verschiebt. Für Forscher und Entwickler markiert dies den Beginn einer neuen Phase für Foundation Models – definiert durch „Reproduzierbarkeit, Verifizierbarkeit und Hinterfragbarkeit“ –, was den Einsatz von Allzweckrobotern in komplexen realen Umgebungen erheblich beschleunigen wird.
Verwandter Artikel
KI-Agenten durchbrechen Hugging-Face-Sandbox mit autonomem Angriffs- und Abwehrprotokoll
In jüngster Zeit hat Hugging Face einen umfassenden technischen Zeitplan veröffentlicht, der einen weithin gemeldeten Sicherheitsvorfall bei einem KI-Agenten detailliert beschreibt. Das autonome System, das mit OpenAI-Modellen entwickelt wurde, führt
Doubao Mobile bringt das Nubia NaviX Ultra auf den Markt, das als weltweit erstes Flaggschiff mit KI-Agenten beworben wird.
Ni Fei, CEO von Navea, gab bekannt, dass das Smartphone der nächsten Generation, Doubao, unter der Marke „Navea NaviX Ultra“, im September auf den Markt kommen wird. Als weltweit erstes Flaggschiff mit einem KI-Smart-Agenten markiert es einen bedeute
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Im Mai 2026 erzielte Chinas Sektors für verkörperte Intelligenz (Embodied Intelligence) einen bedeutenden Meilenstein mit der Open-Source-Veröffentlichung des neuesten Vision-Language-Action (VLA)-Modells Wall-OSS-0.5 durch X Square Robot. Abweichend von der Branchenüblichkeit einer Feinabstimmung vor der Prüfung ermöglicht dieses Modell den Zero-Shot-Einsatz auf physischen Robotern ohne aufgabenbezogene Anpassungen.

Vom maßgeschneiderten Skript zur allgemeinen Intelligenz
Das Feld der verkörperten Intelligenz war lange Zeit mit einer versteckten Einschränkung konfrontiert: Die meisten Modelle erfordern umfangreiche Feinabstimmungen für spezifische Aufgaben vor der Bewertung, was es schwierig macht, zwischen echter Verallgemeinerung und bloßem Skriptverhalten zu unterscheiden.
X Square Robot adressiert dies mit Wall-OSS-0.5. Das Modell wurde auf über 20 Robotertypen, Millionen von Trajektoriendatensätzen und einem multimodalen Korpus mit 90 Millionen Einträgen vortrainiert und ohne aufgabenbezogene Feinabstimmung direkt auf echten Robotern bereitgestellt. Das Team bewertete seine Leistung in 17 komplexen Aufgaben, darunter semantisches Verständnis, das Manipulieren starrer und flexibler Objekte sowie Präzisionsoperationen.
Schlüsselhighlight: Ein großer Sprung in der Vortraining
Testergebnisse zeigen, dass Wall-OSS-0.5 die aktuellen Erwartungen übertrifft:
Zero-Shot-Bereitstellung: Ohne Feinabstimmung erreichte eine Version mit 400.000 Vortrainingsschritten in vier von 17 Zero-Shot-Aufgaben Werte über 80/100. Bemerkenswerterweise erzielte es einen Wert von 82 bei der Aufgabe „Zug festziehen“, eine Herausforderung mit flexiblen Objekten, die während des Vortrainings nicht auftrat.
Verbessertes Feinabstimmungspotenzial: Bei gezielter Feinabstimmung zeigt Wall-OSS-0.5 eine außergewöhnliche Lerneffizienz. Im Vergleich zum Branchenstandard π0.5 führt es mit einem Durchschnitt von 17,5 Punkten unter demselben Datenbudget, wobei Präzisionsaufgaben wie das präzise Einfügen eine fast zehnfache Verbesserung der Erfolgsraten aufweisen.
Fähigkeitsevolution, kein Abbau: Experimente zeigen, dass nach intensivem Aktionstraining die multimodalen Wahrnehmungsfähigkeiten des Modells intakt bleiben und sich in der visuellen Positionsbestimmung und Schlussfolgerung einer „reformierenden“ Evolution unterziehen.
Vier Kerntechnologien schaffen einen Wettbewerbsvorteil
Die Leistung von Wall-OSS-0.5 resultiert aus vier grundlegenden Innovationen:
Gradientenbrücke: Durch das direkte Einbringen von Aktionssupervisionssignalen in den Vortrainings-Backbone vereint das Modell „Sehen, Sprechen und Handeln“ auf der Darstellungsebene.
Visueller Ausrichtungstokenizer: Dies stellt sicher, dass jeder Aktionstoken klare visuelle Semantik trägt und dem Modell echte Fähigkeiten zur Inferenz mit „physischer Bedeutung“ verleiht.
Aktionssraum-Supervision: Das Training konzentriert sich auf die Gesamtstruktur der Trajektorie statt auf triviale hochfrequente Details, was die Konvergenzeffizienz erheblich steigert.
DMuon verteilte Optimierung: Systemoptimierungen auf niedriger Ebene reduzierten die heterogenen Berechnungskosten um das 100-fache und machten diese komplexe Trainingsformel auf großen Clustern praktikabel.
Ein neues Zeitalter der verkörperten Intelligenz
X Square Robot hat die Modellgewichte, den Trainingscode und die Datenschnittstellen für Wall-OSS-0.5 vollständig als Open Source bereitgestellt.
Branchenanalysten weisen darauf hin, dass diese Veröffentlichung das Entwicklungsparadigma der verkörperten Intelligenz neu definiert und den Fokus von „Einzelaufgaben-Erfolgsquoten“ auf „Transfer allgemeiner physischer Intuition“ verschiebt. Für Forscher und Entwickler markiert dies den Beginn einer neuen Phase für Foundation Models – definiert durch „Reproduzierbarkeit, Verifizierbarkeit und Hinterfragbarkeit“ –, was den Einsatz von Allzweckrobotern in komplexen realen Umgebungen erheblich beschleunigen wird.
KI-Agenten durchbrechen Hugging-Face-Sandbox mit autonomem Angriffs- und Abwehrprotokoll
In jüngster Zeit hat Hugging Face einen umfassenden technischen Zeitplan veröffentlicht, der einen weithin gemeldeten Sicherheitsvorfall bei einem KI-Agenten detailliert beschreibt. Das autonome System, das mit OpenAI-Modellen entwickelt wurde, führt
Doubao Mobile bringt das Nubia NaviX Ultra auf den Markt, das als weltweit erstes Flaggschiff mit KI-Agenten beworben wird.
Ni Fei, CEO von Navea, gab bekannt, dass das Smartphone der nächsten Generation, Doubao, unter der Marke „Navea NaviX Ultra“, im September auf den Markt kommen wird. Als weltweit erstes Flaggschiff mit einem KI-Smart-Agenten markiert es einen bedeute












