Maison
Le grand modèle d'encodage domestique Wall-OSS-0.5 fait sensation avec l'open source : déploiement zéro-shot après pré-entraînement
En mai 2026, le secteur de l'intelligence incarnée en Chine a atteint une étape importante avec la publication open-source par X Square Robot de son dernier modèle Vision-Language-Action (VLA), Wall-OSS-0.5. S'écartant de la norme industrielle consistant à effectuer un ajustement fin avant les tests, ce modèle permet un déploiement en mode zéro-shot sur des robots physiques sans ajustements spécifiques à la tâche.

Du passage des scripts personnalisés à l'intelligence générale
Le domaine de l'intelligence incarnée a longtemps été confronté à une limitation cachée : la plupart des modèles nécessitent un ajustement fin approfondi pour des tâches spécifiques avant l'évaluation, ce qui rend difficile la distinction entre une véritable généralisation et un simple comportement scripté.
X Square Robot répond à ce défi avec Wall-OSS-0.5. Pré-entraîné sur plus de 20 types de robots, des millions de jeux de données de trajectoires et un corpus multimodal de 90 millions d'entrées, le modèle a été déployé directement sur des robots réels sans ajustement fin spécifique à la tâche. L'équipe a évalué ses performances sur 17 tâches complexes, notamment la compréhension sémantique, la manipulation d'objets rigides et flexibles, et les opérations de précision.
Points forts majeurs : une avancée significative dans le pré-entraînement
Les résultats des tests démontrent que Wall-OSS-0.5 dépasse les attentes actuelles :
Déploiement en mode zéro-shot : Sans ajustement fin, une version avec 400 000 étapes de pré-entraînement a obtenu un score supérieur à 80/100 sur quatre des 17 tâches en mode zéro-shot. Fait notable, elle a obtenu un score de 82 sur la tâche « nouer la corde », un défi concernant les objets flexibles qui n'avait pas été rencontré lors du pré-entraînement.
Potentiel d'ajustement fin amélioré : Lorsqu'un ajustement fin ciblé est appliqué, Wall-OSS-0.5 fait preuve d'une efficacité d'apprentissage exceptionnelle. Par rapport à la référence industrielle π0.5, il devance cette dernière en moyenne de 17,5 points avec le même budget de données, les tâches de précision comme l'insertion précise affichant une amélioration du taux de réussite de près d'un ordre de grandeur.
Évolution des capacités, et non dégradation : Les expériences révèlent qu'après un entraînement intensif aux actions, les capacités de perception multimodale du modèle restent intactes et subissent une évolution « réformatrice » en matière de positionnement visuel et de raisonnement.
Quatre technologies fondamentales établissent un avantage concurrentiel
Les performances de Wall-OSS-0.5 découlent de quatre innovations fondamentales :
Pont de gradients : En injectant directement des signaux de supervision des actions dans la structure de base du pré-entraînement, le modèle unifie « voir, parler et agir » au niveau de la représentation.
Tokeniseur d'alignement visuel : Cela garantit que chaque token d'action porte une sémantique visuelle claire, offrant au modèle de véritables capacités d'inférence « physique ».
Supervision de l'espace d'action : L'entraînement se concentre sur la structure globale de la trajectoire plutôt que sur des détails triviaux à haute fréquence, augmentant considérablement l'efficacité de la convergence.
Optimisation distribuée DMuon : Des optimisations système de bas niveau ont réduit les coûts de calcul hétérogène par un facteur 100, rendant cette formule d'entraînement complexe viable sur des clusters à grande échelle.
Une nouvelle ère pour l'intelligence incarnée
X Square Robot a entièrement open-sourcé les poids du modèle, le code d'entraînement et les interfaces de jeu de données pour Wall-OSS-0.5.
Les analystes de l'industrie notent que cette publication redéfinit le paradigme de développement de l'intelligence incarnée, déplaçant l'accent des « taux de réussite sur une tâche unique » vers le « transfert d'intuition physique générale ». Pour les chercheurs et les développeurs, cela marque le début d'une nouvelle phase pour les modèles fondamentaux – définis par « la reproductibilité, la vérifiabilité et la contestabilité » – qui accélérera considérablement le déploiement de robots polyvalents dans des environnements réels complexes.
Article connexe
Les agents d’IA contournent le bac à sable de Hugging Face grâce à un enregistrement autonome d’attaques et de défenses
Récemment, Hugging Face a publié une chronologie technique détaillée faisant le point sur une violation largement médiatisée d’un agent d’intelligence artificielle. Le système autonome, développé à l’aide de modèles OpenAI, a exécuté environ 17 600 o
Dernières 24 heures pour exposer à TechCrunch Disrupt 2026
Les réservations de tables d’exposition expirent ce soir, vendredi 18 septembre, à 23 h 59 (heure du Pacifique). Après cette date limite, vous ne pourrez plus ajouter votre startup à l’Expo Hall.Les tables sont limitées et attribuées selon le princip
Doubao Mobile lance le Nubia NaviX Ultra, présenté comme le premier smartphone haut de gamme au monde doté d’un agent d’intelligence artificielle.
Ni Fei, PDG de Navea, a révélé que le smartphone Doubao de nouvelle génération, commercialisé sous la marque « Navea NaviX Ultra », sera lancé en septembre. Positionné comme le premier smartphone phare au monde à intégrer un agent intelligent d’IA, i
Recommandations de sujets spéciaux liés
commentaires (0)
En mai 2026, le secteur de l'intelligence incarnée en Chine a atteint une étape importante avec la publication open-source par X Square Robot de son dernier modèle Vision-Language-Action (VLA), Wall-OSS-0.5. S'écartant de la norme industrielle consistant à effectuer un ajustement fin avant les tests, ce modèle permet un déploiement en mode zéro-shot sur des robots physiques sans ajustements spécifiques à la tâche.

Du passage des scripts personnalisés à l'intelligence générale
Le domaine de l'intelligence incarnée a longtemps été confronté à une limitation cachée : la plupart des modèles nécessitent un ajustement fin approfondi pour des tâches spécifiques avant l'évaluation, ce qui rend difficile la distinction entre une véritable généralisation et un simple comportement scripté.
X Square Robot répond à ce défi avec Wall-OSS-0.5. Pré-entraîné sur plus de 20 types de robots, des millions de jeux de données de trajectoires et un corpus multimodal de 90 millions d'entrées, le modèle a été déployé directement sur des robots réels sans ajustement fin spécifique à la tâche. L'équipe a évalué ses performances sur 17 tâches complexes, notamment la compréhension sémantique, la manipulation d'objets rigides et flexibles, et les opérations de précision.
Points forts majeurs : une avancée significative dans le pré-entraînement
Les résultats des tests démontrent que Wall-OSS-0.5 dépasse les attentes actuelles :
Déploiement en mode zéro-shot : Sans ajustement fin, une version avec 400 000 étapes de pré-entraînement a obtenu un score supérieur à 80/100 sur quatre des 17 tâches en mode zéro-shot. Fait notable, elle a obtenu un score de 82 sur la tâche « nouer la corde », un défi concernant les objets flexibles qui n'avait pas été rencontré lors du pré-entraînement.
Potentiel d'ajustement fin amélioré : Lorsqu'un ajustement fin ciblé est appliqué, Wall-OSS-0.5 fait preuve d'une efficacité d'apprentissage exceptionnelle. Par rapport à la référence industrielle π0.5, il devance cette dernière en moyenne de 17,5 points avec le même budget de données, les tâches de précision comme l'insertion précise affichant une amélioration du taux de réussite de près d'un ordre de grandeur.
Évolution des capacités, et non dégradation : Les expériences révèlent qu'après un entraînement intensif aux actions, les capacités de perception multimodale du modèle restent intactes et subissent une évolution « réformatrice » en matière de positionnement visuel et de raisonnement.
Quatre technologies fondamentales établissent un avantage concurrentiel
Les performances de Wall-OSS-0.5 découlent de quatre innovations fondamentales :
Pont de gradients : En injectant directement des signaux de supervision des actions dans la structure de base du pré-entraînement, le modèle unifie « voir, parler et agir » au niveau de la représentation.
Tokeniseur d'alignement visuel : Cela garantit que chaque token d'action porte une sémantique visuelle claire, offrant au modèle de véritables capacités d'inférence « physique ».
Supervision de l'espace d'action : L'entraînement se concentre sur la structure globale de la trajectoire plutôt que sur des détails triviaux à haute fréquence, augmentant considérablement l'efficacité de la convergence.
Optimisation distribuée DMuon : Des optimisations système de bas niveau ont réduit les coûts de calcul hétérogène par un facteur 100, rendant cette formule d'entraînement complexe viable sur des clusters à grande échelle.
Une nouvelle ère pour l'intelligence incarnée
X Square Robot a entièrement open-sourcé les poids du modèle, le code d'entraînement et les interfaces de jeu de données pour Wall-OSS-0.5.
Les analystes de l'industrie notent que cette publication redéfinit le paradigme de développement de l'intelligence incarnée, déplaçant l'accent des « taux de réussite sur une tâche unique » vers le « transfert d'intuition physique générale ». Pour les chercheurs et les développeurs, cela marque le début d'une nouvelle phase pour les modèles fondamentaux – définis par « la reproductibilité, la vérifiabilité et la contestabilité » – qui accélérera considérablement le déploiement de robots polyvalents dans des environnements réels complexes.
Les agents d’IA contournent le bac à sable de Hugging Face grâce à un enregistrement autonome d’attaques et de défenses
Récemment, Hugging Face a publié une chronologie technique détaillée faisant le point sur une violation largement médiatisée d’un agent d’intelligence artificielle. Le système autonome, développé à l’aide de modèles OpenAI, a exécuté environ 17 600 o
Dernières 24 heures pour exposer à TechCrunch Disrupt 2026
Les réservations de tables d’exposition expirent ce soir, vendredi 18 septembre, à 23 h 59 (heure du Pacifique). Après cette date limite, vous ne pourrez plus ajouter votre startup à l’Expo Hall.Les tables sont limitées et attribuées selon le princip
Doubao Mobile lance le Nubia NaviX Ultra, présenté comme le premier smartphone haut de gamme au monde doté d’un agent d’intelligence artificielle.
Ni Fei, PDG de Navea, a révélé que le smartphone Doubao de nouvelle génération, commercialisé sous la marque « Navea NaviX Ultra », sera lancé en septembre. Positionné comme le premier smartphone phare au monde à intégrer un agent intelligent d’IA, i











