Hogar
El Gran Modelo Encarnado Doméstico Wall-OSS-0.5 hace una gran aparición con código abierto: Implementación de cero disparos después del preentrenamiento
En mayo de 2026, el sector de la inteligencia encarnada de China alcanzó un hito significativo con el lanzamiento de código abierto por parte de X Square Robot de su más reciente modelo de Visión-Lenguaje-Acción (VLA), Wall-OSS-0.5. Rompiendo con la norma de la industria de realizar un ajuste fino previo a los exámenes, este modelo permite el despliegue sin ensayo (zero-shot) en robots físicos sin ajustes específicos para la tarea.

Del cambio de scripts personalizados a la inteligencia general
El campo de la inteligencia encarnada ha luchado durante mucho tiempo con una limitación oculta: la mayoría de los modelos requieren un ajuste fino extenso para tareas específicas antes de la evaluación, lo que dificulta distinguir entre una generalización verdadera y un comportamiento meramente programado.
X Square Robot aborda esto con Wall-OSS-0.5. Preentrenado en más de 20 tipos de robots, millones de conjuntos de datos de trayectorias y un corpus multimodal de 90 millones de entradas, el modelo se implementó directamente en robots reales sin un ajuste fino específico para la tarea. El equipo evaluó su rendimiento en 17 tareas complejas, incluyendo comprensión semántica, manipulación de objetos rígidos y flexibles, y operaciones de precisión.
Aspectos destacados clave: un gran salto en el preentrenamiento
Los resultados de las pruebas demuestran que Wall-OSS-0.5 supera las expectativas actuales:
Despliegue sin ensayo (Zero-Shot): Sin ajuste fino, una versión con 400k pasos de preentrenamiento obtuvo una puntuación superior a 80/100 en cuatro de las 17 tareas sin ensayo. Cabe destacar que obtuvo una puntuación de 82 en la tarea de "apretar la cuerda", un desafío de objetos flexibles no encontrado durante el preentrenamiento.
Potencial mejorado de ajuste fino: Cuando se aplica un ajuste fino dirigido, Wall-OSS-0.5 muestra una eficiencia de aprendizaje excepcional. En comparación con el punto de referencia de la industria π0.5, lidera por un promedio de 17.5 puntos bajo el mismo presupuesto de datos, con tareas de precisión como la inserción precisa que muestran una mejora de casi un orden de magnitud en las tasas de éxito.
Evolución de capacidades, no degradación: Los experimentos revelan que, tras un entrenamiento intensivo en acciones, las capacidades de percepción multimodal del modelo permanecen intactas y experimentan una evolución "reformista" en el posicionamiento visual y el razonamiento.
Cuatro tecnologías fundamentales establecen una ventaja competitiva
El rendimiento de Wall-OSS-0.5 se deriva de cuatro innovaciones fundamentales:
Puente de gradientes: Al inyectar señales de supervisión de acción directamente en la columna vertebral del preentrenamiento, el modelo unifica "ver, hablar y actuar" a nivel de representación.
Tokenizador de alineación visual: Esto asegura que cada token de acción lleve una semántica visual clara, otorgando al modelo capacidades genuinas de inferencia con "significado físico".
Supervisión del espacio de acción: El entrenamiento se centra en la estructura general de la trayectoria en lugar de detalles triviales de alta frecuencia, lo que aumenta significativamente la eficiencia de convergencia.
Optimización distribuida DMuon: Las optimizaciones de sistemas de bajo nivel redujeron los costos de computación heterogénea en 100 veces, haciendo viable esta fórmula de entrenamiento compleja en clústeres a gran escala.
Una nueva era para la inteligencia encarnada
X Square Robot ha abierto completamente los pesos del modelo, el código de entrenamiento y las interfaces de conjuntos de datos para Wall-OSS-0.5.
Los analistas de la industria señalan que este lanzamiento redefine el paradigma de desarrollo de la inteligencia encarnada, desplazando el enfoque desde las "tasas de éxito de tareas individuales" hacia la "transferencia de intuición física general". Para investigadores y desarrolladores, esto marca el inicio de una nueva fase para los modelos fundamentales, definida por la "reproducibilidad, verificabilidad y capacidad de desafío", lo que acelerará significativamente el despliegue de robots de propósito general en entornos del mundo real complejos.
Artículo relacionado
Los agentes de IA vulneran el sandbox de Hugging Face con un registro autónomo de ataque y defensa
Recientemente, Hugging Face publicó una cronología técnica exhaustiva que detalla una ampliamente reportada brecha de un agente de IA. El sistema autónomo, desarrollado utilizando modelos de OpenAI, ejecutó aproximadamente 17.600 operaciones durante
Últimas 24 horas para exhibirse en TechCrunch Disrupt 2026
Las reservas de mesas para la exposición expiran esta noche, viernes 18 de septiembre, a las 11:59 p. m. PT. Después de este plazo, ya no podrás añadir tu startup al Salón de Exposiciones.Las mesas son limitadas y se asignan por orden de llegada. Las
Doubao Mobile lanza el Nubia NaviX Ultra, comercializado como el primer buque insignia de agente de IA del mundo
Ni Fei, director ejecutivo de Navea, reveló que el próximo smartphone de nueva generación de Doubao, comercializado como «Navea NaviX Ultra», se lanzará en septiembre. Posicionado como el primer teléfono inteligente insignia con agente de inteligenci
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En mayo de 2026, el sector de la inteligencia encarnada de China alcanzó un hito significativo con el lanzamiento de código abierto por parte de X Square Robot de su más reciente modelo de Visión-Lenguaje-Acción (VLA), Wall-OSS-0.5. Rompiendo con la norma de la industria de realizar un ajuste fino previo a los exámenes, este modelo permite el despliegue sin ensayo (zero-shot) en robots físicos sin ajustes específicos para la tarea.

Del cambio de scripts personalizados a la inteligencia general
El campo de la inteligencia encarnada ha luchado durante mucho tiempo con una limitación oculta: la mayoría de los modelos requieren un ajuste fino extenso para tareas específicas antes de la evaluación, lo que dificulta distinguir entre una generalización verdadera y un comportamiento meramente programado.
X Square Robot aborda esto con Wall-OSS-0.5. Preentrenado en más de 20 tipos de robots, millones de conjuntos de datos de trayectorias y un corpus multimodal de 90 millones de entradas, el modelo se implementó directamente en robots reales sin un ajuste fino específico para la tarea. El equipo evaluó su rendimiento en 17 tareas complejas, incluyendo comprensión semántica, manipulación de objetos rígidos y flexibles, y operaciones de precisión.
Aspectos destacados clave: un gran salto en el preentrenamiento
Los resultados de las pruebas demuestran que Wall-OSS-0.5 supera las expectativas actuales:
Despliegue sin ensayo (Zero-Shot): Sin ajuste fino, una versión con 400k pasos de preentrenamiento obtuvo una puntuación superior a 80/100 en cuatro de las 17 tareas sin ensayo. Cabe destacar que obtuvo una puntuación de 82 en la tarea de "apretar la cuerda", un desafío de objetos flexibles no encontrado durante el preentrenamiento.
Potencial mejorado de ajuste fino: Cuando se aplica un ajuste fino dirigido, Wall-OSS-0.5 muestra una eficiencia de aprendizaje excepcional. En comparación con el punto de referencia de la industria π0.5, lidera por un promedio de 17.5 puntos bajo el mismo presupuesto de datos, con tareas de precisión como la inserción precisa que muestran una mejora de casi un orden de magnitud en las tasas de éxito.
Evolución de capacidades, no degradación: Los experimentos revelan que, tras un entrenamiento intensivo en acciones, las capacidades de percepción multimodal del modelo permanecen intactas y experimentan una evolución "reformista" en el posicionamiento visual y el razonamiento.
Cuatro tecnologías fundamentales establecen una ventaja competitiva
El rendimiento de Wall-OSS-0.5 se deriva de cuatro innovaciones fundamentales:
Puente de gradientes: Al inyectar señales de supervisión de acción directamente en la columna vertebral del preentrenamiento, el modelo unifica "ver, hablar y actuar" a nivel de representación.
Tokenizador de alineación visual: Esto asegura que cada token de acción lleve una semántica visual clara, otorgando al modelo capacidades genuinas de inferencia con "significado físico".
Supervisión del espacio de acción: El entrenamiento se centra en la estructura general de la trayectoria en lugar de detalles triviales de alta frecuencia, lo que aumenta significativamente la eficiencia de convergencia.
Optimización distribuida DMuon: Las optimizaciones de sistemas de bajo nivel redujeron los costos de computación heterogénea en 100 veces, haciendo viable esta fórmula de entrenamiento compleja en clústeres a gran escala.
Una nueva era para la inteligencia encarnada
X Square Robot ha abierto completamente los pesos del modelo, el código de entrenamiento y las interfaces de conjuntos de datos para Wall-OSS-0.5.
Los analistas de la industria señalan que este lanzamiento redefine el paradigma de desarrollo de la inteligencia encarnada, desplazando el enfoque desde las "tasas de éxito de tareas individuales" hacia la "transferencia de intuición física general". Para investigadores y desarrolladores, esto marca el inicio de una nueva fase para los modelos fundamentales, definida por la "reproducibilidad, verificabilidad y capacidad de desafío", lo que acelerará significativamente el despliegue de robots de propósito general en entornos del mundo real complejos.
Los agentes de IA vulneran el sandbox de Hugging Face con un registro autónomo de ataque y defensa
Recientemente, Hugging Face publicó una cronología técnica exhaustiva que detalla una ampliamente reportada brecha de un agente de IA. El sistema autónomo, desarrollado utilizando modelos de OpenAI, ejecutó aproximadamente 17.600 operaciones durante
Últimas 24 horas para exhibirse en TechCrunch Disrupt 2026
Las reservas de mesas para la exposición expiran esta noche, viernes 18 de septiembre, a las 11:59 p. m. PT. Después de este plazo, ya no podrás añadir tu startup al Salón de Exposiciones.Las mesas son limitadas y se asignan por orden de llegada. Las
Doubao Mobile lanza el Nubia NaviX Ultra, comercializado como el primer buque insignia de agente de IA del mundo
Ni Fei, director ejecutivo de Navea, reveló que el próximo smartphone de nueva generación de Doubao, comercializado como «Navea NaviX Ultra», se lanzará en septiembre. Posicionado como el primer teléfono inteligente insignia con agente de inteligenci











