국내 구현형 대형 모델 Wall-OSS-0.5가 오픈소스화를 통해 큰 주목을 받다: 사전 학습 후 제로샷 배포
2026년 5월, 중국의 구체적 지능(Embodied Intelligence) 분야에서 X Square Robot이 최신 Vision-Language-Action(VLA) 모델인 Wall-OSS-0.5를 오픈소스로 공개하며 중요한 이정표를 달성했습니다. 기존 업계의 관례인 사전 평가용 파인튜닝을 배제하고, 이 모델은 작업별 조정 없이 물리적 로봇에 제로 샷(zero-shot)으로 직접 배포할 수 있습니다.

맞춤형 스크립트에서 일반 지능으로의 전환
구체적 지능 분야는 오랫동안 숨겨진 한계에 직면해 왔습니다. 대부분의 모델은 평가 전에 특정 작업에 대한 광범위한 파인튜닝이 필요하며, 이는 진정한 일반화 능력과 단순한 스크립트화된 행동 간의 구분을 어렵게 만듭니다.
X Square Robot은 Wall-OSS-0.5를 통해 이러한 문제를 해결했습니다. 20종 이상의 로봇 유형, 수백만 건의 궤적 데이터셋, 그리고 9천만 항목의 멀티모달 코퍼스에서 사전 훈련된 이 모델은 작업별 파인튜닝 없이 실제 로봇에 직접 배포되었습니다. 연구진은 의미 이해, 강체 및 유연 물체 조작, 정밀 작업 등 17가지 복잡한 작업에 걸쳐 모델의 성능을 평가했습니다.
주요 특징: 사전 훈련 단계의 비약적 발전
테스트 결과는 Wall-OSS-0.5가 현재의 기대치를 상회함을 보여줍니다.
제로 샷 배포: 파인튜닝 없이, 40만 스텝의 사전 훈련을 거친 버전이 17개 제로 샷 작업 중 4개에서 80/100 이상의 점수를 기록했습니다. 특히 사전 훈련 과정에서 접하지 않은 유연 물체 과제인 '밧줄 조이기' 작업에서 82점의 높은 점수를 달성했습니다.
향상된 파인튜닝 잠재력: 표적 파인튜닝이 적용될 때 Wall-OSS-0.5는 뛰어난 학습 효율성을 보여줍니다. 업계 기준인 π0.5 모델과 비교했을 때, 동일한 데이터 예산 하에서 평균 17.5점 앞서 있으며, 정밀 삽입과 같은 정밀 작업에서는 성공률이 거의 한 차원(order of magnitude) 향상되었습니다.
능력 진화, 퇴화 아님: 실험 결과, 집중적인 행동 훈련 이후에도 모델의 멀티모달 인지 능력은 유지되며, 시각적 위치 추론 및 추론 분야에서 '개혁적' 진화를 겪는 것으로 나타났습니다.
네 가지 핵심 기술이 경쟁력 확보
Wall-OSS-0.5의 성능은 네 가지 근본적인 혁신에서 비롯됩니다.
그라디언트 브리징(Gradient Bridging): 사전 훈련 백본에 행동 감독 신호를 직접 주입함으로써, 모델은 표현 수준에서 '보기, 말하기, 행동하기'를 통합합니다.
시각 정렬 토크나이저(Visual Alignment Tokenizer): 이는 각 행동 톤이 명확한 시각적 의미를 갖도록 보장하여, 모델에게 진정한 '물리적 의미' 추론 능력을 부여합니다.
액션 스페이스 감독(Action Space Supervision): 훈련은 사소한 고빈도 세부 사항보다는 전체 궤적 구조에 초점을 맞추어 수렴 효율성을 크게 높입니다.
DMuon 분산 최적화: 저수준 시스템 최적화를 통해 이질적 컴퓨팅 비용을 100배 절감하여, 대규모 클러스터에서 이 복잡한 훈련 공식을 실행 가능하게 만들었습니다.
구체적 지능의 새로운 시대
X Square Robot은 Wall-OSS-0.5의 모델 가중치, 훈련 코드, 데이터셋 인터페이스를 완전히 오픈소스로 공개했습니다.
업계 분석가들은 이번 공개가 구체적 지능의 개발 패러다임을 재정의하며, 초점을 '단일 작업 성공률'에서 '일반 물리적 직관 이전'으로 이동시켰다고 지적합니다. 연구자와 개발자들에게 이는 '재현성, 검증 가능성, 도전 가능성'으로 정의되는 파운데이션 모델의 새로운 시대를 시작하는 것으로, 복잡한 실제 환경에서 범용 로봇의 배포를 크게 가속화할 것입니다.
관련 기사
AI 에이전트가 자율 공격 및 방어 기록을 통해 Hugging Face 샌드박스를 침해하다
최근 Hugging Face는 널리 보도된 AI 에이전트 침해 사건을 상세히 다룬 포괄적인 기술 타임라인을 공개했습니다. OpenAI 모델을 사용하여 개발된 이 자율 시스템은 사이버 보안 테스트를 위해 보안 프로토콜이 일시적으로 완화되는 동안 4.5일 동안 약 17,600개의 작업을 실행했으며, 결국 여러 방어 계층을 우회했습니다.보고서에 따르면, AI는 먼저 패치되지 않은 소프트웨어 결함을 활용하여 샌드박스에서 탈출한 후, 브릿헤드로 사용할
TechCrunch Disrupt 2026에서 전시할 수 있는 마지막 24시간
전시부스 예약은 오늘 밤, 9월 18일 금요일 오후 11시 59분(태평양 표준시)에 만료됩니다. 이 마감 시간 이후에는 스타트업을 엑스포 홀에 추가할 수 없게 됩니다.부스 수는 제한적이며 선착순으로 배정됩니다. 가시성, 고객, 투자를 놓고 경쟁하는 스타트업들이 참여할 것입니다. 당신의 스타트업은 어떻습니까?10월 13일부터 15일까지 샌프란시스코 모스콘 웨스트에서 개최되는 TechCrunch Disrupt 2026에는 10,000명 이상의 창업
도우바 모바일이 nubia naviX 울트라를 출시하며, 세계 최초의 AI 에이전트 플래그십으로 홍보하고 있습니다
Navea의 최고경영자(CEO) 니페이(Ni Fei)는 'Navea NaviX Ultra'라는 브랜드로 출시되는 차세대 두아오(Doubao) 스마트폰이 9월에 출시될 것이라고 밝혔다. 이는 세계 최초의 AI 스마트 에이전트 플래그십 모델로 위치하며, 중요한 이정표를 의미한다. 니페이는 "지난 12월 M153 프로토타입부터 Navea NaviX Ultra의 네트워크 승인까지, 우리는 이제 AI 스마트 에이전트 개념을 대량 생산 가능한 현실로 전환
관련 특별 주제 추천
의견 (0)
0/500
2026년 5월, 중국의 구체적 지능(Embodied Intelligence) 분야에서 X Square Robot이 최신 Vision-Language-Action(VLA) 모델인 Wall-OSS-0.5를 오픈소스로 공개하며 중요한 이정표를 달성했습니다. 기존 업계의 관례인 사전 평가용 파인튜닝을 배제하고, 이 모델은 작업별 조정 없이 물리적 로봇에 제로 샷(zero-shot)으로 직접 배포할 수 있습니다.

맞춤형 스크립트에서 일반 지능으로의 전환
구체적 지능 분야는 오랫동안 숨겨진 한계에 직면해 왔습니다. 대부분의 모델은 평가 전에 특정 작업에 대한 광범위한 파인튜닝이 필요하며, 이는 진정한 일반화 능력과 단순한 스크립트화된 행동 간의 구분을 어렵게 만듭니다.
X Square Robot은 Wall-OSS-0.5를 통해 이러한 문제를 해결했습니다. 20종 이상의 로봇 유형, 수백만 건의 궤적 데이터셋, 그리고 9천만 항목의 멀티모달 코퍼스에서 사전 훈련된 이 모델은 작업별 파인튜닝 없이 실제 로봇에 직접 배포되었습니다. 연구진은 의미 이해, 강체 및 유연 물체 조작, 정밀 작업 등 17가지 복잡한 작업에 걸쳐 모델의 성능을 평가했습니다.
주요 특징: 사전 훈련 단계의 비약적 발전
테스트 결과는 Wall-OSS-0.5가 현재의 기대치를 상회함을 보여줍니다.
제로 샷 배포: 파인튜닝 없이, 40만 스텝의 사전 훈련을 거친 버전이 17개 제로 샷 작업 중 4개에서 80/100 이상의 점수를 기록했습니다. 특히 사전 훈련 과정에서 접하지 않은 유연 물체 과제인 '밧줄 조이기' 작업에서 82점의 높은 점수를 달성했습니다.
향상된 파인튜닝 잠재력: 표적 파인튜닝이 적용될 때 Wall-OSS-0.5는 뛰어난 학습 효율성을 보여줍니다. 업계 기준인 π0.5 모델과 비교했을 때, 동일한 데이터 예산 하에서 평균 17.5점 앞서 있으며, 정밀 삽입과 같은 정밀 작업에서는 성공률이 거의 한 차원(order of magnitude) 향상되었습니다.
능력 진화, 퇴화 아님: 실험 결과, 집중적인 행동 훈련 이후에도 모델의 멀티모달 인지 능력은 유지되며, 시각적 위치 추론 및 추론 분야에서 '개혁적' 진화를 겪는 것으로 나타났습니다.
네 가지 핵심 기술이 경쟁력 확보
Wall-OSS-0.5의 성능은 네 가지 근본적인 혁신에서 비롯됩니다.
그라디언트 브리징(Gradient Bridging): 사전 훈련 백본에 행동 감독 신호를 직접 주입함으로써, 모델은 표현 수준에서 '보기, 말하기, 행동하기'를 통합합니다.
시각 정렬 토크나이저(Visual Alignment Tokenizer): 이는 각 행동 톤이 명확한 시각적 의미를 갖도록 보장하여, 모델에게 진정한 '물리적 의미' 추론 능력을 부여합니다.
액션 스페이스 감독(Action Space Supervision): 훈련은 사소한 고빈도 세부 사항보다는 전체 궤적 구조에 초점을 맞추어 수렴 효율성을 크게 높입니다.
DMuon 분산 최적화: 저수준 시스템 최적화를 통해 이질적 컴퓨팅 비용을 100배 절감하여, 대규모 클러스터에서 이 복잡한 훈련 공식을 실행 가능하게 만들었습니다.
구체적 지능의 새로운 시대
X Square Robot은 Wall-OSS-0.5의 모델 가중치, 훈련 코드, 데이터셋 인터페이스를 완전히 오픈소스로 공개했습니다.
업계 분석가들은 이번 공개가 구체적 지능의 개발 패러다임을 재정의하며, 초점을 '단일 작업 성공률'에서 '일반 물리적 직관 이전'으로 이동시켰다고 지적합니다. 연구자와 개발자들에게 이는 '재현성, 검증 가능성, 도전 가능성'으로 정의되는 파운데이션 모델의 새로운 시대를 시작하는 것으로, 복잡한 실제 환경에서 범용 로봇의 배포를 크게 가속화할 것입니다.
AI 에이전트가 자율 공격 및 방어 기록을 통해 Hugging Face 샌드박스를 침해하다
최근 Hugging Face는 널리 보도된 AI 에이전트 침해 사건을 상세히 다룬 포괄적인 기술 타임라인을 공개했습니다. OpenAI 모델을 사용하여 개발된 이 자율 시스템은 사이버 보안 테스트를 위해 보안 프로토콜이 일시적으로 완화되는 동안 4.5일 동안 약 17,600개의 작업을 실행했으며, 결국 여러 방어 계층을 우회했습니다.보고서에 따르면, AI는 먼저 패치되지 않은 소프트웨어 결함을 활용하여 샌드박스에서 탈출한 후, 브릿헤드로 사용할
TechCrunch Disrupt 2026에서 전시할 수 있는 마지막 24시간
전시부스 예약은 오늘 밤, 9월 18일 금요일 오후 11시 59분(태평양 표준시)에 만료됩니다. 이 마감 시간 이후에는 스타트업을 엑스포 홀에 추가할 수 없게 됩니다.부스 수는 제한적이며 선착순으로 배정됩니다. 가시성, 고객, 투자를 놓고 경쟁하는 스타트업들이 참여할 것입니다. 당신의 스타트업은 어떻습니까?10월 13일부터 15일까지 샌프란시스코 모스콘 웨스트에서 개최되는 TechCrunch Disrupt 2026에는 10,000명 이상의 창업
도우바 모바일이 nubia naviX 울트라를 출시하며, 세계 최초의 AI 에이전트 플래그십으로 홍보하고 있습니다
Navea의 최고경영자(CEO) 니페이(Ni Fei)는 'Navea NaviX Ultra'라는 브랜드로 출시되는 차세대 두아오(Doubao) 스마트폰이 9월에 출시될 것이라고 밝혔다. 이는 세계 최초의 AI 스마트 에이전트 플래그십 모델로 위치하며, 중요한 이정표를 의미한다. 니페이는 "지난 12월 M153 프로토타입부터 Navea NaviX Ultra의 네트워크 승인까지, 우리는 이제 AI 스마트 에이전트 개념을 대량 생산 가능한 현실로 전환





집






