세계 최초의 이벤트 기반 체화 지능 세계 모델, 로봇의 프레임 단위 학습 시대를 마감하다
5월 29일, Variable Robot 팀은 “이벤트 수준 예측”을 기반으로 한 세계 최초의 체화 지능 세계 모델인 WALL-WM을 공개했다. 이 모델은 시간의 흐름에 따라 프레임 단위로 동작을 학습하는 기존의 신체 기반 대형 모델에서 벗어나, 세계 모델의 예측 단위를 의미론적 이벤트로 전환했습니다. 이는 로봇이 작업을 이해하고 수행하는 방식에 있어 새로운 단계를 의미합니다.

현재 신체 기반 지능 산업에서 주류인 비전-언어-행동(VLA) 모델은 일반적으로 현재 이미지와 지시를 입력받아 고정 길이의 행동 블록을 예측합니다. 이러한 프레임 단위 훈련 방식은 로봇이 사소한 신체 움직임에만 집중하게 하고 행동의 궁극적인 목표를 놓치게 하는 경우가 많습니다. 컵이나 테이블이 바뀌는 것과 같은 상황에 직면했을 때, 로봇은 일반화 능력 부족으로 인해 자주 실패한다. 이러한 업계의 고질적인 문제를 해결하기 위해 Variable 팀은 학술 논문을 통해 텍스트, 비전, 행동 정보가 현실 세계에서 자연스럽게 서로 다른 시간 척도와 다양체 기하학에 존재한다고 지적했다. 이들을 단일 공유 공간에 강제로 끼워 맞추면 사전 훈련된 기하학적 선험적 지식이 쉽게 손상될 수 있습니다.
이러한 과제를 해결하기 위해 WALL-WM 세계 모델은 혁신적인 이벤트 중심 훈련 및 실행 메커니즘을 도입합니다. 이 모델은 복잡한 작업을 '도달', '잡기', '이동'과 같이 의미론적으로 명확한 이벤트 단위로 분해합니다. 실행 시, 이 모델은 더 이상 다음 이미지 프레임을 경직되게 계산하지 않습니다. 대신, 먼저 다음 이벤트로 인해 세계가 어떻게 변화할지 시뮬레이션한 다음, 그 시각적 변화를 로봇 팔의 운동 궤적으로 정확하게 변환합니다.

이 새로운 아키텍처가 실제 환경에 안정적으로 적용될 수 있도록, Variable Robot 팀은 일련의 철저한 엔지니어링 개편을 수행했습니다. 이 시스템은 동일한 기본 가중치를 기반으로 "이벤트 모드"(가변 길이 동작 출력)와 "통합 모드"(실시간 폐쇄 루프 제어) 간 유연한 전환을 지원합니다. 또한 비디오 모델과 동작 모델 간의 단방향 결합을 구현하여, 인터넷 비디오에서 얻은 귀중한 동적 선행 정보가 동작 데이터에 의해 조기에 편향되는 것을 방지합니다. 여러 카메라에 걸친 기하학적 인식을 위해, 이 모델은 프러스텀 마스크와 튜브형 마스크를 도입하여 AI가 크로스 뷰(cross-view)의 진정한 3차원 기하학적 대응 관계를 개발하도록 유도합니다. 결정 지연 문제를 해결하기 위해, 논리적 해석 가능성을 유지하면서 디코딩 지연을 크게 줄여주는 새로운 "단계적 사고 사슬 디코딩(stepped chain-of-thought decoding)" 기법을 사용합니다.

관련 기사
애플 스마트 글래스가 WWDC27에서 공개될 수 있으며, 프라이버시 보호를 강조할 것으로 예상된다
블룸버그의 마크 거먼은 시제품명 N50인 애플의 스마트 글래스가 2027년 6월 WWDC27에서 공개될 예정이며, 2027년 가을에 소매 시장 출시가 예상된다고 보도했다. 원래 올해 말과 2027년 초 출시가 목표였으나, 제품의 추가 정교화와 프라이버시 프로토콜 강화를 위해 출시 시기가 연기되었다.프라이버시는 애플의 스마트 글래스 전략의 핵심 기둥이다. 메타 등 경쟁사의 프라이버시 논란에서 교훈을 얻은 애플은 강력한 기능과 정책을 도입하고 있
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
관련 특별 주제 추천
의견 (1)
0/500
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
5월 29일, Variable Robot 팀은 “이벤트 수준 예측”을 기반으로 한 세계 최초의 체화 지능 세계 모델인 WALL-WM을 공개했다. 이 모델은 시간의 흐름에 따라 프레임 단위로 동작을 학습하는 기존의 신체 기반 대형 모델에서 벗어나, 세계 모델의 예측 단위를 의미론적 이벤트로 전환했습니다. 이는 로봇이 작업을 이해하고 수행하는 방식에 있어 새로운 단계를 의미합니다.

현재 신체 기반 지능 산업에서 주류인 비전-언어-행동(VLA) 모델은 일반적으로 현재 이미지와 지시를 입력받아 고정 길이의 행동 블록을 예측합니다. 이러한 프레임 단위 훈련 방식은 로봇이 사소한 신체 움직임에만 집중하게 하고 행동의 궁극적인 목표를 놓치게 하는 경우가 많습니다. 컵이나 테이블이 바뀌는 것과 같은 상황에 직면했을 때, 로봇은 일반화 능력 부족으로 인해 자주 실패한다. 이러한 업계의 고질적인 문제를 해결하기 위해 Variable 팀은 학술 논문을 통해 텍스트, 비전, 행동 정보가 현실 세계에서 자연스럽게 서로 다른 시간 척도와 다양체 기하학에 존재한다고 지적했다. 이들을 단일 공유 공간에 강제로 끼워 맞추면 사전 훈련된 기하학적 선험적 지식이 쉽게 손상될 수 있습니다.
이러한 과제를 해결하기 위해 WALL-WM 세계 모델은 혁신적인 이벤트 중심 훈련 및 실행 메커니즘을 도입합니다. 이 모델은 복잡한 작업을 '도달', '잡기', '이동'과 같이 의미론적으로 명확한 이벤트 단위로 분해합니다. 실행 시, 이 모델은 더 이상 다음 이미지 프레임을 경직되게 계산하지 않습니다. 대신, 먼저 다음 이벤트로 인해 세계가 어떻게 변화할지 시뮬레이션한 다음, 그 시각적 변화를 로봇 팔의 운동 궤적으로 정확하게 변환합니다.

이 새로운 아키텍처가 실제 환경에 안정적으로 적용될 수 있도록, Variable Robot 팀은 일련의 철저한 엔지니어링 개편을 수행했습니다. 이 시스템은 동일한 기본 가중치를 기반으로 "이벤트 모드"(가변 길이 동작 출력)와 "통합 모드"(실시간 폐쇄 루프 제어) 간 유연한 전환을 지원합니다. 또한 비디오 모델과 동작 모델 간의 단방향 결합을 구현하여, 인터넷 비디오에서 얻은 귀중한 동적 선행 정보가 동작 데이터에 의해 조기에 편향되는 것을 방지합니다. 여러 카메라에 걸친 기하학적 인식을 위해, 이 모델은 프러스텀 마스크와 튜브형 마스크를 도입하여 AI가 크로스 뷰(cross-view)의 진정한 3차원 기하학적 대응 관계를 개발하도록 유도합니다. 결정 지연 문제를 해결하기 위해, 논리적 해석 가능성을 유지하면서 디코딩 지연을 크게 줄여주는 새로운 "단계적 사고 사슬 디코딩(stepped chain-of-thought decoding)" 기법을 사용합니다.

애플 스마트 글래스가 WWDC27에서 공개될 수 있으며, 프라이버시 보호를 강조할 것으로 예상된다
블룸버그의 마크 거먼은 시제품명 N50인 애플의 스마트 글래스가 2027년 6월 WWDC27에서 공개될 예정이며, 2027년 가을에 소매 시장 출시가 예상된다고 보도했다. 원래 올해 말과 2027년 초 출시가 목표였으나, 제품의 추가 정교화와 프라이버시 프로토콜 강화를 위해 출시 시기가 연기되었다.프라이버시는 애플의 스마트 글래스 전략의 핵심 기둥이다. 메타 등 경쟁사의 프라이버시 논란에서 교훈을 얻은 애플은 강력한 기능과 정책을 도입하고 있
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics





집






