Lar
Modelo mundial de inteligência incorporada em nível de evento, inédito no mundo, põe fim ao aprendizado quadro a quadro para robôs
Em 29 de maio, a equipe da Variable Robot apresentou o WALL-WM, o primeiro modelo de mundo com inteligência incorporada do mundo baseado em “previsão em nível de evento”. Esse modelo rompe com os grandes modelos incorporados convencionais, que aprendem ações quadro a quadro ao longo do tempo, mudando, em vez disso, a unidade de previsão do modelo do mundo para eventos semânticos. Isso marca uma nova etapa na forma como os robôs compreendem e executam tarefas.

Na indústria atual de inteligência incorporada, os modelos convencionais de visão-linguagem-ação (VLA) normalmente utilizam uma imagem atual e uma instrução para prever um bloco de ação de duração fixa. Essa abordagem de treinamento quadro a quadro frequentemente faz com que os robôs se concentrem em movimentos físicos menores, perdendo de vista o objetivo final da ação. Quando confrontados com cenários como a troca de copos ou mesas, os robôs frequentemente falham devido à falta de generalização. Para resolver esse ponto fraco do setor, a equipe da Variable destacou em seu artigo acadêmico que as informações de texto, visão e ação existem naturalmente em diferentes escalas de tempo e geometrias múltiplas no mundo real. Forçá-las a um único espaço compartilhado pode facilmente prejudicar o prior geométrico pré-treinado.
Para enfrentar esse desafio, o modelo de mundo WALL-WM introduz um mecanismo inovador de treinamento e execução centrado em eventos. Ele divide tarefas complexas em junções de eventos semanticamente claras, como alcançar, agarrar e mover. Em operação, o modelo não calcula mais rigidamente o próximo quadro de imagem. Em vez disso, ele primeiro simula como o mundo mudará devido ao próximo evento e, em seguida, traduz com precisão essa mudança visual na trajetória de movimento do braço robótico.

Para garantir que essa nova arquitetura possa ser implantada de forma confiável no mundo físico, a equipe do Variable Robot realizou uma série de reformulações de engenharia de ponta. O sistema suporta a alternância flexível entre o “modo de evento” (com saída de ação de comprimento variável) e o “modo unificado” (com controle de malha fechada em tempo real) nos mesmos pesos de base. Ele também alcança um acoplamento unidirecional entre modelos de vídeo e modelos de ação, evitando que valiosas informações dinâmicas prévias de vídeos da internet sejam prematuramente influenciadas pelos dados de ação. Para a percepção geométrica entre múltiplas câmeras, o modelo introduz máscaras de frustum e máscaras tubulares, forçando a IA a desenvolver uma correspondência geométrica tridimensional verdadeira entre as visões. Para lidar com a latência de decisão, ele emprega uma nova técnica de “decodificação em cadeia de pensamento escalonada” que reduz significativamente o atraso na decodificação, mantendo a interpretabilidade lógica.

Artigo relacionado
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Recomendações de tópicos especiais relacionados
Comentários (1)
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
Em 29 de maio, a equipe da Variable Robot apresentou o WALL-WM, o primeiro modelo de mundo com inteligência incorporada do mundo baseado em “previsão em nível de evento”. Esse modelo rompe com os grandes modelos incorporados convencionais, que aprendem ações quadro a quadro ao longo do tempo, mudando, em vez disso, a unidade de previsão do modelo do mundo para eventos semânticos. Isso marca uma nova etapa na forma como os robôs compreendem e executam tarefas.

Na indústria atual de inteligência incorporada, os modelos convencionais de visão-linguagem-ação (VLA) normalmente utilizam uma imagem atual e uma instrução para prever um bloco de ação de duração fixa. Essa abordagem de treinamento quadro a quadro frequentemente faz com que os robôs se concentrem em movimentos físicos menores, perdendo de vista o objetivo final da ação. Quando confrontados com cenários como a troca de copos ou mesas, os robôs frequentemente falham devido à falta de generalização. Para resolver esse ponto fraco do setor, a equipe da Variable destacou em seu artigo acadêmico que as informações de texto, visão e ação existem naturalmente em diferentes escalas de tempo e geometrias múltiplas no mundo real. Forçá-las a um único espaço compartilhado pode facilmente prejudicar o prior geométrico pré-treinado.
Para enfrentar esse desafio, o modelo de mundo WALL-WM introduz um mecanismo inovador de treinamento e execução centrado em eventos. Ele divide tarefas complexas em junções de eventos semanticamente claras, como alcançar, agarrar e mover. Em operação, o modelo não calcula mais rigidamente o próximo quadro de imagem. Em vez disso, ele primeiro simula como o mundo mudará devido ao próximo evento e, em seguida, traduz com precisão essa mudança visual na trajetória de movimento do braço robótico.

Para garantir que essa nova arquitetura possa ser implantada de forma confiável no mundo físico, a equipe do Variable Robot realizou uma série de reformulações de engenharia de ponta. O sistema suporta a alternância flexível entre o “modo de evento” (com saída de ação de comprimento variável) e o “modo unificado” (com controle de malha fechada em tempo real) nos mesmos pesos de base. Ele também alcança um acoplamento unidirecional entre modelos de vídeo e modelos de ação, evitando que valiosas informações dinâmicas prévias de vídeos da internet sejam prematuramente influenciadas pelos dados de ação. Para a percepção geométrica entre múltiplas câmeras, o modelo introduz máscaras de frustum e máscaras tubulares, forçando a IA a desenvolver uma correspondência geométrica tridimensional verdadeira entre as visões. Para lidar com a latência de decisão, ele emprega uma nova técnica de “decodificação em cadeia de pensamento escalonada” que reduz significativamente o atraso na decodificação, mantendo a interpretabilidade lógica.

Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











