Hogar
El primer modelo mundial de inteligencia incorporada a nivel de eventos pone fin al aprendizaje fotograma a fotograma para los robots
El 29 de mayo, el equipo de Variable Robot presentó WALL-WM, el primer modelo del mundo de inteligencia incorporada basado en la «predicción a nivel de eventos». Este modelo se aleja de los grandes modelos de inteligencia incorporada convencionales, que aprenden acciones fotograma a fotograma a lo largo del tiempo, y cambia la unidad de predicción del modelo del mundo a eventos semánticos. Esto marca una nueva etapa en la forma en que los robots comprenden y llevan a cabo tareas.

En la industria actual de la inteligencia incorporada, los modelos dominantes de visión-lenguaje-acción (VLA) suelen tomar una imagen y una instrucción actuales para predecir un bloque de acción de longitud fija. Este enfoque de entrenamiento fotograma a fotograma a menudo hace que los robots se centren en movimientos físicos menores, perdiendo de vista el objetivo final de la acción. Cuando se enfrentan a situaciones como el cambio de tazas o mesas, los robots suelen fallar debido a la falta de generalización. Para abordar este punto débil del sector, el equipo de Variable señaló en su artículo académico que la información de texto, visión y acción existe de forma natural en diferentes escalas temporales y geometrías múltiples en el mundo real. Forzarlas a un único espacio compartido puede dañar fácilmente el prior geométrico preentrenado.
Para hacer frente a este reto, el modelo de mundo WALL-WM introduce un innovador mecanismo de entrenamiento y ejecución centrado en eventos. Desglosa tareas complejas en eventos semánticamente claros, como alcanzar, agarrar y mover. En funcionamiento, el modelo ya no calcula de forma rígida el siguiente fotograma de la imagen. En su lugar, primero simula cómo cambiará el mundo debido al siguiente evento y, a continuación, traduce con precisión ese cambio visual en la trayectoria de movimiento del brazo robótico.

Para garantizar que esta nueva arquitectura pueda implementarse de forma fiable en el mundo físico, el equipo de Variable Robot llevó a cabo una serie de revisiones de ingeniería exhaustivas. El sistema admite el cambio flexible entre el «modo de eventos» (con salida de acciones de longitud variable) y el «modo unificado» (con control de bucle cerrado en tiempo real) sobre los mismos pesos base. También logra un acoplamiento unidireccional entre los modelos de vídeo y los modelos de acción, lo que evita que los valiosos datos dinámicos previos de los vídeos de Internet se vean sesgados prematuramente por los datos de acción. Para la percepción geométrica a través de múltiples cámaras, el modelo introduce máscaras de frustum y máscaras tubulares, lo que obliga a la IA a desarrollar una correspondencia geométrica tridimensional verdadera entre vistas. Para abordar la latencia en la toma de decisiones, emplea una nueva técnica de «decodificación por cadena de pensamiento escalonada» que reduce significativamente el retraso en la decodificación al tiempo que mantiene la interpretabilidad lógica.

Artículo relacionado
Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics
El 29 de mayo, el equipo de Variable Robot presentó WALL-WM, el primer modelo del mundo de inteligencia incorporada basado en la «predicción a nivel de eventos». Este modelo se aleja de los grandes modelos de inteligencia incorporada convencionales, que aprenden acciones fotograma a fotograma a lo largo del tiempo, y cambia la unidad de predicción del modelo del mundo a eventos semánticos. Esto marca una nueva etapa en la forma en que los robots comprenden y llevan a cabo tareas.

En la industria actual de la inteligencia incorporada, los modelos dominantes de visión-lenguaje-acción (VLA) suelen tomar una imagen y una instrucción actuales para predecir un bloque de acción de longitud fija. Este enfoque de entrenamiento fotograma a fotograma a menudo hace que los robots se centren en movimientos físicos menores, perdiendo de vista el objetivo final de la acción. Cuando se enfrentan a situaciones como el cambio de tazas o mesas, los robots suelen fallar debido a la falta de generalización. Para abordar este punto débil del sector, el equipo de Variable señaló en su artículo académico que la información de texto, visión y acción existe de forma natural en diferentes escalas temporales y geometrías múltiples en el mundo real. Forzarlas a un único espacio compartido puede dañar fácilmente el prior geométrico preentrenado.
Para hacer frente a este reto, el modelo de mundo WALL-WM introduce un innovador mecanismo de entrenamiento y ejecución centrado en eventos. Desglosa tareas complejas en eventos semánticamente claros, como alcanzar, agarrar y mover. En funcionamiento, el modelo ya no calcula de forma rígida el siguiente fotograma de la imagen. En su lugar, primero simula cómo cambiará el mundo debido al siguiente evento y, a continuación, traduce con precisión ese cambio visual en la trayectoria de movimiento del brazo robótico.

Para garantizar que esta nueva arquitectura pueda implementarse de forma fiable en el mundo físico, el equipo de Variable Robot llevó a cabo una serie de revisiones de ingeniería exhaustivas. El sistema admite el cambio flexible entre el «modo de eventos» (con salida de acciones de longitud variable) y el «modo unificado» (con control de bucle cerrado en tiempo real) sobre los mismos pesos base. También logra un acoplamiento unidireccional entre los modelos de vídeo y los modelos de acción, lo que evita que los valiosos datos dinámicos previos de los vídeos de Internet se vean sesgados prematuramente por los datos de acción. Para la percepción geométrica a través de múltiples cámaras, el modelo introduce máscaras de frustum y máscaras tubulares, lo que obliga a la IA a desarrollar una correspondencia geométrica tridimensional verdadera entre vistas. Para abordar la latencia en la toma de decisiones, emplea una nueva técnica de «decodificación por cadena de pensamiento escalonada» que reduce significativamente el retraso en la decodificación al tiempo que mantiene la interpretabilidad lógica.

Las gafas inteligentes de Apple podrían debutar en la WWDC27, destacando la protección de la privacidad
El informe de Mark Gurman de Bloomberg indica que las gafas inteligentes de Apple, con el nombre en código N50, están previstas para su presentación en la WWDC27 de junio de 2027, con un lanzamiento al público previsto para el otoño de 2027. Original
Dentro de los detalles revelados sobre el Gemini de próxima generación: Potencia de cálculo limitada, los equipos internos discreparon sobre las prioridades de desarrollo y la asignación de recursos
Los informes indican que el lanzamiento del tan esperado modelo Gemini de próxima generación de Google ha sido pospuesto. Los desacuerdos internos sobre las prioridades de desarrollo y la asignación de recursos, combinados con una capacidad de comput
OpenAI descarta preocupaciones por la desaceleración del crecimiento y afirma que múltiples unidades de negocio están acelerando
En respuesta a la escrutinio externo sobre el desaceleramiento del crecimiento de las ventas y el incumplimiento de las metas internas, el líder en inteligencia artificial, OpenAI, emitió una declaración contundente el martes 28 de abril. La empresa
Finally, a model that doesn't just process frames like a slow-motion video player! 🤖 This event-level prediction sounds way more efficient for real-time robot actions. I've been waiting for something that breaks free from the traditional frame-by-frame bottleneck. Can't wait to see how WALL-WM handles unpredictable environments. #AI #Robotics











