Lar
O AntGroup torna o LingBot-Video, o primeiro modelo de base de vídeo para inteligência incorporada, de código aberto
Em 9 de julho, o Ant Group disponibilizou como código aberto o LingBot-Video, o primeiro modelo de base de geração de vídeo de código aberto do mundo, construído com base na arquitetura Mixture-of-Experts (MoE) e desenvolvido especificamente para a inteligência incorporada. O modelo redefine o pré-treinamento de vídeo ao se concentrar nas necessidades centrais dos robôs e da inteligência incorporada, proporcionando ganhos sistemáticos em eficiência de raciocínio, plausibilidade física, compreensão de ações e conclusão de tarefas. Ele oferece uma nova base de código aberto para que os modelos fundamentais de vídeo vão além da criação de conteúdo digital e avancem para a inteligência incorporada.
No benchmark RBench, desenvolvido em conjunto pela Universidade de Pequim e pela ByteDance, o LingBot-Video obteve uma pontuação de 0,620, superando o Wan2.6 (0,607), o Seedance1.5Pro (0,584) e o Cosmos3Super (0,581). O RBench, um benchmark de avaliação abrangente para vídeos de manipulação robótica, avalia especificamente se um modelo é capaz de gerar comportamentos robóticos que sigam as leis da física do mundo real. Esse resultado indica que o LingBot-Video é mais eficaz em preservar a racionalidade das ações e a integridade da execução de tarefas ao gerar vídeos relacionados a robôs.

(Legenda da figura: O LingBot-Video alcança o melhor desempenho no RBench)
Para verificar ainda mais a capacidade do LingBot-Video de modelar mudanças no mundo físico, o Ant Group o avaliou em um benchmark interno em duas dimensões: qualidade geral e domínio incorporado. Os resultados mostram que, em comparação com cinco modelos de código aberto — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 e LTX-2.3 —, o LingBot-Video supera os principais modelos de referência no domínio incorporado.

(Legenda da figura: Avaliação abrangente mostra que o LingBot-Video apresenta maior compreensão física e consistência de ação em cenários incorporados)
Nos últimos anos, os modelos de geração de vídeo avançaram rapidamente em termos de qualidade visual, fluidez e expressão criativa. No entanto, para a inteligência incorporada, um vídeo que pareça realista e tenha movimentos suaves pode não refletir as leis físicas reais, dificultando o suporte à previsão contínua, ao planejamento e à execução de tarefas por robôs. Ao mesmo tempo, a inteligência incorporada também exige maior eficiência de raciocínio para se adaptar à interação em tempo real e aos ciclos de controle.
Isso levou a geração de vídeos a evoluir por dois caminhos distintos: um voltado para o cinema, voltado à criação de conteúdo; o outro voltado para robôs, voltado à compreensão, previsão e interação com o mundo físico. O LingBot-Video representa uma exploração significativa do Ant Group em um novo caminho para a geração de vídeos adaptados à inteligência incorporada.
O LingBot-Video introduz inovações sistemáticas em arquitetura, dados e treinamento.
Em termos de arquitetura, o LingBot-Video emprega um design DiT + MoE, substituindo as arquiteturas densas tradicionais pelo MoE. Isso permite que o modelo amplie sua capacidade, mantendo os custos de inferência controláveis. Com 30 bilhões de parâmetros, o modelo ativa apenas cerca de 3 bilhões durante a geração, oferecendo aproximadamente três vezes a eficiência de raciocínio de uma arquitetura densa do mesmo tamanho. Esse projeto confere ao modelo expressividade visual a partir de parâmetros em grande escala, ao mesmo tempo em que atende melhor às demandas de eficiência da inteligência incorporada.
Quanto aos dados, o LingBot-Video desenvolveu um mecanismo de perfilagem de dados, incorporando dados relacionados a robôs, como VLA, VLN e Ego, além de uma enorme quantidade de vídeos da internet, abrangendo cenários que incluem manipulação hábil, mobilidade robótica e interações em primeira pessoa, totalizando 70.000 horas de dados incorporados. Esses dados ajudam o modelo a aprender a relação entre ações e mudanças ambientais, em vez de apenas a textura superficial e o estilo visual dos vídeos.

No treinamento, o LingBot-Video introduziu um sistema de recompensa de aprendizado por reforço multidimensional. Além de métricas convencionais como estética, obediência a comandos e consistência de movimento, o modelo também leva em conta a plausibilidade física e a conclusão de tarefas, tornando os resultados gerados mais consistentes com a física do mundo real e mais próximos das necessidades dos robôs que realizam tarefas no mundo real.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 9 de julho, o Ant Group disponibilizou como código aberto o LingBot-Video, o primeiro modelo de base de geração de vídeo de código aberto do mundo, construído com base na arquitetura Mixture-of-Experts (MoE) e desenvolvido especificamente para a inteligência incorporada. O modelo redefine o pré-treinamento de vídeo ao se concentrar nas necessidades centrais dos robôs e da inteligência incorporada, proporcionando ganhos sistemáticos em eficiência de raciocínio, plausibilidade física, compreensão de ações e conclusão de tarefas. Ele oferece uma nova base de código aberto para que os modelos fundamentais de vídeo vão além da criação de conteúdo digital e avancem para a inteligência incorporada.
No benchmark RBench, desenvolvido em conjunto pela Universidade de Pequim e pela ByteDance, o LingBot-Video obteve uma pontuação de 0,620, superando o Wan2.6 (0,607), o Seedance1.5Pro (0,584) e o Cosmos3Super (0,581). O RBench, um benchmark de avaliação abrangente para vídeos de manipulação robótica, avalia especificamente se um modelo é capaz de gerar comportamentos robóticos que sigam as leis da física do mundo real. Esse resultado indica que o LingBot-Video é mais eficaz em preservar a racionalidade das ações e a integridade da execução de tarefas ao gerar vídeos relacionados a robôs.

(Legenda da figura: O LingBot-Video alcança o melhor desempenho no RBench)
Para verificar ainda mais a capacidade do LingBot-Video de modelar mudanças no mundo físico, o Ant Group o avaliou em um benchmark interno em duas dimensões: qualidade geral e domínio incorporado. Os resultados mostram que, em comparação com cinco modelos de código aberto — NVIDIA Cosmos3, Wan2.2A14B, LongCat-Video, Hunyuan Video1.5 e LTX-2.3 —, o LingBot-Video supera os principais modelos de referência no domínio incorporado.

(Legenda da figura: Avaliação abrangente mostra que o LingBot-Video apresenta maior compreensão física e consistência de ação em cenários incorporados)
Nos últimos anos, os modelos de geração de vídeo avançaram rapidamente em termos de qualidade visual, fluidez e expressão criativa. No entanto, para a inteligência incorporada, um vídeo que pareça realista e tenha movimentos suaves pode não refletir as leis físicas reais, dificultando o suporte à previsão contínua, ao planejamento e à execução de tarefas por robôs. Ao mesmo tempo, a inteligência incorporada também exige maior eficiência de raciocínio para se adaptar à interação em tempo real e aos ciclos de controle.
Isso levou a geração de vídeos a evoluir por dois caminhos distintos: um voltado para o cinema, voltado à criação de conteúdo; o outro voltado para robôs, voltado à compreensão, previsão e interação com o mundo físico. O LingBot-Video representa uma exploração significativa do Ant Group em um novo caminho para a geração de vídeos adaptados à inteligência incorporada.
O LingBot-Video introduz inovações sistemáticas em arquitetura, dados e treinamento.
Em termos de arquitetura, o LingBot-Video emprega um design DiT + MoE, substituindo as arquiteturas densas tradicionais pelo MoE. Isso permite que o modelo amplie sua capacidade, mantendo os custos de inferência controláveis. Com 30 bilhões de parâmetros, o modelo ativa apenas cerca de 3 bilhões durante a geração, oferecendo aproximadamente três vezes a eficiência de raciocínio de uma arquitetura densa do mesmo tamanho. Esse projeto confere ao modelo expressividade visual a partir de parâmetros em grande escala, ao mesmo tempo em que atende melhor às demandas de eficiência da inteligência incorporada.
Quanto aos dados, o LingBot-Video desenvolveu um mecanismo de perfilagem de dados, incorporando dados relacionados a robôs, como VLA, VLN e Ego, além de uma enorme quantidade de vídeos da internet, abrangendo cenários que incluem manipulação hábil, mobilidade robótica e interações em primeira pessoa, totalizando 70.000 horas de dados incorporados. Esses dados ajudam o modelo a aprender a relação entre ações e mudanças ambientais, em vez de apenas a textura superficial e o estilo visual dos vídeos.

No treinamento, o LingBot-Video introduziu um sistema de recompensa de aprendizado por reforço multidimensional. Além de métricas convencionais como estética, obediência a comandos e consistência de movimento, o modelo também leva em conta a plausibilidade física e a conclusão de tarefas, tornando os resultados gerados mais consistentes com a física do mundo real e mais próximos das necessidades dos robôs que realizam tarefas no mundo real.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











