Lar
O modelo LPM1.0 gera vídeo de humano digital interativo em tempo real a partir de uma única imagem.

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
Artigo relacionado
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Recomendações de tópicos especiais relacionados
Comentários (0)

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,











