Lar
O modelo LPM1.0 gera vídeo de humano digital interativo em tempo real a partir de uma única imagem.

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
Artigo relacionado
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro
Recomendações de tópicos especiais relacionados
Comentários (0)

Os pesquisadores apresentaram oficialmente o modelo LPM1.0, um projeto criado para gerar vídeos em tempo real de pessoas falando, ouvindo e cantando a partir de uma única imagem de referência. Sua principal inovação reside no processamento multimodal — sincronizando entradas de texto, áudio e imagem para criar cenas dinâmicas com sincronização labial precisa, expressões faciais detalhadas e transições emocionais naturais. O modelo se integra diretamente a plataformas líderes de IA de voz, como ChatGPT e Doubao, transformando conversas convencionais em experiências interativas em tempo real com feedback visual.
Tecnicamente, o LPM1.0 utiliza o método de “condicionamento de identidade em múltiplas granularidades” para extrair características detalhadas dos materiais de referência a partir de diversos ângulos e expressões, eliminando a necessidade de o modelo gerar independentemente elementos complexos como dentes, rugas ou perfis laterais. Isso melhora significativamente o processamento entre diferentes estilos, permitindo a geração imediata de rostos fotorrealistas, animações ou personagens de jogos 3D sem a necessidade de retreinamento. O modelo também suporta transmissão em streaming, garantindo estabilidade do sistema mesmo ao gerar vídeos com duração de até 45 minutos.
Quanto à lógica de interação, o LPM1.0 detecta com precisão três estados de conversação: enquanto ouve, ele gera expressões que refletem a atenção, como acenos de cabeça ou mudanças no olhar; enquanto fala, ele controla os movimentos do corpo e dos lábios com base no áudio; e quando está inativo, ele produz comportamentos naturais de descanso conforme as instruções fornecidas no texto. A gerente de projeto Zeng Ailing destacou que o LPM1.0 é adequado não apenas para conversas em tempo real, mas também para a geração offline de vídeos baseados em áudio, oferecendo redundância técnica para podcasts e produção cinematográfica.
Apesar de seu grande potencial aplicacional, a equipe de desenvolvimento ressalta que o LPM1.0 ainda é um projeto de pesquisa e não há planos atuais para disponibilizar publicamente o código ou os pesos do modelo. Os pesquisadores reconhecem uma diferença qualitativa entre os vídeos gerados e as imagens reais, além dos riscos inerentes associados aos deepfakes, que não podem ser ignorados. A importância deste estudo está em mapear a evolução futura dos sistemas de IA — passando de interações lógicas simples para interações multidimensionais que incluem respostas emocionais, contato visual e representação visual.
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA
Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho
Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro











