Maison
Le modèle LPM1.0 permet de générer en temps réel des vidéos de personnes numériques interactives à partir d’une seule image.

Les chercheurs ont officiellement présenté le modèle LPM1.0, un projet conçu pour générer en temps réel des vidéos montrant des personnes qui parlent, écoutent ou chantent à partir d’une seule image de référence. Sa principale avancée réside dans le traitement multimodal : il synchronise les entrées texte, audio et image afin de créer des scènes dynamiques présentant une synchronisation labiale précise, des expressions faciales nuancées et des transitions émotionnelles naturelles. Ce modèle s’intègre directement aux principales plateformes d’IA vocale telles que ChatGPT et Doubao, transformant les conversations vocales traditionnelles en expériences interactives en temps réel accompagnées de retours visuels.
Sur le plan technique, LPM1.0 utilise une méthode de « conditionnement identitaire à multiple granularités » pour extraire des caractéristiques détaillées des matériaux de référence sous différents angles et expressions, ce qui élimine la nécessité pour le modèle de générer indépendamment des éléments complexes tels que les dents, les rides ou les profils latéraux. Cela améliore considérablement le traitement entre différents styles, permettant de créer instantanément des visages photoréalistes, des animations ou des personnages de jeux 3D sans avoir à reformerater le modèle. De plus, ce modèle prend en charge la transmission par streaming, assurant ainsi la stabilité du système même lors de la génération de vidéos d’une durée allant jusqu’à 45 minutes.
En ce qui concerne la logique d’interaction, LPM1.0 détecte avec précision trois états de conversation : lorsqu’il écoute, il génère des expressions adaptées telles que des hochements de tête ou des changements de regard ; lorsqu’il parle, il déclenche les mouvements du corps et des lèvres en fonction de l’audio ; et en état d’inactivité, il produit des comportements de repos naturels selon les indications textuelles. La responsable du projet, Zeng Ailing, a indiqué que LPM1.0 convient non seulement aux conversations en temps réel mais aussi à la génération de vidéos pilotées par l’audio hors ligne, offrant ainsi une redondance technique utile pour les podcasts et la production cinématographique.
Malgré son fort potentiel d’application, l’équipe de développement souligne que LPM1.0 reste un projet de recherche et qu’il n’existe pour l’instant aucun plan pour rendre public le code ou les poids du modèle. Les chercheurs reconnaissent une différence qualitative entre les vidéos générées et des enregistrements réels, et les risques inhérents liés aux deepfakes ne peuvent être ignorés. L’importance de cette étude réside dans son rôle de guide pour l’évolution future des systèmes d’IA, qui évoluent d’une interaction logique unidimensionnelle vers une interaction multidimensionnelle intégrant des réponses émotionnelles, des contacts visuels et une incarnation visuelle.
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (0)

Les chercheurs ont officiellement présenté le modèle LPM1.0, un projet conçu pour générer en temps réel des vidéos montrant des personnes qui parlent, écoutent ou chantent à partir d’une seule image de référence. Sa principale avancée réside dans le traitement multimodal : il synchronise les entrées texte, audio et image afin de créer des scènes dynamiques présentant une synchronisation labiale précise, des expressions faciales nuancées et des transitions émotionnelles naturelles. Ce modèle s’intègre directement aux principales plateformes d’IA vocale telles que ChatGPT et Doubao, transformant les conversations vocales traditionnelles en expériences interactives en temps réel accompagnées de retours visuels.
Sur le plan technique, LPM1.0 utilise une méthode de « conditionnement identitaire à multiple granularités » pour extraire des caractéristiques détaillées des matériaux de référence sous différents angles et expressions, ce qui élimine la nécessité pour le modèle de générer indépendamment des éléments complexes tels que les dents, les rides ou les profils latéraux. Cela améliore considérablement le traitement entre différents styles, permettant de créer instantanément des visages photoréalistes, des animations ou des personnages de jeux 3D sans avoir à reformerater le modèle. De plus, ce modèle prend en charge la transmission par streaming, assurant ainsi la stabilité du système même lors de la génération de vidéos d’une durée allant jusqu’à 45 minutes.
En ce qui concerne la logique d’interaction, LPM1.0 détecte avec précision trois états de conversation : lorsqu’il écoute, il génère des expressions adaptées telles que des hochements de tête ou des changements de regard ; lorsqu’il parle, il déclenche les mouvements du corps et des lèvres en fonction de l’audio ; et en état d’inactivité, il produit des comportements de repos naturels selon les indications textuelles. La responsable du projet, Zeng Ailing, a indiqué que LPM1.0 convient non seulement aux conversations en temps réel mais aussi à la génération de vidéos pilotées par l’audio hors ligne, offrant ainsi une redondance technique utile pour les podcasts et la production cinématographique.
Malgré son fort potentiel d’application, l’équipe de développement souligne que LPM1.0 reste un projet de recherche et qu’il n’existe pour l’instant aucun plan pour rendre public le code ou les poids du modèle. Les chercheurs reconnaissent une différence qualitative entre les vidéos générées et des enregistrements réels, et les risques inhérents liés aux deepfakes ne peuvent être ignorés. L’importance de cette étude réside dans son rôle de guide pour l’évolution future des systèmes d’IA, qui évoluent d’une interaction logique unidimensionnelle vers une interaction multidimensionnelle intégrant des réponses émotionnelles, des contacts visuels et une incarnation visuelle.
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc











