Hogar
El modelo LPM1.0 genera video de personas digitales interactivas en tiempo real a partir de una sola imagen.

Los investigadores han presentado oficialmente el modelo LPM1.0, un proyecto cuyo objetivo es generar videos en tiempo real de personas hablando, escuchando y cantando a partir de una sola imagen de referencia. Su principal avance radica en el procesamiento multimodal: sincroniza las entradas de texto, audio e imagen para crear escenas dinámicas con sincronización labial precisa, expresiones faciales detalladas y transiciones emocionales naturales. Este modelo se integra directamente con plataformas líderes de inteligencia artificial de voz como ChatGPT y Doubao, convirtiendo las conversaciones tradicionales por voz en experiencias interactivas en tiempo real con retroalimentación visual.
Técnicamente, LPM1.0 utiliza el método de “condicionamiento de identidad multigranular” para extraer características detalladas de los materiales de referencia desde múltiples ángulos y expresiones, lo que elimina la necesidad de que el modelo genere por sí mismo elementos complejos como dientes, arrugas o perfiles laterales. Esto mejora enormemente el procesamiento entre diferentes estilos, permitiendo generar rostros fotorrealistas, animaciones o personajes de videojuegos en 3D de forma instantánea sin necesidad de reentrenamiento. Además, el modelo admite transmisión por streaming, lo que garantiza la estabilidad del sistema incluso al generar videos de hasta 45 minutos de duración.
En cuanto a la lógica de interacción, LPM1.0 detecta con precisión tres estados de conversación: mientras escucha, muestra expresiones como asentir o desviar la mirada; mientras habla, controla los movimientos del cuerpo y de los labios en función del audio; y cuando está inactivo, genera comportamientos naturales de descanso según las indicaciones textuales. La directora del proyecto, Zeng Ailing, señaló que LPM1.0 es adecuado no solo para conversaciones en tiempo real, sino también para la generación de videos por audio sin conexión a Internet, ofreciendo redundancia técnica para podcasts y producciones cinematográficas.
A pesar de su gran potencial aplicativo, el equipo de desarrollo destaca que LPM1.0 sigue siendo un proyecto de investigación y, por el momento, no hay planes para hacer públicos el código ni los pesos del modelo. Los investigadores reconocen una diferencia cualitativa entre los videos generados y las grabaciones reales, además de que los riesgos inherentes relacionados con los deepfake no pueden pasarse por alto. La importancia de este estudio radica en trazar la evolución futura de los sistemas de inteligencia artificial, pasando de interacciones lógicas simples a interacciones multidimensionales que incluyen respuestas emocionales, contacto visual y representación visual.
Artículo relacionado
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Los investigadores han presentado oficialmente el modelo LPM1.0, un proyecto cuyo objetivo es generar videos en tiempo real de personas hablando, escuchando y cantando a partir de una sola imagen de referencia. Su principal avance radica en el procesamiento multimodal: sincroniza las entradas de texto, audio e imagen para crear escenas dinámicas con sincronización labial precisa, expresiones faciales detalladas y transiciones emocionales naturales. Este modelo se integra directamente con plataformas líderes de inteligencia artificial de voz como ChatGPT y Doubao, convirtiendo las conversaciones tradicionales por voz en experiencias interactivas en tiempo real con retroalimentación visual.
Técnicamente, LPM1.0 utiliza el método de “condicionamiento de identidad multigranular” para extraer características detalladas de los materiales de referencia desde múltiples ángulos y expresiones, lo que elimina la necesidad de que el modelo genere por sí mismo elementos complejos como dientes, arrugas o perfiles laterales. Esto mejora enormemente el procesamiento entre diferentes estilos, permitiendo generar rostros fotorrealistas, animaciones o personajes de videojuegos en 3D de forma instantánea sin necesidad de reentrenamiento. Además, el modelo admite transmisión por streaming, lo que garantiza la estabilidad del sistema incluso al generar videos de hasta 45 minutos de duración.
En cuanto a la lógica de interacción, LPM1.0 detecta con precisión tres estados de conversación: mientras escucha, muestra expresiones como asentir o desviar la mirada; mientras habla, controla los movimientos del cuerpo y de los labios en función del audio; y cuando está inactivo, genera comportamientos naturales de descanso según las indicaciones textuales. La directora del proyecto, Zeng Ailing, señaló que LPM1.0 es adecuado no solo para conversaciones en tiempo real, sino también para la generación de videos por audio sin conexión a Internet, ofreciendo redundancia técnica para podcasts y producciones cinematográficas.
A pesar de su gran potencial aplicativo, el equipo de desarrollo destaca que LPM1.0 sigue siendo un proyecto de investigación y, por el momento, no hay planes para hacer públicos el código ni los pesos del modelo. Los investigadores reconocen una diferencia cualitativa entre los videos generados y las grabaciones reales, además de que los riesgos inherentes relacionados con los deepfake no pueden pasarse por alto. La importancia de este estudio radica en trazar la evolución futura de los sistemas de inteligencia artificial, pasando de interacciones lógicas simples a interacciones multidimensionales que incluyen respuestas emocionales, contacto visual y representación visual.
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
MiniMax presenta el Programa de Equipo 10x para incentivar a expertos globales en IA
MiniMax (Xiyu Technology), el Laboratorio de Inteligencia Artificial General, ha lanzado oficialmente "10x Team", una iniciativa global de colaboración de talento. Este programa tiene como objetivo reclutar a los mejores expertos de diversas industri
Corea del Sur inicia la construcción del Centro Nacional de Cómputo de IA, invirtiendo 2,5 billones de wones con un objetivo para 2028
El medio surcoreano EtNews informa que la ceremonia de colocación de la primera piedra del Centro de Cómputo de IA de Corea (KOACC) se llevó a cabo el 3 de agosto en el parque de centros de datos Solar City, en Sunan, Jeollanam-do. Con una inversión











