Дом
Модель LPM1.0 создаёт видео с интерактивным цифровым человеком в реальном времени на основе одного изображения.

Исследователи официально представили модель LPM1.0 — проект, направленный на создание видео в реальном времени с изображениями людей, говорящих, слушающих или поющих, на основе одного исходного изображения. Ключевым прорывом этой модели является мультимодальная обработка: синхронизация текстовых, аудио- и визуальных данных для формирования динамичных сцен с точным синхронизацией губ, выразительными выражениями лица и естественными эмоциональными переходами. Модель может напрямую интегрироваться в ведущие платформы искусственного интеллекта для голосового общения, такие как ChatGPT и Doubao, превращая традиционные голосовые разговоры в интерактивный опыт с визуальным обратным связью.
С технической точки зрения LPM1.0 использует метод «условирования идентичности с множественной гранулярностью» для извлечения детальных характеристик из исходных материалов под разными углами и при различных выражениях лица, что позволяет избежать необходимости самостоятельного генерирования сложных элементов, таких как зубы, морщины или боковые профили. Это значительно улучшает возможности обработки различных стилей — позволяя мгновенно создавать фотореалистичные лица, анимации или персонажей в 3D-играх без повторной настройки модели. Кроме того, модель поддерживает потоковую передачу данных, обеспечивая стабильность работы даже при генерации видео продолжительностью до 45 минут.
Что касается логики взаимодействия, LPM1.0 точно определяет три состояния разговора: во время прослушивания она формирует соответствующие выражения лица, такие как кивки или изменение направления взгляда; во время речи — движения тела и губ в соответствии с аудиосигналом; в состоянии покоя — естественные поведенческие реакции на основе текстовых указаний. Руководитель проекта Цзэн Айлин отметила, что LPM1.0 подходит не только для реального времени общения, но и для офлайн-генерации видео на основе аудио, обеспечивая техническую надежность для подкастов и кинопроизводства.
Несмотря на значительный потенциал применения, команда разработчиков подчеркивает, что LPM1.0 пока остается исследовательским проектом, и в настоящее время нет планов публиковать его код или параметры обучения. Исследователи признают качественное различие между генерируемыми видео и реальными записями, а также не могут игнорировать присущие технологии дипфейков риски. Значение данного исследования заключается в том, что оно показывает будущее развитие систем искусственного интеллекта — переход от одномерного логического взаимодействия к многомерному, включающему эмоциональные реакции, зрительный контакт и визуальное воплощение.
Связанная статья
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны
Рекомендации по связанным специальным темам
Комментарии (0)

Исследователи официально представили модель LPM1.0 — проект, направленный на создание видео в реальном времени с изображениями людей, говорящих, слушающих или поющих, на основе одного исходного изображения. Ключевым прорывом этой модели является мультимодальная обработка: синхронизация текстовых, аудио- и визуальных данных для формирования динамичных сцен с точным синхронизацией губ, выразительными выражениями лица и естественными эмоциональными переходами. Модель может напрямую интегрироваться в ведущие платформы искусственного интеллекта для голосового общения, такие как ChatGPT и Doubao, превращая традиционные голосовые разговоры в интерактивный опыт с визуальным обратным связью.
С технической точки зрения LPM1.0 использует метод «условирования идентичности с множественной гранулярностью» для извлечения детальных характеристик из исходных материалов под разными углами и при различных выражениях лица, что позволяет избежать необходимости самостоятельного генерирования сложных элементов, таких как зубы, морщины или боковые профили. Это значительно улучшает возможности обработки различных стилей — позволяя мгновенно создавать фотореалистичные лица, анимации или персонажей в 3D-играх без повторной настройки модели. Кроме того, модель поддерживает потоковую передачу данных, обеспечивая стабильность работы даже при генерации видео продолжительностью до 45 минут.
Что касается логики взаимодействия, LPM1.0 точно определяет три состояния разговора: во время прослушивания она формирует соответствующие выражения лица, такие как кивки или изменение направления взгляда; во время речи — движения тела и губ в соответствии с аудиосигналом; в состоянии покоя — естественные поведенческие реакции на основе текстовых указаний. Руководитель проекта Цзэн Айлин отметила, что LPM1.0 подходит не только для реального времени общения, но и для офлайн-генерации видео на основе аудио, обеспечивая техническую надежность для подкастов и кинопроизводства.
Несмотря на значительный потенциал применения, команда разработчиков подчеркивает, что LPM1.0 пока остается исследовательским проектом, и в настоящее время нет планов публиковать его код или параметры обучения. Исследователи признают качественное различие между генерируемыми видео и реальными записями, а также не могут игнорировать присущие технологии дипфейков риски. Значение данного исследования заключается в том, что оно показывает будущее развитие систем искусственного интеллекта — переход от одномерного логического взаимодействия к многомерному, включающему эмоциональные реакции, зрительный контакт и визуальное воплощение.
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче
Оптимизация написания комментариев в отчетных карточках с помощью ИИ-инструментовВведениеИИ-инструменты для генерации комментариев в отчетных карточкахMagic SchoolAlmanac AIChat GPTИспользование Magic School для генерации комментариев в отчетны











