LPM1.0 모델은 단일 이미지로부터 실시간 대화형 디지털 휴먼 영상을 생성합니다.

연구진은 단일 참조 이미지만으로 사람들이 말하거나 듣거나 노래하는 모습의 실시간 영상을 생성하기 위해 개발된 LPM1.0 모델을 공식적으로 공개했습니다. 이 모델의 핵심 혁신점은 멀티모달 처리 기술에 있으며, 텍스트, 오디오, 이미지 입력을 동기화하여 정확한 입동기화와 섬세한 표정, 자연스러운 감정 전환을 갖춘 동적인 장면을 만들어냅니다. 이 모델은 ChatGPT나 Doubao와 같은 주요 음성 AI 플랫폼과 직접 연동되어 기존의 음성 대화를 시각적 피드백이 포함된 실시간 상호작용 경험으로 전환합니다.
기술적으로 LPM1.0은 “다중 해상도 정체성 조건부 처리” 기법을 활용해 다양한 각도와 표정의 참조 자료에서 상세한 특징들을 추출함으로써, 치아나 주름, 측면 프로필과 같은 복잡한 요소들을 모델이 단독으로 생성해야 하는 필요성을 없앴습니다. 이를 통해 재교육 없이도 사실적인 얼굴, 애니메이션, 3D 게임 캐릭터 등 다양한 스타일의 콘텐츠를 즉시 생성할 수 있게 되었으며, 최대 45분 길이의 영상을 생성해도 시스템의 안정성을 유지할 수 있습니다.
상호작용 로직 측면에서 LPM1.0은 대화 상태를 세 가지로 정확하게 인식합니다. 상대방의 말을 듣는 동안에는 고개를 끄덕이거나 시선을 옮기는 등 적절한 표정을 보여주고, 말하는 동안에는 오디오 정보를 바탕으로 신체와 입의 움직임을 생성하며, 대화가 없는 상태에서는 텍스트 프롬프트에 따라 자연스러운 휴식 모습을 만들어냅니다. 프로젝트 매니저인 젱아일링은 LPM1.0이 실시간 대화는 물론 오프라인에서 오디오 기반으로 영상을 생성하는 데에도 적합하며, 팟캐스트나 영화 제작 시 기술적 여유를 제공한다고 언급했습니다.
높은 응용 가능성에도 불구하고 개발팀은 LPM1.0이 아직 연구 단계의 모델일 뿐이며, 현재로서는 코드나 가중치를 공개할 계획이 없다고 강조합니다. 연구진들은 생성된 영상과 실제 촬영 영상 사이에 질적인 차이가 존재하며, 딥페이크와 관련된 내재적 위험도 간과할 수 없다고 인정합니다. 이 연구의 의의는 단일 논리적 상호작용에서 감정 반응, 시선 교환, 시각적 표현까지 포함하는 다차원적 상호작용으로 AI 시스템이 발전해 나가는 미래의 방향을 제시한다는 점에 있습니다.
관련 기사
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받
관련 특별 주제 추천
의견 (0)
0/500

연구진은 단일 참조 이미지만으로 사람들이 말하거나 듣거나 노래하는 모습의 실시간 영상을 생성하기 위해 개발된 LPM1.0 모델을 공식적으로 공개했습니다. 이 모델의 핵심 혁신점은 멀티모달 처리 기술에 있으며, 텍스트, 오디오, 이미지 입력을 동기화하여 정확한 입동기화와 섬세한 표정, 자연스러운 감정 전환을 갖춘 동적인 장면을 만들어냅니다. 이 모델은 ChatGPT나 Doubao와 같은 주요 음성 AI 플랫폼과 직접 연동되어 기존의 음성 대화를 시각적 피드백이 포함된 실시간 상호작용 경험으로 전환합니다.
기술적으로 LPM1.0은 “다중 해상도 정체성 조건부 처리” 기법을 활용해 다양한 각도와 표정의 참조 자료에서 상세한 특징들을 추출함으로써, 치아나 주름, 측면 프로필과 같은 복잡한 요소들을 모델이 단독으로 생성해야 하는 필요성을 없앴습니다. 이를 통해 재교육 없이도 사실적인 얼굴, 애니메이션, 3D 게임 캐릭터 등 다양한 스타일의 콘텐츠를 즉시 생성할 수 있게 되었으며, 최대 45분 길이의 영상을 생성해도 시스템의 안정성을 유지할 수 있습니다.
상호작용 로직 측면에서 LPM1.0은 대화 상태를 세 가지로 정확하게 인식합니다. 상대방의 말을 듣는 동안에는 고개를 끄덕이거나 시선을 옮기는 등 적절한 표정을 보여주고, 말하는 동안에는 오디오 정보를 바탕으로 신체와 입의 움직임을 생성하며, 대화가 없는 상태에서는 텍스트 프롬프트에 따라 자연스러운 휴식 모습을 만들어냅니다. 프로젝트 매니저인 젱아일링은 LPM1.0이 실시간 대화는 물론 오프라인에서 오디오 기반으로 영상을 생성하는 데에도 적합하며, 팟캐스트나 영화 제작 시 기술적 여유를 제공한다고 언급했습니다.
높은 응용 가능성에도 불구하고 개발팀은 LPM1.0이 아직 연구 단계의 모델일 뿐이며, 현재로서는 코드나 가중치를 공개할 계획이 없다고 강조합니다. 연구진들은 생성된 영상과 실제 촬영 영상 사이에 질적인 차이가 존재하며, 딥페이크와 관련된 내재적 위험도 간과할 수 없다고 인정합니다. 이 연구의 의의는 단일 논리적 상호작용에서 감정 반응, 시선 교환, 시각적 표현까지 포함하는 다차원적 상호작용으로 AI 시스템이 발전해 나가는 미래의 방향을 제시한다는 점에 있습니다.
리눅스 재단에 6대 기술 거대기업이 1250만 달러를 지원해 AI 취약성 소음 문제 해결에 나서다
AI 자동화 도구가 생성한 저품질 보안 보고서의 홍수를 처리하기 위해, 앤트로픽(Anthropic), 아마존(AWS), 깃허브(GitHub), 구글(Google), 마이크로소프트(Microsoft), 오픈AI(OpenAI) 등 6대 주요 기술 기업은 리눅스 재단(Linux Foundation) 이니셔티브에 총 1,250만 달러의 자금을 공동으로 기부했습니다. 이 투자는 오픈 소스 소프트웨어(FOSS) 유지 관리자가 수동 선별의 부담에서 벗어나
[[IMG_BASE64_PLACEHOLDER]] 머스크, 오픈AI를 자녀들에게 넘길 가능성 고려… 알트만 증언
오늘 아침, 오픈에이아이(OpenAI)의 샘 알트만(Sam Altman) 최고경영자(CEO)는 회사의 기업 구조에 이의를 제기한 전 공동 창업자 일론 머스크(Elon Musk)의 소송에 대응하기 위해 증언대에 섰습니다.머스크가 비영리 자선단체를 사적 이익을 추구하는 자회사로 전환하여 AI 기반 제품을 마케팅한 다른 창업자들이 “자선단체를 훔쳤다”고 주장한 것과 관련해 질문을 받자, 알트만은 뚜렷한 망설임으로 응답했습니다.“그런 프레임으로 받





집







