메이투안, ‘LongCat-Video-Avatar 1.5’ 오픈소스 공개… 주류 비공개 모델보다 우수한 성능 보여
메이투안의 LongCat 대형 모델 팀은 상용급 디지털 휴먼 영상 생성 모델인 ‘LongCat-Video-Avatar 1.5’를 공식적으로 오픈소스로 공개했습니다. 이번 버전은 오픈소스 최첨단 기술에서 실제 상용 배포로 완전히 전환된 것으로, 립싱크, 물리적 사실성, 장편 영상 안정성, 다인 상호작용 및 효율적인 추론 측면에서 크게 개선되었습니다.
상용화 과제를 극복하기 위한 세 가지 핵심 업그레이드
디지털 휴먼이 다양한 실제 애플리케이션에서 안정적으로 작동할 수 있도록, LongCat-Video-Avatar 1.5는 세 가지 포괄적인 개선을 통해 기존 디지털 휴먼 영상에서 지속적으로 발생하던 지터, 왜곡, 높은 지연 시간과 같은 문제를 해결합니다:
상용급 오디오 인코딩 업그레이드
모델의 오디오 특징 추출 인코더가 Wav2Vec2에서 Whisper-large로 업그레이드되었습니다. 더 많은 매개변수와 풍부한 다국어 선행 지식을 바탕으로, 이제 미묘한 음소 변이와 말의 리듬을 포착합니다. 이를 통해 긴 문장, 빠른 말투, 노래와 같은 복잡한 오디오에 대한 입술 동기화를 개선하는 동시에, 표정, 머리 움직임, 말소리 간의 자연스러운 조화를 가능하게 하여 긴 동영상에서 프레임 건너뛰기와 정체성 편차를 현저히 줄입니다.
다단계 데이터 강화를 통한 강력한 오픈 도메인 일반화
실제 사람, 가상 아이돌, 애니메이션 캐릭터, 동물 등 다양한 피사체에 걸쳐 안정적인 성능을 보장하기 위해, 연구팀은 오프라인 주석 부착 및 온라인 검증을 통합한 다단계 데이터 파이프라인을 개발하고, 다음 세 가지 유형의 강화된 데이터를 도입했습니다:
다인물 데이터: 능동적 화자 감지 기술을 활용하여 다인물 장면에서 시청각적 모호성을 제거하고, 화자와 청취자를 정확하게 구분합니다.
침묵 데이터: 음성이 없는 동영상을 선별함으로써, 모델은 침묵 상태에서의 자연스러운 미세 표정을 학습하여, 말하지 않는 캐릭터의 원치 않는 입 움직임을 방지합니다.
감정 데이터: 프레임 단위 감정 인식 필터링과 결합하여 감정적 변동을 반영함으로써, 모델이 말과 얼굴 표정 간의 깊은 연관성을 파악할 수 있도록 돕습니다.
GRPO를 활용한 손 정렬 및 시간적 연속성
손이 자주 노출되는 전자상거래 라이브 스트리밍이나 제품 시연과 같은 사용 사례를 위해, 이 모델은 GRPO(Human Preference Alignment)를 도입하여 보상 신호를 프레임 단위로 정교화하고 첫 번째 프레임 손 탐지 메커니즘을 추가합니다. 이를 통해 손의 왜곡, 국소적 구조 붕괴, 동작 불일치와 같은 일반적인 문제를 대폭 줄입니다.

15배 더 빠른 추론: 막대한 연산 요구 사항 제거
비용은 상용화에 있어 또 다른 중요한 요소입니다. LongCat-Video-Avatar 1.5는 DMD(Distributed Matching Distillation) 기술을 사용하여, 원래 50단계였던 생성 과정을 단 8단계로 압축했습니다. 또한 연구팀은 기존의 3개 모델 병렬 구성을 단일 공유 기본 모델과 여러 개의 LoRA 어댑터로 대체하여 VRAM 사용량을 획기적으로 줄였습니다.
실제 테스트에서 이 모델은 약 15배 더 빠른 추론 속도를 보여주며, 10초 분량의 동영상을 약 1분 만에 생성합니다.
벤치마크 평가: 업계 최고 모델들을 능가하는 성능
EvalTalker 벤치마크를 사용하여 770명의 평가자와 10명의 분야 전문가가 뉴스, 교육, 엔터테인먼트 등 복잡한 분야의 동영상에 대해 체계적인 품질 분석을 수행했습니다. 그 결과, LongCat-Video-Avatar 1.5는 다음과 같은 여러 주요 지표에서 뛰어난 성능을 보였습니다.
사용자 선호도 승률: Kling Avatar 2.0보다 65.9%, OmniHuman-1.5보다 61.1%, HeyGen보다 54.3% 높은 수치를 기록했습니다 .
단일 및 다인 시나리오 점수: 단일 시나리오 점수는 3.336을 기록하여 HeyGen과 같은 경쟁사들을 훨씬 상회했으며, 다인 시나리오 점수는 2.730으로 InfiniteTalk(2.339)보다 현저히 우수한 성과를 보였습니다.
영상 안정성: 피사체 왜곡률은 23.1%에 불과하며, 배경 왜곡률은 9.4%에 그쳤습니다.프레임 누락률은 0.8%로, 비교 대상 모델 중 가장낮은 수치를 기록했습니다.
영상-음성 동기화: 얼굴-신체 동기화 오류율은 5.1%로, 입모양 동기화 오류율은 29.8%로 떨어졌으며, 두 지표 모두 기존 상용 시스템을 능가했습니다.
Meituan LongCat 대형 모델 팀은 LongCat-Video-Avatar 1.5의 오픈소스 공개가 단순한 버전 업데이트를 넘어, 전 세계 개발자 및 크리에이터 커뮤니티에 보내는 초대라고 밝혔습니다. 이들은 이 모델이 검증 가능하고 개선 가능한 기술적 토대가 되어, 디지털 휴먼 비디오 애플리케이션의 실제 적용 범위를 넓히는 데 기여하기를 희망합니다.
오픈 소스 링크:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
기술 보고서: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
프로젝트 페이지: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
모델스코프: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
관련 기사
Preply의 ‘유니콘’ 지위는 우크라이나의 회복력을 반영한다
언어 학습 플랫폼 Preply는 1억 5천만 달러 규모의 시리즈 D 투자 유치를 통해 기업 가치가 12억 달러에 도달했으며, 이는 창립 14년 차인 이 회사에 있어 중요한 이정표가 되었습니다. 기존 투자자로는 Horizon Capital, Hoxton Ventures, Owl Ventures, Techstars Berlin 등이 있습니다.2013년 언어 학
왕싱싱: 2~3년 내 ChatGPT와 유사한 획기적인 발전을 이룰 것으로 예상되는 ‘체화형 AI’
BotSchool의 창립자이자 CEO인 왕싱싱은 2026 세계 로봇 컨퍼런스(WRC2026) 메인 포럼에서 기조 연설을 통해, 체화 지능이 “챗GPT의 등장”과 유사한 산업적 전환점에 접어들고 있다고 강조했다. 그는 이러한 돌파구가 빠르면 2~3년 내에 나타날 수도 있고, 도입 속도가 더딘 시나리오에서는 5~10년이 걸릴 수도 있다고 전망했다.왕 싱싱 대표
Microsoft, 새로운 코딩 모델로 자체 AI 전략 부활, Claude 비용 급등
AI 기반 코딩은 현대 소프트웨어 개발의 핵심 요소가 되었지만, Microsoft와 같은 기술 거대 기업들도 고가의 서드파티 대규모 언어 모델 구독 비용으로 인해 부담을 느끼고 있습니다. 외부 의존성과 운영 오버헤드를 줄이기 위해 Microsoft는 자체 AI 모델 패키지를 출시할 준비를 하고 있으며, 이는 AI 코딩 분야를 직접적으로 겨냥한 것입니다.급증하는 비용이 Microsoft의 자체 솔루션 추진을 주도Microsoft는 최근 Cla
관련 특별 주제 추천
의견 (0)
0/500
메이투안의 LongCat 대형 모델 팀은 상용급 디지털 휴먼 영상 생성 모델인 ‘LongCat-Video-Avatar 1.5’를 공식적으로 오픈소스로 공개했습니다. 이번 버전은 오픈소스 최첨단 기술에서 실제 상용 배포로 완전히 전환된 것으로, 립싱크, 물리적 사실성, 장편 영상 안정성, 다인 상호작용 및 효율적인 추론 측면에서 크게 개선되었습니다.
상용화 과제를 극복하기 위한 세 가지 핵심 업그레이드
디지털 휴먼이 다양한 실제 애플리케이션에서 안정적으로 작동할 수 있도록, LongCat-Video-Avatar 1.5는 세 가지 포괄적인 개선을 통해 기존 디지털 휴먼 영상에서 지속적으로 발생하던 지터, 왜곡, 높은 지연 시간과 같은 문제를 해결합니다:
상용급 오디오 인코딩 업그레이드
모델의 오디오 특징 추출 인코더가 Wav2Vec2에서 Whisper-large로 업그레이드되었습니다. 더 많은 매개변수와 풍부한 다국어 선행 지식을 바탕으로, 이제 미묘한 음소 변이와 말의 리듬을 포착합니다. 이를 통해 긴 문장, 빠른 말투, 노래와 같은 복잡한 오디오에 대한 입술 동기화를 개선하는 동시에, 표정, 머리 움직임, 말소리 간의 자연스러운 조화를 가능하게 하여 긴 동영상에서 프레임 건너뛰기와 정체성 편차를 현저히 줄입니다.
다단계 데이터 강화를 통한 강력한 오픈 도메인 일반화
실제 사람, 가상 아이돌, 애니메이션 캐릭터, 동물 등 다양한 피사체에 걸쳐 안정적인 성능을 보장하기 위해, 연구팀은 오프라인 주석 부착 및 온라인 검증을 통합한 다단계 데이터 파이프라인을 개발하고, 다음 세 가지 유형의 강화된 데이터를 도입했습니다:
다인물 데이터: 능동적 화자 감지 기술을 활용하여 다인물 장면에서 시청각적 모호성을 제거하고, 화자와 청취자를 정확하게 구분합니다.
침묵 데이터: 음성이 없는 동영상을 선별함으로써, 모델은 침묵 상태에서의 자연스러운 미세 표정을 학습하여, 말하지 않는 캐릭터의 원치 않는 입 움직임을 방지합니다.
감정 데이터: 프레임 단위 감정 인식 필터링과 결합하여 감정적 변동을 반영함으로써, 모델이 말과 얼굴 표정 간의 깊은 연관성을 파악할 수 있도록 돕습니다.
GRPO를 활용한 손 정렬 및 시간적 연속성
손이 자주 노출되는 전자상거래 라이브 스트리밍이나 제품 시연과 같은 사용 사례를 위해, 이 모델은 GRPO(Human Preference Alignment)를 도입하여 보상 신호를 프레임 단위로 정교화하고 첫 번째 프레임 손 탐지 메커니즘을 추가합니다. 이를 통해 손의 왜곡, 국소적 구조 붕괴, 동작 불일치와 같은 일반적인 문제를 대폭 줄입니다.

15배 더 빠른 추론: 막대한 연산 요구 사항 제거
비용은 상용화에 있어 또 다른 중요한 요소입니다. LongCat-Video-Avatar 1.5는 DMD(Distributed Matching Distillation) 기술을 사용하여, 원래 50단계였던 생성 과정을 단 8단계로 압축했습니다. 또한 연구팀은 기존의 3개 모델 병렬 구성을 단일 공유 기본 모델과 여러 개의 LoRA 어댑터로 대체하여 VRAM 사용량을 획기적으로 줄였습니다.
실제 테스트에서 이 모델은 약 15배 더 빠른 추론 속도를 보여주며, 10초 분량의 동영상을 약 1분 만에 생성합니다.
벤치마크 평가: 업계 최고 모델들을 능가하는 성능
EvalTalker 벤치마크를 사용하여 770명의 평가자와 10명의 분야 전문가가 뉴스, 교육, 엔터테인먼트 등 복잡한 분야의 동영상에 대해 체계적인 품질 분석을 수행했습니다. 그 결과, LongCat-Video-Avatar 1.5는 다음과 같은 여러 주요 지표에서 뛰어난 성능을 보였습니다.
사용자 선호도 승률: Kling Avatar 2.0보다 65.9%, OmniHuman-1.5보다 61.1%, HeyGen보다 54.3% 높은 수치를 기록했습니다 .
단일 및 다인 시나리오 점수: 단일 시나리오 점수는 3.336을 기록하여 HeyGen과 같은 경쟁사들을 훨씬 상회했으며, 다인 시나리오 점수는 2.730으로 InfiniteTalk(2.339)보다 현저히 우수한 성과를 보였습니다.
영상 안정성: 피사체 왜곡률은 23.1%에 불과하며, 배경 왜곡률은 9.4%에 그쳤습니다.프레임 누락률은 0.8%로, 비교 대상 모델 중 가장낮은 수치를 기록했습니다.
영상-음성 동기화: 얼굴-신체 동기화 오류율은 5.1%로, 입모양 동기화 오류율은 29.8%로 떨어졌으며, 두 지표 모두 기존 상용 시스템을 능가했습니다.
Meituan LongCat 대형 모델 팀은 LongCat-Video-Avatar 1.5의 오픈소스 공개가 단순한 버전 업데이트를 넘어, 전 세계 개발자 및 크리에이터 커뮤니티에 보내는 초대라고 밝혔습니다. 이들은 이 모델이 검증 가능하고 개선 가능한 기술적 토대가 되어, 디지털 휴먼 비디오 애플리케이션의 실제 적용 범위를 넓히는 데 기여하기를 희망합니다.
오픈 소스 링크:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
기술 보고서: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
프로젝트 페이지: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
모델스코프: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Preply의 ‘유니콘’ 지위는 우크라이나의 회복력을 반영한다
언어 학습 플랫폼 Preply는 1억 5천만 달러 규모의 시리즈 D 투자 유치를 통해 기업 가치가 12억 달러에 도달했으며, 이는 창립 14년 차인 이 회사에 있어 중요한 이정표가 되었습니다. 기존 투자자로는 Horizon Capital, Hoxton Ventures, Owl Ventures, Techstars Berlin 등이 있습니다.2013년 언어 학
왕싱싱: 2~3년 내 ChatGPT와 유사한 획기적인 발전을 이룰 것으로 예상되는 ‘체화형 AI’
BotSchool의 창립자이자 CEO인 왕싱싱은 2026 세계 로봇 컨퍼런스(WRC2026) 메인 포럼에서 기조 연설을 통해, 체화 지능이 “챗GPT의 등장”과 유사한 산업적 전환점에 접어들고 있다고 강조했다. 그는 이러한 돌파구가 빠르면 2~3년 내에 나타날 수도 있고, 도입 속도가 더딘 시나리오에서는 5~10년이 걸릴 수도 있다고 전망했다.왕 싱싱 대표
Microsoft, 새로운 코딩 모델로 자체 AI 전략 부활, Claude 비용 급등
AI 기반 코딩은 현대 소프트웨어 개발의 핵심 요소가 되었지만, Microsoft와 같은 기술 거대 기업들도 고가의 서드파티 대규모 언어 모델 구독 비용으로 인해 부담을 느끼고 있습니다. 외부 의존성과 운영 오버헤드를 줄이기 위해 Microsoft는 자체 AI 모델 패키지를 출시할 준비를 하고 있으며, 이는 AI 코딩 분야를 직접적으로 겨냥한 것입니다.급증하는 비용이 Microsoft의 자체 솔루션 추진을 주도Microsoft는 최근 Cla





집






