Heim
Meituan veröffentlicht „LongCat-Video-Avatar 1.5“ als Open-Source-Software – das Modell übertrifft gängige proprietäre Modelle
Das LongCat-Team für große Modelle bei Meituan hat „LongCat-Video-Avatar 1.5“, ein Modell zur Erzeugung digitaler Menschen in Videos auf kommerziellem Niveau, offiziell als Open Source veröffentlicht. Diese Version markiert einen vollständigen Übergang vom Open-Source-Stand der Technik zum praktischen kommerziellen Einsatz und bietet wesentliche Verbesserungen in den Bereichen Lippensynchronisation, physikalischer Realismus, Stabilität bei langen Videos, Interaktionen zwischen mehreren Personen sowie effiziente Inferenz.
Drei wichtige Verbesserungen zur Überwindung von Hürden bei der Kommerzialisierung
Damit digitale Menschen in verschiedenen realen Anwendungen zuverlässig funktionieren, geht LongCat-Video-Avatar 1.5 durch drei ganzheitliche Verbesserungen hartnäckige Probleme wie Bildflackern, Verzerrungen und hohe Latenz in herkömmlichen Videos mit digitalen Menschen an:
Verbesserung der Audio-Kodierung auf kommerziellem Niveau
Der Encoder zur Extraktion von Audio-Merkmalen des Modells wurde von Wav2Vec2 auf Whisper-large aktualisiert. Mit mehr Parametern und umfangreicheren mehrsprachigen Vorwissen erfasst er nun subtile Phonemvariationen und den Sprachrhythmus. Dies verbessert die Lippensynchronisation bei komplexen Audioinhalten wie langen Sätzen, schneller Sprache und Gesang und ermöglicht gleichzeitig eine natürliche Koordination zwischen Gesichtsausdrücken, Kopfbewegungen und Sprache – wodurch Frame-Skipping und Identitätsdrift in längeren Videos deutlich reduziert werden.
Robuste Open-Domain-Generalisierung durch mehrstufige Datenanreicherung
Um eine stabile Leistung bei unterschiedlichen Motiven – echte Menschen, virtuelle Idole, Anime-Figuren und Tiere – zu gewährleisten, entwickelte das Team eine mehrstufige Datenpipeline, die Offline-Annotation und Online-Validierung umfasst, und führte drei gezielte Arten von angereicherten Daten ein:
Daten mit mehreren Personen: Mithilfe der Erkennung des aktiven Sprechers werden audiovisuelle Mehrdeutigkeiten in Szenen mit mehreren Personen beseitigt, wobei Sprecher und Zuhörer präzise voneinander unterschieden werden.
Stille Daten: Durch die Auswahl von Videos ohne Sprache lernt das Modell natürliche Mikroausdrücke in stillen Zuständen kennen und verhindert so unerwünschte Mundbewegungen bei nicht sprechenden Figuren.
Emotionsdaten: In Kombination mit einem Filter zur Emotionserkennung auf Frame-Ebene werden emotionale Schwankungen einbezogen, was dem Modell hilft, den tiefen Zusammenhang zwischen Sprache und Gesichtsausdrücken zu erfassen.
Handausrichtung und zeitliche Kontinuität mit GRPO
Für Anwendungsfälle wie E-Commerce-Livestreams und Produktdemos, bei denen Hände häufig zu sehen sind, führt das Modell GRPO (Human Preference Alignment) ein, das Belohnungssignale auf Frame-Ebene verfeinert und einen Mechanismus zur Handerkennung im ersten Frame hinzufügt. Dies reduziert häufige Probleme wie Handverzerrungen, lokalen Strukturkollaps und inkonsistente Bewegungen erheblich.

15-mal schnellere Inferenz: Eliminierung hoher Rechenanforderungen
Die Kosten sind ein weiterer entscheidender Faktor für den kommerziellen Einsatz. LongCat-Video-Avatar 1.5 nutzt die DMD-Technologie (Distributed Matching Distillation) und komprimiert den ursprünglichen 50-stufigen Generierungsprozess auf nur 8 Schritte. Darüber hinaus ersetzte das Team die herkömmliche parallele Konfiguration mit drei Modellen durch ein einziges gemeinsames Basismodell sowie mehrere LoRA-Adapter, wodurch der VRAM-Verbrauch drastisch reduziert wurde.
In Praxistests liefert das Modell eine etwa 15-mal schnellere Inferenz und generiert ein 10-Sekunden-Video in etwa einer Minute.
Benchmark-Auswertung: Übertrifft führende Branchenmodelle
Mithilfe des EvalTalker-Benchmarks führten 770 Bewerter und 10 Fachexperten eine strukturierte Qualitätsanalyse von Videos aus komplexen Bereichen wie Nachrichten, Bildung und Unterhaltung durch. Die Ergebnisse zeigen, dass LongCat-Video-Avatar 1.5 bei mehreren Schlüsselkennzahlen herausragende Leistungen erbringt:
Gewinnquote bei den Nutzerpräferenzen: Es übertrifft Kling Avatar 2.0 um 65,9 %, OmniHuman-1.5 um 61,1 % und HeyGen um 54,3 %.
Bewertungen in Ein- und Mehrpersonen-Szenarien: Die Bewertung im Ein-Personen-Szenario erreicht 3,336 und liegt damit deutlich über der von Wettbewerbern wie HeyGen; die Bewertung im Mehrpersonen-Szenario beträgt 2,730 und übertrifft InfiniteTalk (2,339) deutlich.
Videostabilität: Die Verformungsrate der Testperson beträgt nur 23,1 % und die des Hintergrunds lediglich 9,4 %;die Bildausfallrate liegt bei nur 0,8 % und ist damit dieniedrigste aller verglichenen Modelle.
Audiovisuelle Koordination: Die Fehlerquote bei der Gesichts-Körper-Synchronisation sank auf 5,1 %, und die Fehlerquote bei der Lippensynchronisation fiel auf 29,8 % – beide Werte übertreffen herkömmliche kommerzielle Systeme.
Das Team des großen Meituan-LongCat-Modells erklärt, dass die Veröffentlichung von „LongCat-Video-Avatar 1.5“ als Open-Source-Projekt mehr ist als nur ein Versions-Update – es ist eine Einladung an die weltweite Entwickler- und Kreativ-Community. Sie hoffen, dass dieses Modell als überprüfbare, verbesserungsfähige technische Grundlage dienen wird, um die Grenzen digitaler Human-Video-Anwendungen in der Praxis weiter zu verschieben.
Open-Source-Links:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Technischer Bericht: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Projektseite: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Verwandter Artikel
Preplys „Unicorn“-Status spiegelt die Widerstandsfähigkeit der Ukraine wider
Die Sprachlernplattform Preply hat nach einer Serie-D-Finanzierungsrunde in Höhe von 150 Millionen US-Dollar eine Bewertung von 1,2 Milliarden US-Dollar erreicht – ein bedeutender Meilenstein für das
Wang Xingxing: „Embodied AI“ soll in zwei bis drei Jahren einen Durchbruch wie ChatGPT erzielen
Wang Xingxing, Gründer und CEO von BotSchool, betonte in seiner Rede auf dem Hauptforum der World Robot Conference 2026 (WRC2026), dass sich die verkörperte Intelligenz einem industriellen Wendepunkt
Microsoft belebt die eigene KI-Strategie mit neuem Codierungsmodell wieder, während die Kosten für Claude stark ansteigen
Die KI-gestützte Programmierung ist zu einem festen Bestandteil der modernen Softwareentwicklung geworden, doch selbst Tech-Giganten wie Microsoft spüren die Last teurer Abos für Drittanbieter-Modelle großer Sprachmodelle. Um externe Abhängigkeiten u
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Das LongCat-Team für große Modelle bei Meituan hat „LongCat-Video-Avatar 1.5“, ein Modell zur Erzeugung digitaler Menschen in Videos auf kommerziellem Niveau, offiziell als Open Source veröffentlicht. Diese Version markiert einen vollständigen Übergang vom Open-Source-Stand der Technik zum praktischen kommerziellen Einsatz und bietet wesentliche Verbesserungen in den Bereichen Lippensynchronisation, physikalischer Realismus, Stabilität bei langen Videos, Interaktionen zwischen mehreren Personen sowie effiziente Inferenz.
Drei wichtige Verbesserungen zur Überwindung von Hürden bei der Kommerzialisierung
Damit digitale Menschen in verschiedenen realen Anwendungen zuverlässig funktionieren, geht LongCat-Video-Avatar 1.5 durch drei ganzheitliche Verbesserungen hartnäckige Probleme wie Bildflackern, Verzerrungen und hohe Latenz in herkömmlichen Videos mit digitalen Menschen an:
Verbesserung der Audio-Kodierung auf kommerziellem Niveau
Der Encoder zur Extraktion von Audio-Merkmalen des Modells wurde von Wav2Vec2 auf Whisper-large aktualisiert. Mit mehr Parametern und umfangreicheren mehrsprachigen Vorwissen erfasst er nun subtile Phonemvariationen und den Sprachrhythmus. Dies verbessert die Lippensynchronisation bei komplexen Audioinhalten wie langen Sätzen, schneller Sprache und Gesang und ermöglicht gleichzeitig eine natürliche Koordination zwischen Gesichtsausdrücken, Kopfbewegungen und Sprache – wodurch Frame-Skipping und Identitätsdrift in längeren Videos deutlich reduziert werden.
Robuste Open-Domain-Generalisierung durch mehrstufige Datenanreicherung
Um eine stabile Leistung bei unterschiedlichen Motiven – echte Menschen, virtuelle Idole, Anime-Figuren und Tiere – zu gewährleisten, entwickelte das Team eine mehrstufige Datenpipeline, die Offline-Annotation und Online-Validierung umfasst, und führte drei gezielte Arten von angereicherten Daten ein:
Daten mit mehreren Personen: Mithilfe der Erkennung des aktiven Sprechers werden audiovisuelle Mehrdeutigkeiten in Szenen mit mehreren Personen beseitigt, wobei Sprecher und Zuhörer präzise voneinander unterschieden werden.
Stille Daten: Durch die Auswahl von Videos ohne Sprache lernt das Modell natürliche Mikroausdrücke in stillen Zuständen kennen und verhindert so unerwünschte Mundbewegungen bei nicht sprechenden Figuren.
Emotionsdaten: In Kombination mit einem Filter zur Emotionserkennung auf Frame-Ebene werden emotionale Schwankungen einbezogen, was dem Modell hilft, den tiefen Zusammenhang zwischen Sprache und Gesichtsausdrücken zu erfassen.
Handausrichtung und zeitliche Kontinuität mit GRPO
Für Anwendungsfälle wie E-Commerce-Livestreams und Produktdemos, bei denen Hände häufig zu sehen sind, führt das Modell GRPO (Human Preference Alignment) ein, das Belohnungssignale auf Frame-Ebene verfeinert und einen Mechanismus zur Handerkennung im ersten Frame hinzufügt. Dies reduziert häufige Probleme wie Handverzerrungen, lokalen Strukturkollaps und inkonsistente Bewegungen erheblich.

15-mal schnellere Inferenz: Eliminierung hoher Rechenanforderungen
Die Kosten sind ein weiterer entscheidender Faktor für den kommerziellen Einsatz. LongCat-Video-Avatar 1.5 nutzt die DMD-Technologie (Distributed Matching Distillation) und komprimiert den ursprünglichen 50-stufigen Generierungsprozess auf nur 8 Schritte. Darüber hinaus ersetzte das Team die herkömmliche parallele Konfiguration mit drei Modellen durch ein einziges gemeinsames Basismodell sowie mehrere LoRA-Adapter, wodurch der VRAM-Verbrauch drastisch reduziert wurde.
In Praxistests liefert das Modell eine etwa 15-mal schnellere Inferenz und generiert ein 10-Sekunden-Video in etwa einer Minute.
Benchmark-Auswertung: Übertrifft führende Branchenmodelle
Mithilfe des EvalTalker-Benchmarks führten 770 Bewerter und 10 Fachexperten eine strukturierte Qualitätsanalyse von Videos aus komplexen Bereichen wie Nachrichten, Bildung und Unterhaltung durch. Die Ergebnisse zeigen, dass LongCat-Video-Avatar 1.5 bei mehreren Schlüsselkennzahlen herausragende Leistungen erbringt:
Gewinnquote bei den Nutzerpräferenzen: Es übertrifft Kling Avatar 2.0 um 65,9 %, OmniHuman-1.5 um 61,1 % und HeyGen um 54,3 %.
Bewertungen in Ein- und Mehrpersonen-Szenarien: Die Bewertung im Ein-Personen-Szenario erreicht 3,336 und liegt damit deutlich über der von Wettbewerbern wie HeyGen; die Bewertung im Mehrpersonen-Szenario beträgt 2,730 und übertrifft InfiniteTalk (2,339) deutlich.
Videostabilität: Die Verformungsrate der Testperson beträgt nur 23,1 % und die des Hintergrunds lediglich 9,4 %;die Bildausfallrate liegt bei nur 0,8 % und ist damit dieniedrigste aller verglichenen Modelle.
Audiovisuelle Koordination: Die Fehlerquote bei der Gesichts-Körper-Synchronisation sank auf 5,1 %, und die Fehlerquote bei der Lippensynchronisation fiel auf 29,8 % – beide Werte übertreffen herkömmliche kommerzielle Systeme.
Das Team des großen Meituan-LongCat-Modells erklärt, dass die Veröffentlichung von „LongCat-Video-Avatar 1.5“ als Open-Source-Projekt mehr ist als nur ein Versions-Update – es ist eine Einladung an die weltweite Entwickler- und Kreativ-Community. Sie hoffen, dass dieses Modell als überprüfbare, verbesserungsfähige technische Grundlage dienen wird, um die Grenzen digitaler Human-Video-Anwendungen in der Praxis weiter zu verschieben.
Open-Source-Links:
Github: https://github.com/meituan-longcat/LongCat-Video
HuggingFace: https://huggingface.co/meituan-longcat/LongCat-Video-Avatar-1.5
Technischer Bericht: https://github.com/meituan-longcat/LongCat-Video/blob/main/assets/LongCat-Video-Avatar-1.5-Tech-Report.pdf
Projektseite: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/
Modelscope: https://www.modelscope.cn/models/meituan-longcat/LongCat-Video-Avatar-1.5/summary
Preplys „Unicorn“-Status spiegelt die Widerstandsfähigkeit der Ukraine wider
Die Sprachlernplattform Preply hat nach einer Serie-D-Finanzierungsrunde in Höhe von 150 Millionen US-Dollar eine Bewertung von 1,2 Milliarden US-Dollar erreicht – ein bedeutender Meilenstein für das
Wang Xingxing: „Embodied AI“ soll in zwei bis drei Jahren einen Durchbruch wie ChatGPT erzielen
Wang Xingxing, Gründer und CEO von BotSchool, betonte in seiner Rede auf dem Hauptforum der World Robot Conference 2026 (WRC2026), dass sich die verkörperte Intelligenz einem industriellen Wendepunkt
Microsoft belebt die eigene KI-Strategie mit neuem Codierungsmodell wieder, während die Kosten für Claude stark ansteigen
Die KI-gestützte Programmierung ist zu einem festen Bestandteil der modernen Softwareentwicklung geworden, doch selbst Tech-Giganten wie Microsoft spüren die Last teurer Abos für Drittanbieter-Modelle großer Sprachmodelle. Um externe Abhängigkeiten u











