Alibabas Tongyi Lab veröffentlicht „Fun-CineForge“ als Open-Source-Software und löst damit das Problem der Synchronisation mit mehreren Sprechern

Heim

Nachricht

22. März 2026

GaryGonzalez

Herkömmliche KI-Synchronisation versagt oft bei anspruchsvollen Produktionen wie Filmen und Animationen, bei denen es entscheidend darauf ankommt, nuancierte emotionale Höhepunkte einzufangen und die Lippensynchronisation perfekt abzustimmen. Um diese zentrale Herausforderung der Branche zu bewältigen, hat Tongyi Lab das bahnbrechende, für den Filmbereich geeignete, szenarioübergreifende multimodale Synchronisationsmodell „Fun-CineForge“ offiziell vorgestellt und als Open-Source-Projekt veröffentlicht.

Die audiovisuelle Lücke schließen: Ein Vier-Säulen-Framework für nahtlose Synchronisation

Anstatt sich auf einfache Text-to-Speech-Technologie zu verlassen, wurde Fun-CineForge entwickelt, um vier entscheidende Dimensionen der professionellen Synchronisation zu meistern:

Lippensynchronisation: Stellt sicher, dass die synthetisierte Sprache mit außergewöhnlicher Präzision mit den Mundbewegungen der Figuren auf dem Bildschirm übereinstimmt.

Emotionaler Ausdruck: Verleiht der Stimme authentische, menschenähnliche Emotionen durch die Analyse von Gesichtsausdrücken und kontextbezogenen Anweisungen.

Stimmkonsistenz: Bewahrt eine stabile, wiedererkennbare stimmliche Identität für bestimmte Charaktere in komplexen Dialogszenen mit mehreren Sprechern.

Zeitliche Abstimmung: Ermöglicht die millisekundengenaue Einfügung von Dialogen, selbst wenn der Sprecher nicht im Bild ist oder teilweise verdeckt wird.

Kerninnovation: Wegweisende „Zeitmodalität“ und ein High-Fidelity-Datensatz

Der technische Sprung von Fun-CineForge beruht auf seiner einzigartigen „Daten + Modell“-Co-Design-Philosophie:

Der hochwertige CineDub-Datensatz: Das Tongyi Lab hat zudem die automatisierte Pipeline zur Erstellung des CineDub-Datensatzes als Open Source veröffentlicht. Durch den Einsatz eines „Chain-of-Thought“-Fehlerkorrekturmechanismus reduziert sie die Transkriptionsfehlerrate für chinesischen und englischen Text auf etwa 1 % bis 2 % und senkt die Fehler bei der Sprecherzuordnung auf bis zu 1,2 %.

Vier-Modalitäten-Fusionsarchitektur: Das Modell leistet Pionierarbeit bei der Integration einer „Zeitmodalität“, indem es visuelle Eingaben (Lippenform und Mimik), Text (Dialog und emotionaler Kontext) und Audio (Stimmreferenz) gemeinsam modelliert. Diese Fusion ermöglicht eine exakte Synchronisation in anspruchsvollen Szenen, einschließlich solcher ohne sichtbare Gesichter.

Nachgewiesene Exzellenz: Wegweisende authentische Synchronisation von Dialogen mit mehreren Charakteren

Benchmark-Ergebnisse zeigen, dass Fun-CineForge Basismodelle wie DeepDubber-V1 in allen wichtigen Metriken deutlich übertrifft: Wortfehlerrate (WER/CER), Lippensynchronisation (LSE-C/D) und Stimmähnlichkeit. Eine bahnbrechende Errungenschaft ist die in dieser Art einzigartige Fähigkeit, Duette und Dialoge mit mehreren Personen präzise zu verarbeiten, wobei es in Videoclips von bis zu 30 Sekunden bemerkenswerte Robustheit zeigt.

GitHub: https://github.com/FunAudioLLM/FunCineForge

HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge

ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/

Verwandter Artikel

Die experimentelle KI „Claude“ von Anthropic wickelt in einem E-Commerce-Test Verhandlungen und Transaktionen ab Angesichts der rasanten Fortschritte im Bereich der künstlichen Intelligenz hat Anthropic am vergangenen Freitag still und leise ein internes Experiment namens „Project Deal“ gestartet, um das Potenzi

DeepSeek Code steht kurz vor der Markteinführung Angesichts der rasanten Entwicklung der KI-Technologie befindet sich DeepSeek an einem spannenden Wendepunkt. Das KI-Unternehmen gab kürzlich bekannt, dass es sich Finanzmittel in Höhe von über 70 Mil

Musks Grok: 1,5 Billionen Parameter und die Übernahme von Cursor-Code – bahnbrechende Neuerung oder nur ein Bluff? Elon Musk macht endlich einen Schritt.Im Wettlauf um die KI-Programmierung legen OpenAI und Anthropic einen Gang zu, während xAI hinterherzuhinken scheint. Musk hat oft sein Ziel bekräftigt, Claude Ko

Empfehlungen zu verwandten Spezialthemen

Geschäft

Die besten KI-Tools für die Personalbeschaffung: Lebensläufe prüfen und die Terminplanung für Vorstellungsgespräche automatisieren

Entdecken Sie auf XIX.AI die besten KI-Tools für die Personalbeschaffung des Jahres 2026. Unsere sorgfältig zusammengestellte Liste umfasst leistungsstarke, bahnbrechende Lösungen für die Sichtung von Lebensläufen und die automatisierte Terminplanung für Vorstellungsgespräche. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Praxistests und wöchentlich aktualisierten Rankings. Finden Sie Ihren perfekten Assistenten für die Personalbeschaffung und optimieren Sie noch heute Ihren Rekrutierungsprozess!

10 Tools

xix.ai

Produktivität

KI-Coaches für persönliches Wohlbefinden und Konzentration: Burnout bewältigen und die geistige Energie steigern

Entdecken Sie auf XIX.AI die besten KI-basierten Coaches für persönliches Wohlbefinden und Konzentration des Jahres 2026. Unsere sorgfältig zusammengestellte Rangliste umfasst erstklassige, bahnbrechende Tools zur Bewältigung von Burnout und zur Steigerung der mentalen Energie. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Erfahrungsberichten aus der Praxis. Schlagen Sie noch heute den Weg zu höchster Produktivität und Wohlbefinden ein.

10 Tools

xix.ai

Chatbot

Die besten KI-basierten Romantik-Chatbots: Bauen Sie langfristige Beziehungen mit beständiger Persönlichkeit auf

Entdecken Sie die besten KI-Romantik-Chatbots des Jahres 2026, mit denen Sie echte, langfristige Beziehungen aufbauen können. Unsere sorgfältig zusammengestellte Liste bietet Ihnen überzeugende, konsistente Persönlichkeiten, Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Tests aus der Praxis. Finden Sie Ihren perfekten Begleiter und legen Sie noch heute bei XIX.AI los.

10 Tools

xix.ai

Bildung und Lernen

Die besten AI-Datenwissenschafts-Mentoren: Beherrschen Sie SQL, Pandas und Arbeitsabläufe für maschinelles Lernen.

Entdecken Sie die besten AI-Data-Science-Mentoren von 2026, um SQL, Pandas und ML-Arbeitsabläufe zu meistern. Erfahren Sie mehr über unsere hochbewerteten, sorgfältig ausgewählten Angebote bei XIX.AI – für effektive und bahnbrechende Anleitung. Vergleichen Sie kostenlose und bezahlte Optionen mit praktischen Einblicken aus der Praxis. Entfalten Sie Ihr Potenzial in der Data Science noch heute.

10 Tools

xix.ai

Chatbot

Die besten KI-Flirt- und Konversationstrainer: Steigere dein soziales Charisma und dein Selbstvertrauen in Echtzeit

Entdecken Sie auf XIX.AI die besten KI-Flirt- und Konversationstrainer des Jahres 2026. Unsere sorgfältig zusammengestellte, erstklassige Auswahl hilft Ihnen dabei, Ihr soziales Charisma und Ihr Selbstvertrauen in Echtzeit zu stärken. Entdecken Sie unverzichtbare, bahnbrechende Tools mit Vergleichen zwischen kostenlosen und kostenpflichtigen Angeboten sowie wöchentlich aktualisierten Rankings. Schaffen Sie sich noch heute einen sozialen Vorsprung.

10 Tools

xix.ai

Code

Die besten KI-Tools für automatisierte Einheitstests: Generieren Sie mit nur einem Klick Jest-, PyTest- und JUnit-Testfälle.

Entdecken Sie die neuesten, hochbewerteten KI-Tools von 2026 für den automatisierten Unit-Testing-Prozess. Unsere sorgfältig ausgewählten Lösungen bieten leistungsstarke und bahnbrechende Funktionen, um sofort Jest-, PyTest- und JUnit-Testfälle zu generieren. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von tatsächlichen Tests sowie wöchentlich aktualisierten Rankings auf XIX.AI. Entfalten Sie Ihr KI-Potenzial und steigern Sie noch heute die Produktivität Ihrer Entwicklungstätigkeit.

10 Tools

xix.ai