Tongyi Lab stellt „PrismAudio“ für die bidirektionale Trennung von Bild und Ton vor
In einer Zeit, in der die KI-gestützte Videogenerierung rasant zunimmt, stellt die Diskrepanz zwischen Bild und Ton – die sich oft in Form von Stille oder nicht synchronem Ton äußert – nach wie vor eine erhebliche Hürde für das Eintauchen des Zuschauers in das Geschehen dar. Um dieser Herausforderung zu begegnen, hat das Tongyi Lab von Alibaba „PrismAudio“ vorgestellt, ein neuartiges Framework zur Umwandlung von Video in Audio. Diese Forschungsarbeit, die von der führenden KI-Konferenz ICLR 2026 angenommen wurde, konzentriert sich auf die automatische Synchronisation von Videoinhalten mit präzisen Umgebungsgeräuschen.

Überlegungen vor der Generierung: Audio-Optimierung mit der „Chain of Thought“
Herkömmliche Modelle zur Audioerzeugung arbeiten in der Regel „intuitiv“ und liefern häufig unzusammenhängende Ergebnisse – beispielsweise klingen Pferdehufschläge wie Vogelgezwitscher oder das Audio hinkt der visuellen Handlung hinterher. PrismAudio zeichnet sich durch einen Ansatz aus, bei dem zuerst geplant und dann generiert wird.
Zerlegung der Gedankenkette: Vor der Audioerzeugung analysiert das Modell das Video Bild für Bild: Es identifiziert Szenenelemente, bestimmt den Zeitpunkt des Einsetzens von Geräuschen, bewertet Audioeigenschaften (z. B. Klarheit oder Tiefe) und lokalisiert die Schallquelle räumlich.
Mehrdimensionale Bewertung: Um eine hohe Ausgabequalität zu gewährleisten, integrierte das Entwicklungsteam verstärktes Lernen und nutzte vier „virtuelle Bewerter“, um die Ergebnisse hinsichtlich semantischer Konsistenz, zeitlicher Synchronisation, ästhetischer Qualität und räumlicher Genauigkeit zu bewerten. Diese vielschichtige Rückkopplungsschleife löst das häufige Problem, dass frühere Modelle zwar einen Aspekt optimierten, andere dabei jedoch vernachlässigten.
Leichtgewichtig und effizient: Verarbeitung von 9-Sekunden-Videos in 0,6 Sekunden
Über die Genauigkeit hinaus bietet PrismAudio eine außergewöhnliche Geschwindigkeit. Durch den Einsatz seines proprietären Fast-GRPO-Trainingsalgorithmus erzielt das Modell eine erhebliche Leistungssteigerung bei gleichbleibender Betriebseffizienz:
Kompakte Architektur, große Wirkung: Mit nur 518 Millionen Parametern ist das Modell deutlich kleiner als vergleichbare Systeme, die oft mehrere zehn Milliarden Parameter erfordern.
Schnelle Reaktion: Die Erzeugung von hochwertigem Audio für einen 9-Sekunden-Videoclip dauert lediglich 0,63 Sekunden und kommt damit einer Echtzeitleistung sehr nahe.
Branchenperspektive: Der Aufstieg authentischer Umgebungsgeräusche
Die Einführung von PrismAudio bietet nicht nur ein robustes Automatisierungstool für die Film-Postproduktion und die Erstellung von Kurzvideos, sondern inspiriert auch zu neuen Ansätzen bei der Multi-Objekt-Generierung. Da KI ihre Fähigkeit verbessert, Audio-Textur und räumliche Positionierung in Einklang zu bringen, wird die zukünftige Videoproduktion zunehmend eine echte „What you see is what you hear“-Treue erreichen.
Link zum Artikel: arXiv:2511.18833
Open-Source-Link: https://prismaudio-project.github.io/
Verwandter Artikel
Neros Technologies sichert sich 250 Millionen US-Dollar, um bis 2026 Abwehrdrohnen einzusetzen
Neros Archer: Eine FPV-Drohhe, die für modulare Nutzlasten und widerstandsfähige Kommunikationsverbindungen konzipiert ist. | Quelle: NerosNeros Inc. hat eine Series-C-Finanzierungsrunde über 250 Millionen US-Dollar abgeschlossen, wodurch die Bewertu
Yushu Technology, der erste börsennotierte humanoide Aktienmarkt in China, plant die Notierung am 19. August mit einer Bewertung von rund 61 Milliarden Yuan.
Geplant für die Notierung an der Sci-Tech-Innovationsbörse am 19. August wird Yue Shu Technology mit einem Kurs von 150,80 Yuan pro Aktie an den Markt treten und eine Marktkapitalisierung nach der Emission von rund 60,993 Milliarden Yuan etablieren.
Ali Zhenwu M890 Ultra-Knoten jetzt kompatibel mit Qwen3.8, verfügbar auf der BaiLian-Plattform für Inferenz
Alibaba Cloud hat am 23. Juli bestätigt, dass sein Zhenwu M890-Supernode erfolgreich in das neueste Flaggschiff-Großmodell Qwen3.8 integriert wurde, wodurch er für Modellschlussfolgerungsdienste auf der Alibaba Cloud BaiLian-Plattform verfügbar ist.
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
In einer Zeit, in der die KI-gestützte Videogenerierung rasant zunimmt, stellt die Diskrepanz zwischen Bild und Ton – die sich oft in Form von Stille oder nicht synchronem Ton äußert – nach wie vor eine erhebliche Hürde für das Eintauchen des Zuschauers in das Geschehen dar. Um dieser Herausforderung zu begegnen, hat das Tongyi Lab von Alibaba „PrismAudio“ vorgestellt, ein neuartiges Framework zur Umwandlung von Video in Audio. Diese Forschungsarbeit, die von der führenden KI-Konferenz ICLR 2026 angenommen wurde, konzentriert sich auf die automatische Synchronisation von Videoinhalten mit präzisen Umgebungsgeräuschen.

Überlegungen vor der Generierung: Audio-Optimierung mit der „Chain of Thought“
Herkömmliche Modelle zur Audioerzeugung arbeiten in der Regel „intuitiv“ und liefern häufig unzusammenhängende Ergebnisse – beispielsweise klingen Pferdehufschläge wie Vogelgezwitscher oder das Audio hinkt der visuellen Handlung hinterher. PrismAudio zeichnet sich durch einen Ansatz aus, bei dem zuerst geplant und dann generiert wird.
Zerlegung der Gedankenkette: Vor der Audioerzeugung analysiert das Modell das Video Bild für Bild: Es identifiziert Szenenelemente, bestimmt den Zeitpunkt des Einsetzens von Geräuschen, bewertet Audioeigenschaften (z. B. Klarheit oder Tiefe) und lokalisiert die Schallquelle räumlich.
Mehrdimensionale Bewertung: Um eine hohe Ausgabequalität zu gewährleisten, integrierte das Entwicklungsteam verstärktes Lernen und nutzte vier „virtuelle Bewerter“, um die Ergebnisse hinsichtlich semantischer Konsistenz, zeitlicher Synchronisation, ästhetischer Qualität und räumlicher Genauigkeit zu bewerten. Diese vielschichtige Rückkopplungsschleife löst das häufige Problem, dass frühere Modelle zwar einen Aspekt optimierten, andere dabei jedoch vernachlässigten.
Leichtgewichtig und effizient: Verarbeitung von 9-Sekunden-Videos in 0,6 Sekunden
Über die Genauigkeit hinaus bietet PrismAudio eine außergewöhnliche Geschwindigkeit. Durch den Einsatz seines proprietären Fast-GRPO-Trainingsalgorithmus erzielt das Modell eine erhebliche Leistungssteigerung bei gleichbleibender Betriebseffizienz:
Kompakte Architektur, große Wirkung: Mit nur 518 Millionen Parametern ist das Modell deutlich kleiner als vergleichbare Systeme, die oft mehrere zehn Milliarden Parameter erfordern.
Schnelle Reaktion: Die Erzeugung von hochwertigem Audio für einen 9-Sekunden-Videoclip dauert lediglich 0,63 Sekunden und kommt damit einer Echtzeitleistung sehr nahe.
Branchenperspektive: Der Aufstieg authentischer Umgebungsgeräusche
Die Einführung von PrismAudio bietet nicht nur ein robustes Automatisierungstool für die Film-Postproduktion und die Erstellung von Kurzvideos, sondern inspiriert auch zu neuen Ansätzen bei der Multi-Objekt-Generierung. Da KI ihre Fähigkeit verbessert, Audio-Textur und räumliche Positionierung in Einklang zu bringen, wird die zukünftige Videoproduktion zunehmend eine echte „What you see is what you hear“-Treue erreichen.
Link zum Artikel: arXiv:2511.18833
Open-Source-Link: https://prismaudio-project.github.io/
Yushu Technology, der erste börsennotierte humanoide Aktienmarkt in China, plant die Notierung am 19. August mit einer Bewertung von rund 61 Milliarden Yuan.
Geplant für die Notierung an der Sci-Tech-Innovationsbörse am 19. August wird Yue Shu Technology mit einem Kurs von 150,80 Yuan pro Aktie an den Markt treten und eine Marktkapitalisierung nach der Emission von rund 60,993 Milliarden Yuan etablieren.
Ali Zhenwu M890 Ultra-Knoten jetzt kompatibel mit Qwen3.8, verfügbar auf der BaiLian-Plattform für Inferenz
Alibaba Cloud hat am 23. Juli bestätigt, dass sein Zhenwu M890-Supernode erfolgreich in das neueste Flaggschiff-Großmodell Qwen3.8 integriert wurde, wodurch er für Modellschlussfolgerungsdienste auf der Alibaba Cloud BaiLian-Plattform verfügbar ist.





Heim






