Tongyi Lab представляет PrismAudio для двунаправленного разделения аудио и видео
В эпоху стремительного развития технологий генерации видео с помощью ИИ несогласованность между изображением и звуком — часто проявляющаяся в виде тишины или несоответствия звукового сопровождения — по-прежнему остается серьезным препятствием для погружения зрителя в происходящее. Решая эту проблему, лаборатория Tongyi Lab компании Alibaba представила PrismAudio — инновационную платформу для преобразования видео в аудио. Это исследование, принятое к публикации на ведущей конференции по искусственному интеллекту ICLR 2026, посвящено автоматической синхронизации видеоконтента с точными звуковыми эффектами окружающей среды.

Анализ перед генерацией: управление звуком с помощью «цепочки мыслей»
Обычные модели генерации звука, как правило, работают на основе «интуиции», что часто приводит к несогласованным результатам — например, когда стук копыт лошади звучит как щебетание птиц, или звук отстает от визуального действия. PrismAudio отличается тем, что использует подход «сначала план, потом генерация».
Цепочка декомпозиции мысли: перед генерацией звука модель анализирует видео кадр за кадром: идентифицирует элементы сцены, определяет момент появления звука, оценивает характеристики звука (например, четкость или глубину) и локализует источник звука в пространстве.
Многомерная оценка: чтобы обеспечить высокое качество результатов, команда разработчиков интегрировала метод обучения с подкреплением, используя четыре «виртуальных оценщика» для оценки результатов по таким критериям, как семантическая согласованность, временная синхронизация, эстетическое качество и пространственная точность. Эта многогранная петля обратной связи решает распространенную проблему, когда предыдущие модели оптимизировались под один аспект, игнорируя остальные.
Легкость и эффективность: обработка 9-секундных видео за 0,6 секунды
Помимо точности, PrismAudio обеспечивает исключительную скорость. Благодаря собственному алгоритму обучения Fast-GRPO модель достигает значительного повышения производительности при сохранении операционной эффективности:
Компактная архитектура, высокая эффективность: с всего лишь 518 миллионами параметров модель значительно меньше, чем сопоставимые системы, которым часто требуются десятки миллиардов параметров.
Быстрая реакция: генерация высококачественного аудио для 9-секундного видеоролика занимает всего 0,63 секунды, что близко к производительности в режиме реального времени.
Взгляд из отрасли: рост популярности аутентичного окружающего звука
Запуск PrismAudio не только предоставляет надёжный инструмент автоматизации для постпродакшна фильмов и создания короткометражных видео, но и вдохновляет на новые подходы к генерации нескольких объектов. По мере того как ИИ совершенствует свою способность балансировать текстуру звука и пространственное позиционирование, будущее видеопроизводство будет всё в большей степени достигать подлинной точности по принципу «что видишь, то и слышишь».
Ссылка на статью: arXiv:2511.18833
Ссылка на открытый исходный код: https://prismaudio-project.github.io/
Связанная статья
Юйшу Технологии, первая акция A-Share в сфере человекоподобных роботов, устанавливает 19 августа листинг с оценкой ~61 миллиард юаней
Запланированное к листингу на Сцене технологических инноваций 19 августа, Yue Shu Technology дебютирует по цене 150,80 юаней за акцию, формируя рыночную капитализацию после выпуска примерно в 60,993 млрд юаней. При коэффициенте цена/прибыль (P/E) 219
Узел Ali Zhenwu M890 Ultra теперь совместим с Qwen3.8, доступен на платформе BaiLian для вывода
Alibaba Cloud подтвердила 23 июля, что её супернода Zhenwu M890 успешно интегрирована с новейшей флагманской большой языковой моделью Qwen3.8, сделав её доступной для сервисов вывода моделей на платформе Alibaba Cloud BaiLian. Этот рубеж закрепляет з
Spotify вводит теги ИИ-персон; алгоритмические плейлисты по умолчанию исключают виртуальных ИИ-артистов
11 августа Spotify объявил о запуске системы тегирования профилей «ИИ-персонаж» (AI Persona) в середине сентября. Эта инициатива четко идентифицирует виртуальных исполнителей, созданных с помощью искусственного интеллекта, и по умолчанию исключает та
Рекомендации по связанным специальным темам
Комментарии (0)
В эпоху стремительного развития технологий генерации видео с помощью ИИ несогласованность между изображением и звуком — часто проявляющаяся в виде тишины или несоответствия звукового сопровождения — по-прежнему остается серьезным препятствием для погружения зрителя в происходящее. Решая эту проблему, лаборатория Tongyi Lab компании Alibaba представила PrismAudio — инновационную платформу для преобразования видео в аудио. Это исследование, принятое к публикации на ведущей конференции по искусственному интеллекту ICLR 2026, посвящено автоматической синхронизации видеоконтента с точными звуковыми эффектами окружающей среды.

Анализ перед генерацией: управление звуком с помощью «цепочки мыслей»
Обычные модели генерации звука, как правило, работают на основе «интуиции», что часто приводит к несогласованным результатам — например, когда стук копыт лошади звучит как щебетание птиц, или звук отстает от визуального действия. PrismAudio отличается тем, что использует подход «сначала план, потом генерация».
Цепочка декомпозиции мысли: перед генерацией звука модель анализирует видео кадр за кадром: идентифицирует элементы сцены, определяет момент появления звука, оценивает характеристики звука (например, четкость или глубину) и локализует источник звука в пространстве.
Многомерная оценка: чтобы обеспечить высокое качество результатов, команда разработчиков интегрировала метод обучения с подкреплением, используя четыре «виртуальных оценщика» для оценки результатов по таким критериям, как семантическая согласованность, временная синхронизация, эстетическое качество и пространственная точность. Эта многогранная петля обратной связи решает распространенную проблему, когда предыдущие модели оптимизировались под один аспект, игнорируя остальные.
Легкость и эффективность: обработка 9-секундных видео за 0,6 секунды
Помимо точности, PrismAudio обеспечивает исключительную скорость. Благодаря собственному алгоритму обучения Fast-GRPO модель достигает значительного повышения производительности при сохранении операционной эффективности:
Компактная архитектура, высокая эффективность: с всего лишь 518 миллионами параметров модель значительно меньше, чем сопоставимые системы, которым часто требуются десятки миллиардов параметров.
Быстрая реакция: генерация высококачественного аудио для 9-секундного видеоролика занимает всего 0,63 секунды, что близко к производительности в режиме реального времени.
Взгляд из отрасли: рост популярности аутентичного окружающего звука
Запуск PrismAudio не только предоставляет надёжный инструмент автоматизации для постпродакшна фильмов и создания короткометражных видео, но и вдохновляет на новые подходы к генерации нескольких объектов. По мере того как ИИ совершенствует свою способность балансировать текстуру звука и пространственное позиционирование, будущее видеопроизводство будет всё в большей степени достигать подлинной точности по принципу «что видишь, то и слышишь».
Ссылка на статью: arXiv:2511.18833
Ссылка на открытый исходный код: https://prismaudio-project.github.io/
Юйшу Технологии, первая акция A-Share в сфере человекоподобных роботов, устанавливает 19 августа листинг с оценкой ~61 миллиард юаней
Запланированное к листингу на Сцене технологических инноваций 19 августа, Yue Shu Technology дебютирует по цене 150,80 юаней за акцию, формируя рыночную капитализацию после выпуска примерно в 60,993 млрд юаней. При коэффициенте цена/прибыль (P/E) 219
Узел Ali Zhenwu M890 Ultra теперь совместим с Qwen3.8, доступен на платформе BaiLian для вывода
Alibaba Cloud подтвердила 23 июля, что её супернода Zhenwu M890 успешно интегрирована с новейшей флагманской большой языковой моделью Qwen3.8, сделав её доступной для сервисов вывода моделей на платформе Alibaba Cloud BaiLian. Этот рубеж закрепляет з
Spotify вводит теги ИИ-персон; алгоритмические плейлисты по умолчанию исключают виртуальных ИИ-артистов
11 августа Spotify объявил о запуске системы тегирования профилей «ИИ-персонаж» (AI Persona) в середине сентября. Эта инициатива четко идентифицирует виртуальных исполнителей, созданных с помощью искусственного интеллекта, и по умолчанию исключает та





Дом






