Дом
Подразделение Tongyi компании Alibaba представило Fun-CineForge: модель искусственного интеллекта с открытым исходным кодом, обеспечивающая синтез речи кинематографического качества
16 марта лаборатория Alibaba Tongyi Lab официально представила и открыла исходный код мультимодальной модели Fun-CineForge для синтеза голоса киноуровня, предназначенной для различных сценариев. Эта модель решает основные проблемы в области дубляжа с помощью ИИ, включая несоответствие синхронизации губ, недостаток эмоциональной выразительности и несогласованность голосовых характеристик у разных персонажей. Кроме того, в ней представлен высококачественный метод построения наборов данных.

С технической точки зрения Fun-CineForge является пионером концепции «временной модальности». В отличие от традиционных моделей, которые сосредоточены исключительно на тексте или визуальных элементах, она обеспечивает синтез голоса в точных временных интервалах благодаря точному управлению временными метками. Даже в сложных сценах фильмов с закрытыми персонажами, частыми переключениями камеры или размытыми лицами модель сохраняет высокую степень аудиовизуальной синхронизации и соблюдения инструкций.
Еще одним ключевым нововведением является сопутствующий конвейер построения набора данных CineDub с открытым исходным кодом. Tongyi Lab использовала цепочку рассуждений на основе крупных языковых моделей для автоматического преобразования необработанных видеоматериалов в структурированные данные, что значительно сократило необходимость в ручной аннотации. Этот процесс обеспечивает уровень ошибок по словам примерно 1% и уровень ошибок диаризации говорящих всего 1,20%, создавая высококонкурентную основу для обучения крупных моделей.

Fun-CineForge теперь доступен на GitHub, HuggingFace и в сообществе ModelScope, поддерживая инференцию для видеороликов длиной до 30 секунд. Он превосходен не только в монологах одного говорящего, но и предлагает профессиональную поддержку для сценариев диалогов в дуэте и с участием нескольких говорящих. Этот прорыв сигнализирует об эволюции технологии голосового ИИ от базовых ролей в обслуживании клиентов и в качестве помощников к высококачественной анимации и постпродакшну фильмов.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
16 марта лаборатория Alibaba Tongyi Lab официально представила и открыла исходный код мультимодальной модели Fun-CineForge для синтеза голоса киноуровня, предназначенной для различных сценариев. Эта модель решает основные проблемы в области дубляжа с помощью ИИ, включая несоответствие синхронизации губ, недостаток эмоциональной выразительности и несогласованность голосовых характеристик у разных персонажей. Кроме того, в ней представлен высококачественный метод построения наборов данных.

С технической точки зрения Fun-CineForge является пионером концепции «временной модальности». В отличие от традиционных моделей, которые сосредоточены исключительно на тексте или визуальных элементах, она обеспечивает синтез голоса в точных временных интервалах благодаря точному управлению временными метками. Даже в сложных сценах фильмов с закрытыми персонажами, частыми переключениями камеры или размытыми лицами модель сохраняет высокую степень аудиовизуальной синхронизации и соблюдения инструкций.
Еще одним ключевым нововведением является сопутствующий конвейер построения набора данных CineDub с открытым исходным кодом. Tongyi Lab использовала цепочку рассуждений на основе крупных языковых моделей для автоматического преобразования необработанных видеоматериалов в структурированные данные, что значительно сократило необходимость в ручной аннотации. Этот процесс обеспечивает уровень ошибок по словам примерно 1% и уровень ошибок диаризации говорящих всего 1,20%, создавая высококонкурентную основу для обучения крупных моделей.

Fun-CineForge теперь доступен на GitHub, HuggingFace и в сообществе ModelScope, поддерживая инференцию для видеороликов длиной до 30 секунд. Он превосходен не только в монологах одного говорящего, но и предлагает профессиональную поддержку для сценариев диалогов в дуэте и с участием нескольких говорящих. Этот прорыв сигнализирует об эволюции технологии голосового ИИ от базовых ролей в обслуживании клиентов и в качестве помощников к высококачественной анимации и постпродакшну фильмов.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











