Дом
Лаборатория Tongyi компании Alibaba открыла исходный код Fun-CineForge, решив проблему дубляжа с участием нескольких дикторов
Традиционный дубляж с использованием искусственного интеллекта зачастую не справляется с задачами в таких ответственных проектах, как кино и анимация, где первостепенное значение имеет передача тонких эмоциональных пиков и идеальная синхронизация с движением губ. Чтобы решить эту ключевую проблему отрасли, Tongyi Lab официально представила и открыла исходный код революционной мультимодальной модели дубляжа киноуровня для различных сценариев — Fun-CineForge .
Преодоление аудиовизуального разрыва: четырехкомпонентная структура для безупречной синхронизации
Вместо того чтобы полагаться на базовую технологию преобразования текста в речь, Fun-CineForge разработана для овладения четырьмя критически важными аспектами профессионального дубляжа:
Синхронизация губ: обеспечивает исключительную точность совпадения синтезированной речи с движениями рта персонажа на экране.
Эмоциональная экспрессия: наполняет голос аутентичными человеческими эмоциями путем анализа мимики и контекстуальных инструкций.
Единообразие голоса: поддерживает стабильную, узнаваемую голосовую индивидуальность конкретных персонажей в сложных диалоговых сценах с участием нескольких говорящих.
Синхронизация по времени: позволяет вставлять диалоги с точностью до миллисекунд, даже если говорящий находится за кадром или частично скрыт.
Основная инновация: новаторская «временная модальность» и набор данных высокой точности
Технический прорыв Fun-CineForge обусловлен уникальной философией совместного проектирования «данные + модель»:

Набор данных высокого качества CineDub: Tongyi Lab также открыла исходный код автоматизированного конвейера построения набора данных CineDub. Используя механизм исправления ошибок по цепочке мыслей, он снижает уровень ошибок транскрипции для китайского и английского текстов примерно до 1%–2% и сокращает ошибки диаризации говорящих до 1,2%.
Архитектура слияния четырех модальностей: Модель впервые интегрирует «временную модальность», совместно моделируя визуальные входы (форма губ и мимика), текст (диалог и эмоциональный контекст) и аудио (голосовой эталон). Такое слияние позволяет обеспечить точную синхронизацию в сложных сценах, включая те, где лица не видны.
Доказанное превосходство: новаторский дубляж аутентичных диалогов с участием нескольких персонажей
Результаты тестирования показывают, что Fun-CineForge значительно превосходит базовые модели, такие как DeepDubber-V1, по ключевым показателям: коэффициенту ошибок слов (WER/CER), синхронизации губ (LSE-C/D) и сходству голосов. Знаковым достижением является уникальная способность точно обрабатывать дуэты и многосторонние диалоги, демонстрируя замечательную устойчивость в видеороликах длительностью до 30 секунд.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Связанная статья
iFLYTEK представляет общую большую модель Spark X2.5
1 сентября iFlytek откроет открытый доступ к двум большим языковым моделям, ориентированным на работу на периферийных устройствах: Xinghuo X2.5-4B и Xinghuo X2.5-1.7B, согласно последнему официальному заявлению. Обе модели изначально поддерживают кон
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
Рекомендации по связанным специальным темам
Комментарии (0)
Традиционный дубляж с использованием искусственного интеллекта зачастую не справляется с задачами в таких ответственных проектах, как кино и анимация, где первостепенное значение имеет передача тонких эмоциональных пиков и идеальная синхронизация с движением губ. Чтобы решить эту ключевую проблему отрасли, Tongyi Lab официально представила и открыла исходный код революционной мультимодальной модели дубляжа киноуровня для различных сценариев —
Преодоление аудиовизуального разрыва: четырехкомпонентная структура для безупречной синхронизации
Вместо того чтобы полагаться на базовую технологию преобразования текста в речь, Fun-CineForge разработана для овладения четырьмя критически важными аспектами профессионального дубляжа:
Синхронизация губ: обеспечивает исключительную точность совпадения синтезированной речи с движениями рта персонажа на экране.
Эмоциональная экспрессия: наполняет голос аутентичными человеческими эмоциями путем анализа мимики и контекстуальных инструкций.
Единообразие голоса: поддерживает стабильную, узнаваемую голосовую индивидуальность конкретных персонажей в сложных диалоговых сценах с участием нескольких говорящих.
Синхронизация по времени: позволяет вставлять диалоги с точностью до миллисекунд, даже если говорящий находится за кадром или частично скрыт.
Основная инновация: новаторская «временная модальность» и набор данных высокой точности
Технический прорыв Fun-CineForge обусловлен уникальной философией совместного проектирования «данные + модель»:

Набор данных высокого качества CineDub: Tongyi Lab также открыла исходный код автоматизированного конвейера построения набора данных CineDub. Используя механизм исправления ошибок по цепочке мыслей, он снижает уровень ошибок транскрипции для китайского и английского текстов примерно до 1%–2% и сокращает ошибки диаризации говорящих до 1,2%.
Архитектура слияния четырех модальностей: Модель впервые интегрирует «временную модальность», совместно моделируя визуальные входы (форма губ и мимика), текст (диалог и эмоциональный контекст) и аудио (голосовой эталон). Такое слияние позволяет обеспечить точную синхронизацию в сложных сценах, включая те, где лица не видны.
Доказанное превосходство: новаторский дубляж аутентичных диалогов с участием нескольких персонажей
Результаты тестирования показывают, что Fun-CineForge значительно превосходит базовые модели, такие как DeepDubber-V1, по ключевым показателям: коэффициенту ошибок слов (WER/CER), синхронизации губ (LSE-C/D) и сходству голосов. Знаковым достижением является уникальная способность точно обрабатывать дуэты и многосторонние диалоги, демонстрируя замечательную устойчивость в видеороликах длительностью до 30 секунд.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
iFLYTEK представляет общую большую модель Spark X2.5
1 сентября iFlytek откроет открытый доступ к двум большим языковым моделям, ориентированным на работу на периферийных устройствах: Xinghuo X2.5-4B и Xinghuo X2.5-1.7B, согласно последнему официальному заявлению. Обе модели изначально поддерживают кон
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи











