Lar
A Tongyi, do Alibaba, lança o Fun-CineForge: modelo de IA de código aberto alcança síntese de voz com qualidade cinematográfica
O Alibaba Tongyi Lab lançou oficialmente e disponibilizou como código aberto, em 16 de março, o modelo multimodal de síntese de voz para múltiplos cenários e com qualidade cinematográfica, denominado Fun-CineForge. Esse modelo aborda os principais desafios da dublagem por IA, incluindo a falta de sincronização labial, a ausência de expressão emocional e as características vocais inconsistentes entre vários personagens. Ele também apresenta um método de alta qualidade para a construção de conjuntos de dados.

Tecnicamente, o Fun-CineForge é pioneiro no conceito de “modalidade temporal”. Ao contrário dos modelos convencionais que se concentram exclusivamente em texto ou imagens, ele garante que a síntese de voz ocorra em intervalos de tempo precisos por meio de um controle preciso de marcações de tempo. Mesmo em cenas cinematográficas complexas com personagens ocultos, cortes frequentes de câmera ou rostos desfocados, o modelo mantém um alto grau de sincronização audiovisual e adesão às instruções.
O pipeline de construção do conjunto de dados CineDub de código aberto que o acompanha é outra inovação fundamental. O Tongyi Lab empregou o raciocínio em cadeia de pensamento de grandes modelos de linguagem para transformar automaticamente filmagens brutas em dados estruturados, reduzindo significativamente a necessidade de anotação manual. Esse processo alcança uma taxa de erro de palavras de aproximadamente 1% e uma taxa de erro de diarização de falantes de apenas 1,20%, fornecendo uma base de treinamento altamente competitiva para grandes modelos.

O Fun-CineForge já está disponível no GitHub, HuggingFace e na comunidade ModelScope, oferecendo suporte à inferência para clipes de vídeo de até 30 segundos de duração. Ele se destaca não apenas em monólogos de um único locutor, mas também oferece suporte de nível profissional para cenários de diálogos em dueto e com múltiplos locutores. Esse avanço sinaliza a evolução da tecnologia de voz com IA, passando de funções básicas de atendimento ao cliente e assistência para a pós-produção de animações e filmes de alto padrão.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Artigo relacionado
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Em 14 de maio de 2026, a plataforma de desenvolvimento de aplicações de IA Lovable anunciou sua participação na rodada de investimento inicial (seed) de US$ 800.000 para a startup dinamarquesa de hardware Atech. Liderada pela Lovable, a rodada atraiu
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
Recomendações de tópicos especiais relacionados
Comentários (1)
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.
O Alibaba Tongyi Lab lançou oficialmente e disponibilizou como código aberto, em 16 de março, o modelo multimodal de síntese de voz para múltiplos cenários e com qualidade cinematográfica, denominado Fun-CineForge. Esse modelo aborda os principais desafios da dublagem por IA, incluindo a falta de sincronização labial, a ausência de expressão emocional e as características vocais inconsistentes entre vários personagens. Ele também apresenta um método de alta qualidade para a construção de conjuntos de dados.

Tecnicamente, o Fun-CineForge é pioneiro no conceito de “modalidade temporal”. Ao contrário dos modelos convencionais que se concentram exclusivamente em texto ou imagens, ele garante que a síntese de voz ocorra em intervalos de tempo precisos por meio de um controle preciso de marcações de tempo. Mesmo em cenas cinematográficas complexas com personagens ocultos, cortes frequentes de câmera ou rostos desfocados, o modelo mantém um alto grau de sincronização audiovisual e adesão às instruções.
O pipeline de construção do conjunto de dados CineDub de código aberto que o acompanha é outra inovação fundamental. O Tongyi Lab empregou o raciocínio em cadeia de pensamento de grandes modelos de linguagem para transformar automaticamente filmagens brutas em dados estruturados, reduzindo significativamente a necessidade de anotação manual. Esse processo alcança uma taxa de erro de palavras de aproximadamente 1% e uma taxa de erro de diarização de falantes de apenas 1,20%, fornecendo uma base de treinamento altamente competitiva para grandes modelos.

O Fun-CineForge já está disponível no GitHub, HuggingFace e na comunidade ModelScope, oferecendo suporte à inferência para clipes de vídeo de até 30 segundos de duração. Ele se destaca não apenas em monólogos de um único locutor, mas também oferece suporte de nível profissional para cenários de diálogos em dueto e com múltiplos locutores. Esse avanço sinaliza a evolução da tecnologia de voz com IA, passando de funções básicas de atendimento ao cliente e assistência para a pós-produção de animações e filmes de alto padrão.
GitHub: https://github.com/FunAudioLLM/FunCineForge
HuggingFace: https://huggingface.co/FunAudioLLM/Fun-CineForge
ModelScope: https://www.modelscope.cn/models/FunAudioLLM/Fun-CineForge/
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
Em 14 de maio de 2026, a plataforma de desenvolvimento de aplicações de IA Lovable anunciou sua participação na rodada de investimento inicial (seed) de US$ 800.000 para a startup dinamarquesa de hardware Atech. Liderada pela Lovable, a rodada atraiu
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
Just tried the demo and honestly blown away by how natural the lip-sync feels now! 😮 Always thought AI dubbing sounded a bit robotic, but this seems like a huge leap. Wonder if this will start being used in indie films or even gaming soon? The open-source move is pretty bold too—curious to see how other companies respond.











