O Tongyi Lab apresenta o PrismAudio para separação audiovisual bidirecional
Em uma era em que a geração de vídeos por IA está se expandindo rapidamente, a desconexão entre o visual e o áudio — que muitas vezes se manifesta como silêncio ou som descompassado — continua sendo um obstáculo significativo para a imersão do espectador. Para enfrentar esse desafio, o Tongyi Lab, da Alibaba, revelou o PrismAudio, uma nova estrutura de conversão de vídeo em áudio. Essa pesquisa, aceita pela importante conferência de IA ICLR 2026, concentra-se na sincronização automática de conteúdo de vídeo com efeitos sonoros ambientais precisos.

Raciocínio antes da geração: dominando o áudio com a “cadeia de pensamento”
Os modelos convencionais de geração de áudio geralmente operam de forma “intuitiva”, produzindo frequentemente resultados desconexos — como o barulho dos cascos de um cavalo soando como o chilrear de pássaros, ou o áudio ficando atrasado em relação à ação visual. O PrismAudio se destaca por empregar uma abordagem do tipo “planejar primeiro, depois gerar”.
Cadeia de pensamento de decomposição: antes de gerar o áudio, o modelo analisa o vídeo quadro a quadro: identificando elementos da cena, determinando o momento de início do som, avaliando características do áudio (por exemplo, nitidez ou profundidade) e localizando espacialmente a fonte sonora.
Avaliação multidimensional: Para garantir uma saída de alta qualidade, a equipe de desenvolvimento integrou o aprendizado por reforço, utilizando quatro “avaliadores virtuais” para pontuar os resultados em termos de consistência semântica, sincronização temporal, qualidade estética e precisão espacial. Esse ciclo de feedback multifacetado resolve o problema comum em que modelos anteriores otimizavam um aspecto, mas negligenciavam outros.
Leve e eficiente: processando vídeos de 9 segundos em 0,6 segundos
Além da precisão, o PrismAudio oferece velocidade excepcional. Aproveitando seu algoritmo de treinamento proprietário Fast-GRPO, o modelo alcança um aumento substancial de desempenho, mantendo a eficiência operacional:
Arquitetura compacta, alto impacto: com apenas 518 milhões de parâmetros, o modelo é significativamente menor do que sistemas comparáveis, que frequentemente exigem dezenas de bilhões de parâmetros.
Resposta rápida: a geração de áudio de alta qualidade para um clipe de vídeo de 9 segundos leva apenas 0,63 segundos, aproximando-se do desempenho em tempo real.
Perspectiva do setor: a ascensão do áudio ambiente autêntico
O lançamento do PrismAudio não apenas oferece uma ferramenta robusta de automação para a pós-produção cinematográfica e a criação de vídeos curtos, mas também inspira novas abordagens para a geração de múltiplos objetos. À medida que a IA aprimora sua capacidade de equilibrar a textura do áudio e o posicionamento espacial, a produção de vídeo no futuro alcançará cada vez mais a verdadeira fidelidade do princípio “o que você vê é o que você ouve”.
Link do artigo: arXiv:2511.18833
Link do código-fonte: https://prismaudio-project.github.io/
Artigo relacionado
A Neros Technologies garante US$ 250 milhões para implantar drones de defesa até 2026
Neros Archer: Um drone FPV projetado para cargas úteis modulares e links de comunicação resilientes. | Fonte: NerosA Neros Inc. fechou uma rodada de financiamento da Série C de $250 milhões, elevando a avaliação da contratante de drones de defesa par
Yushu Technology, a primeira ação de robôs humanoides listada no mercado A-share, define 19 de agosto como data de listagem, com avaliação de aproximadamente 61 bilhões de yuans.
Agendada para listagem na Bolsa de Inovação Científica e Tecnológica em 19 de agosto, a Yue Shu Technology estreia a 150,80 yuan por ação, estabelecendo uma capitalização de mercado pós-emissão de aproximadamente 60,993 bilhões de yuan. Com uma relaç
Nó Ali Zhenwu M890 Ultra agora compatível com Qwen3.8, disponível na plataforma BaiLian para inferência
A Alibaba Cloud confirmou em 23 de julho que seu supernó Zhenwu M890 foi integrado com sucesso ao mais recente modelo de grande escala de ponta, Qwen3.8, tornando-o disponível para serviços de inferência de modelos na plataforma Alibaba Cloud BaiLian
Recomendações de tópicos especiais relacionados
Comentários (0)
Em uma era em que a geração de vídeos por IA está se expandindo rapidamente, a desconexão entre o visual e o áudio — que muitas vezes se manifesta como silêncio ou som descompassado — continua sendo um obstáculo significativo para a imersão do espectador. Para enfrentar esse desafio, o Tongyi Lab, da Alibaba, revelou o PrismAudio, uma nova estrutura de conversão de vídeo em áudio. Essa pesquisa, aceita pela importante conferência de IA ICLR 2026, concentra-se na sincronização automática de conteúdo de vídeo com efeitos sonoros ambientais precisos.

Raciocínio antes da geração: dominando o áudio com a “cadeia de pensamento”
Os modelos convencionais de geração de áudio geralmente operam de forma “intuitiva”, produzindo frequentemente resultados desconexos — como o barulho dos cascos de um cavalo soando como o chilrear de pássaros, ou o áudio ficando atrasado em relação à ação visual. O PrismAudio se destaca por empregar uma abordagem do tipo “planejar primeiro, depois gerar”.
Cadeia de pensamento de decomposição: antes de gerar o áudio, o modelo analisa o vídeo quadro a quadro: identificando elementos da cena, determinando o momento de início do som, avaliando características do áudio (por exemplo, nitidez ou profundidade) e localizando espacialmente a fonte sonora.
Avaliação multidimensional: Para garantir uma saída de alta qualidade, a equipe de desenvolvimento integrou o aprendizado por reforço, utilizando quatro “avaliadores virtuais” para pontuar os resultados em termos de consistência semântica, sincronização temporal, qualidade estética e precisão espacial. Esse ciclo de feedback multifacetado resolve o problema comum em que modelos anteriores otimizavam um aspecto, mas negligenciavam outros.
Leve e eficiente: processando vídeos de 9 segundos em 0,6 segundos
Além da precisão, o PrismAudio oferece velocidade excepcional. Aproveitando seu algoritmo de treinamento proprietário Fast-GRPO, o modelo alcança um aumento substancial de desempenho, mantendo a eficiência operacional:
Arquitetura compacta, alto impacto: com apenas 518 milhões de parâmetros, o modelo é significativamente menor do que sistemas comparáveis, que frequentemente exigem dezenas de bilhões de parâmetros.
Resposta rápida: a geração de áudio de alta qualidade para um clipe de vídeo de 9 segundos leva apenas 0,63 segundos, aproximando-se do desempenho em tempo real.
Perspectiva do setor: a ascensão do áudio ambiente autêntico
O lançamento do PrismAudio não apenas oferece uma ferramenta robusta de automação para a pós-produção cinematográfica e a criação de vídeos curtos, mas também inspira novas abordagens para a geração de múltiplos objetos. À medida que a IA aprimora sua capacidade de equilibrar a textura do áudio e o posicionamento espacial, a produção de vídeo no futuro alcançará cada vez mais a verdadeira fidelidade do princípio “o que você vê é o que você ouve”.
Link do artigo: arXiv:2511.18833
Link do código-fonte: https://prismaudio-project.github.io/
Yushu Technology, a primeira ação de robôs humanoides listada no mercado A-share, define 19 de agosto como data de listagem, com avaliação de aproximadamente 61 bilhões de yuans.
Agendada para listagem na Bolsa de Inovação Científica e Tecnológica em 19 de agosto, a Yue Shu Technology estreia a 150,80 yuan por ação, estabelecendo uma capitalização de mercado pós-emissão de aproximadamente 60,993 bilhões de yuan. Com uma relaç
Nó Ali Zhenwu M890 Ultra agora compatível com Qwen3.8, disponível na plataforma BaiLian para inferência
A Alibaba Cloud confirmou em 23 de julho que seu supernó Zhenwu M890 foi integrado com sucesso ao mais recente modelo de grande escala de ponta, Qwen3.8, tornando-o disponível para serviços de inferência de modelos na plataforma Alibaba Cloud BaiLian





Lar






