Lar
A Black Forest Labs apresenta o Flux3: o primeiro modelo multimodal nativo para geração audiovisual em 20 segundos
A Black Forest Labs, uma startup alemã de IA, lançou o Flux3, um modelo de base multimodal desenvolvido com base na arquitetura Self-Flow. Ele integra codecs dedicados para imagem, vídeo, áudio e movimento, permitindo uma compreensão e geração unificadas tanto de ambientes físicos quanto digitais.
A característica de destaque do Flux3 é a sincronização nativa de áudio e vídeo. Como o primeiro modelo multimodal a oferecer suporte à geração direta de áudio, ele produz clipes sincronizados com até 20 segundos de duração. O modelo lida com conversão de texto em imagem, de imagem em vídeo, transições baseadas em quadros-chave e diálogos com vários personagens, combinando recursos visuais e auditivos em uma única base.

Os primeiros testes comparativos mostram que o Flux3 supera os concorrentes. Na resolução de 720p com clipes de 10 segundos, ele alcançou uma taxa de vitórias de 93% em relação ao Luma Ray3.2 e uma vantagem de 77% sobre o Runway Gen-4.5, mantendo uma ligeira vantagem sobre modelos de ponta como o Seedance2.0 e o Gemini Omni Flash.
A Black Forest Labs também estendeu esses recursos à robótica por meio do Flux-mimic, desenvolvido em colaboração com a Mimic Robotics. Atualmente passando por testes de produção em uma fábrica da Audi, esse modelo demonstra a transição da IA multimodal das telas para aplicações industriais. Quanto à disponibilidade, o Flux3Video já está em operação, com o Flux3Image e os pesos de código aberto “Flux3Dev” com lançamento previsto para breve.
Artigo relacionado
WeChat anuncia cota de 1 bilhão de tokens para geração de imagens por IA, gratuita para os usuários
A Tencent Cloud Development divulgou hoje uma grande atualização, acelerando significativamente o Plano de Crescimento dos Miniprogramas de IA do WeChat. Para garantir que as ideias inovadoras dos des
Microsoft confirma atualização do Windows 11 para 2026: barra de tarefas volta, IA ativa o “desintox digital”
Após anos de sistema sobrecarregado e reputação controversa, a Microsoft finalmente decidiu realizar uma “grande cirurgia” no Windows 11. Pavan Davuluri, chefe da divisão do Windows da Microsoft, conf
Google lança as ferramentas jurídicas Gemini Enterprise para escritórios de advocacia
Na terça-feira, o Google ampliou sua plataforma Gemini Enterprise com o lançamento do Gemini Enterprise for Legal, uma solução dedicada a advogados e escritórios de advocacia, marcando uma intensifica
Recomendações de tópicos especiais relacionados
Comentários (0)
A Black Forest Labs, uma startup alemã de IA, lançou o Flux3, um modelo de base multimodal desenvolvido com base na arquitetura Self-Flow. Ele integra codecs dedicados para imagem, vídeo, áudio e movimento, permitindo uma compreensão e geração unificadas tanto de ambientes físicos quanto digitais.
A característica de destaque do Flux3 é a sincronização nativa de áudio e vídeo. Como o primeiro modelo multimodal a oferecer suporte à geração direta de áudio, ele produz clipes sincronizados com até 20 segundos de duração. O modelo lida com conversão de texto em imagem, de imagem em vídeo, transições baseadas em quadros-chave e diálogos com vários personagens, combinando recursos visuais e auditivos em uma única base.

Os primeiros testes comparativos mostram que o Flux3 supera os concorrentes. Na resolução de 720p com clipes de 10 segundos, ele alcançou uma taxa de vitórias de 93% em relação ao Luma Ray3.2 e uma vantagem de 77% sobre o Runway Gen-4.5, mantendo uma ligeira vantagem sobre modelos de ponta como o Seedance2.0 e o Gemini Omni Flash.
A Black Forest Labs também estendeu esses recursos à robótica por meio do Flux-mimic, desenvolvido em colaboração com a Mimic Robotics. Atualmente passando por testes de produção em uma fábrica da Audi, esse modelo demonstra a transição da IA multimodal das telas para aplicações industriais. Quanto à disponibilidade, o Flux3Video já está em operação, com o Flux3Image e os pesos de código aberto “Flux3Dev” com lançamento previsto para breve.
WeChat anuncia cota de 1 bilhão de tokens para geração de imagens por IA, gratuita para os usuários
A Tencent Cloud Development divulgou hoje uma grande atualização, acelerando significativamente o Plano de Crescimento dos Miniprogramas de IA do WeChat. Para garantir que as ideias inovadoras dos des
Microsoft confirma atualização do Windows 11 para 2026: barra de tarefas volta, IA ativa o “desintox digital”
Após anos de sistema sobrecarregado e reputação controversa, a Microsoft finalmente decidiu realizar uma “grande cirurgia” no Windows 11. Pavan Davuluri, chefe da divisão do Windows da Microsoft, conf
Google lança as ferramentas jurídicas Gemini Enterprise para escritórios de advocacia
Na terça-feira, o Google ampliou sua plataforma Gemini Enterprise com o lançamento do Gemini Enterprise for Legal, uma solução dedicada a advogados e escritórios de advocacia, marcando uma intensifica











