Lar
O CEO da DeepMind Demis Hassabis anuncia a integração futura dos modelos Gemini and Veo AI do Google

Em um recente episódio do podcast Possible, coapresentado pelo cofundador do LinkedIn, Reid Hoffman, o CEO da Google DeepMind, Demis Hassabis, compartilhou algumas notícias empolgantes sobre os planos do Google. Ele revelou que o Google está buscando fundir seus modelos de IA Gemini com os modelos de geração de vídeo Veo. Essa fusão visa aprimorar a compreensão do Gemini sobre o mundo físico, tornando-o mais apto a entender dinâmicas da vida real.
Hassabis enfatizou que, desde o início, o Gemini foi projetado para ser multimodal. "Sempre construímos o Gemini, nosso modelo de fundação, para ser multimodal desde o começo," ele explicou. A motivação por trás dessa abordagem? Uma visão para um assistente digital universal que possa realmente ajudar na vida cotidiana. "Um assistente que … realmente te ajuda no mundo real," Hassabis elaborou.
A indústria de IA está progredindo constantemente em direção ao que você poderia chamar de modelos "omni" — aqueles capazes de lidar e sintetizar vários tipos de mídia. As últimas iterações do Gemini do Google, por exemplo, podem produzir não apenas texto, mas também áudio e imagens. Enquanto isso, o modelo padrão do ChatGPT da OpenAI pode criar imagens na hora, incluindo arte encantadora no estilo Studio Ghibli. A Amazon não está muito atrás, com planos de lançar um modelo "any-to-any" ainda este ano.
Esses modelos omni exigem uma quantidade considerável de dados de treinamento — pense em imagens, vídeos, áudio e texto. Hassabis sugeriu que os dados de vídeo do Veo vêm principalmente do YouTube, um tesouro pertencente ao Google. "Basicamente, ao assistir a vídeos do YouTube — muitos vídeos do YouTube — [Veo 2] pode descobrir, sabe, a física do mundo," ele observou.
O Google havia mencionado anteriormente ao TechCrunch que seus modelos "podem ser" treinados com "algum" conteúdo do YouTube, em conformidade com acordos feitos com criadores do YouTube. Vale notar que, no último ano, o Google expandiu seus termos de serviço, em parte para acessar mais dados para treinar seus modelos de IA.
Artigo relacionado
A Gemini oferece geração personalizada e gratuita de imagens por IA para usuários dos EUA
Na segunda-feira, o Google revelou que o aplicativo Gemini está ampliando seus recursos de geração personalizada de imagens, desenvolvidos pela Nano Banana, para um público mais amplo. A partir de hoj
Novas funcionalidades do Gemini devem ser integradas ao Google TV em breve
Na quarta-feira, o Google revelou uma série de novos recursos baseados em IA que chegarão ao Google TV, incluindo uma seção dedicada a vídeos curtos que colocará o YouTube Shorts diretamente na tela i
Novos produtos apresentados no Made by Google ’26: Pixel 11, Pixel Watch 5, Pixel Tag e recursos aprimorados do Gemini
Durante o evento “Made by Google 2026”, realizado na quarta-feira, o Google revelou uma série de novos produtos, incluindo a série Pixel 11, o Pixel Watch 5 e um dispositivo de rastreamento projetado
Recomendações de tópicos especiais relacionados
Comentários (2)
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.

Em um recente episódio do podcast Possible, coapresentado pelo cofundador do LinkedIn, Reid Hoffman, o CEO da Google DeepMind, Demis Hassabis, compartilhou algumas notícias empolgantes sobre os planos do Google. Ele revelou que o Google está buscando fundir seus modelos de IA Gemini com os modelos de geração de vídeo Veo. Essa fusão visa aprimorar a compreensão do Gemini sobre o mundo físico, tornando-o mais apto a entender dinâmicas da vida real.
Hassabis enfatizou que, desde o início, o Gemini foi projetado para ser multimodal. "Sempre construímos o Gemini, nosso modelo de fundação, para ser multimodal desde o começo," ele explicou. A motivação por trás dessa abordagem? Uma visão para um assistente digital universal que possa realmente ajudar na vida cotidiana. "Um assistente que … realmente te ajuda no mundo real," Hassabis elaborou.
A indústria de IA está progredindo constantemente em direção ao que você poderia chamar de modelos "omni" — aqueles capazes de lidar e sintetizar vários tipos de mídia. As últimas iterações do Gemini do Google, por exemplo, podem produzir não apenas texto, mas também áudio e imagens. Enquanto isso, o modelo padrão do ChatGPT da OpenAI pode criar imagens na hora, incluindo arte encantadora no estilo Studio Ghibli. A Amazon não está muito atrás, com planos de lançar um modelo "any-to-any" ainda este ano.
Esses modelos omni exigem uma quantidade considerável de dados de treinamento — pense em imagens, vídeos, áudio e texto. Hassabis sugeriu que os dados de vídeo do Veo vêm principalmente do YouTube, um tesouro pertencente ao Google. "Basicamente, ao assistir a vídeos do YouTube — muitos vídeos do YouTube — [Veo 2] pode descobrir, sabe, a física do mundo," ele observou.
O Google havia mencionado anteriormente ao TechCrunch que seus modelos "podem ser" treinados com "algum" conteúdo do YouTube, em conformidade com acordos feitos com criadores do YouTube. Vale notar que, no último ano, o Google expandiu seus termos de serviço, em parte para acessar mais dados para treinar seus modelos de IA.
A Gemini oferece geração personalizada e gratuita de imagens por IA para usuários dos EUA
Na segunda-feira, o Google revelou que o aplicativo Gemini está ampliando seus recursos de geração personalizada de imagens, desenvolvidos pela Nano Banana, para um público mais amplo. A partir de hoj
Novas funcionalidades do Gemini devem ser integradas ao Google TV em breve
Na quarta-feira, o Google revelou uma série de novos recursos baseados em IA que chegarão ao Google TV, incluindo uma seção dedicada a vídeos curtos que colocará o YouTube Shorts diretamente na tela i
Novos produtos apresentados no Made by Google ’26: Pixel 11, Pixel Watch 5, Pixel Tag e recursos aprimorados do Gemini
Durante o evento “Made by Google 2026”, realizado na quarta-feira, o Google revelou uma série de novos produtos, incluindo a série Pixel 11, o Pixel Watch 5 e um dispositivo de rastreamento projetado
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.











