Heim
DeepMind -CEO Demis Hassabis kündigt die zukünftige Integration von Googles Gemini- und VEO -AI -Modellen an

In einer kürzlichen Episode des Podcasts Possible, moderiert von LinkedIn-Mitbegründer Reid Hoffman, teilte Google DeepMind CEO Demis Hassabis spannende Neuigkeiten über Googles Pläne mit. Er enthüllte, dass Google plant, seine Gemini AI-Modelle mit den Veo-Video-generierenden Modellen zu verschmelzen. Diese Fusion zielt darauf ab, das Verständnis von Gemini für die physische Welt zu verbessern und es geschickter im Verstehen realer Dynamiken zu machen.
Hassabis betonte, dass Gemini von Anfang an als multimodal konzipiert wurde. „Wir haben Gemini, unser Grundmodell, von Beginn an multimodal aufgebaut“, erklärte er. Die Motivation hinter diesem Ansatz? Eine Vision für einen universellen digitalen Assistenten, der im Alltag wirklich hilfreich ist. „Ein Assistent, der … dir in der realen Welt tatsächlich hilft“, erläuterte Hassabis.
Die AI-Branche entwickelt sich stetig hin zu sogenannten „Omni“-Modellen – solchen, die in der Lage sind, verschiedene Medientypen zu verarbeiten und zu synthetisieren. Die neuesten Gemini-Iterationen von Google können beispielsweise nicht nur Text, sondern auch Audio und Bilder erzeugen. In der Zwischenzeit kann das Standardmodell von OpenAI, ChatGPT, spontan Bilder erstellen, einschließlich bezaubernder Kunst im Stil von Studio Ghibli. Amazon hinkt nicht weit hinterher und plant, noch in diesem Jahr ein „Any-to-Any“-Modell einzuführen.
Diese Omni-Modelle erfordern eine enorme Menge an Trainingsdaten – denken Sie an Bilder, Videos, Audio und Text. Hassabis deutete an, dass die Videodaten von Veo hauptsächlich von YouTube stammen, einem Schatz, der Google gehört. „Grundsätzlich kann [Veo 2] durch das Ansehen von YouTube-Videos – sehr vielen YouTube-Videos – die Physik der Welt herausfinden“, bemerkte er.
Google hatte zuvor gegenüber TechCrunch erwähnt, dass seine Modelle „möglicherweise“ auf „einigen“ YouTube-Inhalten trainiert werden, in Übereinstimmung mit Vereinbarungen mit YouTube-Creators. Es ist erwähnenswert, dass Google im letzten Jahr seine Nutzungsbedingungen erweitert hat, teilweise um mehr Daten für das Training seiner AI-Modelle zu nutzen.
Verwandter Artikel
Gemini bietet Nutzern in den USA eine kostenlose, personalisierte KI-Bildgenerierung an
Am Montag gab Google bekannt, dass die Gemini-App ihre personalisierten Funktionen zur Bilderzeugung, die auf der Technologie von Nano Banana basieren, nun einem breiteren Publikum zugänglich macht. A
Neue Gemini-Funktionen sollen bald in Google TV integriert werden
Am Mittwoch stellte Google eine Reihe neuer KI-gestützter Funktionen vor, die auf Google TV eingeführt werden sollen, darunter einen eigenen Bereich für Kurzvideos, in dem „YouTube Shorts“ direkt auf
Neue Produkte auf der „Made by Google ’26“ vorgestellt: Pixel 11, Pixel Watch 5, Pixel Tag und erweiterte Gemini-Funktionen
Im Rahmen seiner am Mittwoch stattfindenden Veranstaltung „Made by Google 2026“ stellte Google eine Reihe neuer Produkte vor, darunter die Pixel-11-Serie, die Pixel Watch 5 und ein Ortungsgerät, das a
Empfehlungen zu verwandten Spezialthemen
Kommentare (2)
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.

In einer kürzlichen Episode des Podcasts Possible, moderiert von LinkedIn-Mitbegründer Reid Hoffman, teilte Google DeepMind CEO Demis Hassabis spannende Neuigkeiten über Googles Pläne mit. Er enthüllte, dass Google plant, seine Gemini AI-Modelle mit den Veo-Video-generierenden Modellen zu verschmelzen. Diese Fusion zielt darauf ab, das Verständnis von Gemini für die physische Welt zu verbessern und es geschickter im Verstehen realer Dynamiken zu machen.
Hassabis betonte, dass Gemini von Anfang an als multimodal konzipiert wurde. „Wir haben Gemini, unser Grundmodell, von Beginn an multimodal aufgebaut“, erklärte er. Die Motivation hinter diesem Ansatz? Eine Vision für einen universellen digitalen Assistenten, der im Alltag wirklich hilfreich ist. „Ein Assistent, der … dir in der realen Welt tatsächlich hilft“, erläuterte Hassabis.
Die AI-Branche entwickelt sich stetig hin zu sogenannten „Omni“-Modellen – solchen, die in der Lage sind, verschiedene Medientypen zu verarbeiten und zu synthetisieren. Die neuesten Gemini-Iterationen von Google können beispielsweise nicht nur Text, sondern auch Audio und Bilder erzeugen. In der Zwischenzeit kann das Standardmodell von OpenAI, ChatGPT, spontan Bilder erstellen, einschließlich bezaubernder Kunst im Stil von Studio Ghibli. Amazon hinkt nicht weit hinterher und plant, noch in diesem Jahr ein „Any-to-Any“-Modell einzuführen.
Diese Omni-Modelle erfordern eine enorme Menge an Trainingsdaten – denken Sie an Bilder, Videos, Audio und Text. Hassabis deutete an, dass die Videodaten von Veo hauptsächlich von YouTube stammen, einem Schatz, der Google gehört. „Grundsätzlich kann [Veo 2] durch das Ansehen von YouTube-Videos – sehr vielen YouTube-Videos – die Physik der Welt herausfinden“, bemerkte er.
Google hatte zuvor gegenüber TechCrunch erwähnt, dass seine Modelle „möglicherweise“ auf „einigen“ YouTube-Inhalten trainiert werden, in Übereinstimmung mit Vereinbarungen mit YouTube-Creators. Es ist erwähnenswert, dass Google im letzten Jahr seine Nutzungsbedingungen erweitert hat, teilweise um mehr Daten für das Training seiner AI-Modelle zu nutzen.
Gemini bietet Nutzern in den USA eine kostenlose, personalisierte KI-Bildgenerierung an
Am Montag gab Google bekannt, dass die Gemini-App ihre personalisierten Funktionen zur Bilderzeugung, die auf der Technologie von Nano Banana basieren, nun einem breiteren Publikum zugänglich macht. A
Neue Gemini-Funktionen sollen bald in Google TV integriert werden
Am Mittwoch stellte Google eine Reihe neuer KI-gestützter Funktionen vor, die auf Google TV eingeführt werden sollen, darunter einen eigenen Bereich für Kurzvideos, in dem „YouTube Shorts“ direkt auf
Neue Produkte auf der „Made by Google ’26“ vorgestellt: Pixel 11, Pixel Watch 5, Pixel Tag und erweiterte Gemini-Funktionen
Im Rahmen seiner am Mittwoch stattfindenden Veranstaltung „Made by Google 2026“ stellte Google eine Reihe neuer Produkte vor, darunter die Pixel-11-Serie, die Pixel Watch 5 und ein Ortungsgerät, das a
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.











