Deepmind CEOのDemis Hassabisは、GoogleのGeminiとVeo AIモデルの将来の統合を発表しました

ポッドキャストPossibleの最近のエピソードで、LinkedIn共同創業者レイド・ホフマンが共同ホストを務め、Google DeepMind CEOデミス・ハサビスがGoogleの計画について興奮するニュースを共有しました。彼は、GoogleがGemini AIモデルをVeoビデオ生成モデルと統合しようとしていることを明らかにしました。この融合は、Geminiの物理世界の理解を強化し、現実のダイナミクスをより巧みに理解できるようにすることを目指しています。
ハサビスは、Geminiが最初からマルチモーダルになるように設計されていたと強調しました。「我々は常に、基盤モデルであるGeminiを最初からマルチモーダルに構築してきました」と彼は説明しました。このアプローチの動機は?日常生活で本当の意味で役立つユニバーサルデジタルアシスタントのビジョンです。「現実世界で実際にあなたを助けるアシスタント」とハサビスは詳しく述べました。
AI業界は、いわゆる「オムニ」モデル——さまざまなメディアを処理し統合できるモデル——に向かって着実に進化しています。たとえば、Googleの最新のGeminiイテレーションは、テキストだけでなくオーディオや画像も生成できます。一方、OpenAIのChatGPTデフォルトモデルは、その場で画像を生成でき、スタジオジブリ風のアートも含まれます。Amazonも遅れを取っておらず、今年後半に「any-to-any」モデルを展開する計画です。
これらのオムニモデルには、画像、ビデオ、オーディオ、テキストといった膨大なトレーニングデータが必要です。ハサビスは、Veoのビデオデータが主にYouTubeから来ていると示唆しました。YouTubeはGoogleが所有する宝の山です。「基本的に、YouTubeビデオ——大量のYouTubeビデオ——を見ることによって、[Veo 2]は世界の物理を理解できます」と彼は述べました。
Googleは以前、TechCrunchに対し、そのモデルがYouTubeクリエイターとの契約に基づいて「一部の」YouTubeコンテンツでトレーニングされている「可能性がある」と述べていました。昨年、GoogleがAIモデルのトレーニングのためにさらに多くのデータにアクセスするために利用規約を拡大したことは注目に値します。
関連記事
Geminiは、米国のユーザー向けに、無料でパーソナライズされたAI画像生成サービスを提供しています
月曜日、Googleは、「Gemini」アプリが「Nano Banana」を基盤としたパーソナライズされた画像生成機能を、より多くのユーザーに提供することを明らかにしました。本日より、米国内の条件を満たすすべてのユーザーが、この機能を無料で利用できるようになり、これまで「Plus」「Pro」「Ultra」のサブスクリプション加入者に限定されていた制限が撤廃されました。4月に初めて導入されたGemi
Geminiの新機能がまもなくGoogle TVに統合される見込み
水曜日、GoogleはGoogle TVに導入予定の一連の新しいAI駆動型機能を公開しました。これには、YouTube Shortsをホーム画面に直接表示するショート動画専用のセクションも含まれています。これらのアップデートの中心となるのは、Geminiを基盤とした機能の強化です。「Gemini」タブ内の「作成」ボタンをクリックすると、ユーザーは「Nano Banana」や「Veo」といった生成A
「Made by Google ’26」で新製品が発表:Pixel 11、Pixel Watch 5、Pixel Tag、そしてGeminiの機能強化
水曜日に開催された「Made by Google 2026」イベントで、GoogleはPixel 11シリーズ、Pixel Watch 5、そしてAppleのAirTagに対抗するために設計された追跡デバイスなど、一連の新製品を発表しました。同社はまた、デバイスラインナップ全体にわたってGeminiによって実現されたいくつかの新機能についても紹介しました。PixelデバイスにおけるGeminiの利
関連特集おすすめ
コメント (2)
0/500
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.

ポッドキャストPossibleの最近のエピソードで、LinkedIn共同創業者レイド・ホフマンが共同ホストを務め、Google DeepMind CEOデミス・ハサビスがGoogleの計画について興奮するニュースを共有しました。彼は、GoogleがGemini AIモデルをVeoビデオ生成モデルと統合しようとしていることを明らかにしました。この融合は、Geminiの物理世界の理解を強化し、現実のダイナミクスをより巧みに理解できるようにすることを目指しています。
ハサビスは、Geminiが最初からマルチモーダルになるように設計されていたと強調しました。「我々は常に、基盤モデルであるGeminiを最初からマルチモーダルに構築してきました」と彼は説明しました。このアプローチの動機は?日常生活で本当の意味で役立つユニバーサルデジタルアシスタントのビジョンです。「現実世界で実際にあなたを助けるアシスタント」とハサビスは詳しく述べました。
AI業界は、いわゆる「オムニ」モデル——さまざまなメディアを処理し統合できるモデル——に向かって着実に進化しています。たとえば、Googleの最新のGeminiイテレーションは、テキストだけでなくオーディオや画像も生成できます。一方、OpenAIのChatGPTデフォルトモデルは、その場で画像を生成でき、スタジオジブリ風のアートも含まれます。Amazonも遅れを取っておらず、今年後半に「any-to-any」モデルを展開する計画です。
これらのオムニモデルには、画像、ビデオ、オーディオ、テキストといった膨大なトレーニングデータが必要です。ハサビスは、Veoのビデオデータが主にYouTubeから来ていると示唆しました。YouTubeはGoogleが所有する宝の山です。「基本的に、YouTubeビデオ——大量のYouTubeビデオ——を見ることによって、[Veo 2]は世界の物理を理解できます」と彼は述べました。
Googleは以前、TechCrunchに対し、そのモデルがYouTubeクリエイターとの契約に基づいて「一部の」YouTubeコンテンツでトレーニングされている「可能性がある」と述べていました。昨年、GoogleがAIモデルのトレーニングのためにさらに多くのデータにアクセスするために利用規約を拡大したことは注目に値します。
Geminiは、米国のユーザー向けに、無料でパーソナライズされたAI画像生成サービスを提供しています
月曜日、Googleは、「Gemini」アプリが「Nano Banana」を基盤としたパーソナライズされた画像生成機能を、より多くのユーザーに提供することを明らかにしました。本日より、米国内の条件を満たすすべてのユーザーが、この機能を無料で利用できるようになり、これまで「Plus」「Pro」「Ultra」のサブスクリプション加入者に限定されていた制限が撤廃されました。4月に初めて導入されたGemi
Geminiの新機能がまもなくGoogle TVに統合される見込み
水曜日、GoogleはGoogle TVに導入予定の一連の新しいAI駆動型機能を公開しました。これには、YouTube Shortsをホーム画面に直接表示するショート動画専用のセクションも含まれています。これらのアップデートの中心となるのは、Geminiを基盤とした機能の強化です。「Gemini」タブ内の「作成」ボタンをクリックすると、ユーザーは「Nano Banana」や「Veo」といった生成A
「Made by Google ’26」で新製品が発表:Pixel 11、Pixel Watch 5、Pixel Tag、そしてGeminiの機能強化
水曜日に開催された「Made by Google 2026」イベントで、GoogleはPixel 11シリーズ、Pixel Watch 5、そしてAppleのAirTagに対抗するために設計された追跡デバイスなど、一連の新製品を発表しました。同社はまた、デバイスラインナップ全体にわたってGeminiによって実現されたいくつかの新機能についても紹介しました。PixelデバイスにおけるGeminiの利
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.





家






