GoogleのGenie世界モデルは、ストリートビューで実際の街並みをシミュレートするようになった

私たちの多くは、Googleストリートビューを使って友人に昔の近所を見せたり、小さな人型アイコンをパリにドロップして、ホテルが流行りのエリアにあるか確認したりしたことがあるでしょう。では、その体験を完全な没入感とインタラクティブ性を持って、つまり通りとその周辺をシミュレートし、天候条件を調整したり、「ザ・デイ・アフター・トゥモロー」のような極端なシナリオを可視化したりすることを想像してみてください。
これがGoogleの最新の統合の背後にあるビジョンです。本日より、Google DeepMindはストリートビューを、多様でインタラクティブな環境を生成できる汎用世界モデルであるProject Genieと結びつけました。この機能はGoogle I/O開発者会議で初披露されました。
「エージェントやロボティクスへの応用、さらに人間の探査にとっても、非常に強力なものです」と、DeepMindのオープンエンドネスチームの研究科学者であるJack Parker-Holder氏はTechCrunchに語りました。「それが常にGenieの核心となるアイデアでした。」
彼は、日光が珍しいロンドンに配備された新しいロボットに関するシナリオを例にこれを説明しました。Parker-Holder氏によると、Genieはバロック様式の建物に日光が反射する稀な瞬間をシミュレートでき、突然の明るさにロボットが驚かないようにすることができます。
プレイヤーを読み込み中…
「あるいは、『ニューヨーク市を訪れるが、今の季節ではない』と言うかもしれません」と彼は付け加えました。「雪が降る。雪が積もったあの街区がどう見えるか見てみたいのです。」
過去20年間、Googleはカメラを搭載した車両や「トラッカーバックパック」を着用した個人を用いてストリートビューのデータを収集してきました。このテクノロジーの巨人は、110カ国、全7大陸にわたる2,800億枚以上の画像を蓄積しています。
「ストリートビューは、世界の広範な部分からの画像を提供してくれます」とJackは説明しました。「この豊富な実世界データと、世界全体をシミュレートする能力を組み合わせる可能性を想像してみてください。」
昨年8月、Googleは研究プレビュー用にGenie 3をリリースし、今年1月には米国のGoogle AI Ultraサブスクリプションユーザーにアクセスを許可し、テキストプロンプトや画像からインタラクティブなゲーム世界を作成できるようにしました。その目的は、Genieを教育体験、ゲーム、ロボティクスのトレーニングに活用することです。
Genie 3はすでにWaymoのシミュレーターの1つを駆動し、竜巻や予期せぬ象との遭遇といった「極めて稀な事象」について自動運転車を訓練しています。ストリートビューのデータを組み込むことで、Waymoはより多くの世界的都市でのサービス開始に備えることができます。
Waymoは独自のシミュレーターを使用して、米国の11都市への事業拡大を行い、他のいくつかの都市でそのAIドライバーをテストしています。Parker-Holder氏は、これらのシミュレーションは車の視点からのものである一方、ストリートビューは実在の場所に固定された世界をシミュレートし、人間やロボットなどの他のエージェントへの視点を変換することを可能にすると指摘しています。
Googleは本日、米国の選択されたUltraユーザー向けにGenieにおけるストリートビューの提供を開始しており、グローバルなUltraユーザー向けのより広範なアクセスは数週間以内に提供される予定だと同社は述べています。
DeepMindのプロダクトマネージャーであるDiego Rivas氏は、研究者がこの機能を広く利用可能にすることを目指していると述べました。彼は、ストリートビュー、そしてGenie全般が実験的な段階にあり、精度の面で大幅な改善の余地が残っていると警告しました。
Googleによってデモで示された結果には、かつて住んでいた近所の水下世界シミュレーションなども含まれていますが、印象的で認識可能なものであるものの、まだフォトリアリズムというよりはビデオゲームのグラフィックに似ています。また、これらのモデルは物理法則に関する認識を欠いており、因果関係をまだ理解していません。例えば、雪の降るジョシュuatreeを走る女性のシミュレーションでは、彼女はサボテンや低木をそのまま通り抜けていました。
これと比較すると、Googleの画像生成エンジンNano Bananaは現在インフォグラフィックで完璧なテキストを生成できるようになり、動画生成エンジンVeoは紙船が水流に漂い、煙が大気に拡散し、布が形状に垂れ下がることを理解しています。
物理法則はこれらのモデルにハードコードされていません。それらは、生物のように、受動的な観察を通じて時間とともに直感的にそれを学習します。
「この種のモデルは、精度と品質の面で動画生成よりも6〜12ヶ月遅れている我认为、私たちはそれを解決できるでしょう」とParker-Holder氏は語りました。
12年前にインターンとしてストリートビューチームで働き始めたGoogleマップズのディレクターであるJonathan Herbert氏は、Genieはまだ通りの忠実な再構築を作成できないと指摘しました。彼は、真の突破口はAIの空間的連続性にあると考えています。360度回転した場合、AIは背後の環境を正しく記憶し、シミュレートします。そこから、モデルはその基盤の上に新しい環境を構築することができます。
「私たちは長年にわたり、ストリートビューデータを使用して、世界の中で最も良く、最も豊かなモデルを構築する方法を考えてきました」とHerbert氏は言いました。「マップデータを用いて、新しい方法で、そして長年にわたり新しい種類のAI研究を行うことは、確かに私たちの目標でした。」
関連記事
Googleはクラウド収益の急増で重厚なAI投資を擁護
アルファベットの株主たちは、同社の巨額のAI支出が適切なリターンをもたらしているかどうかについて公に疑問を呈してきた。最新の財務結果を受けて、これらの懸念は大幅に緩和されるべきである。主要な洞察:広範な企業向けAI統合を背景に、Googleのクラウド部門は堅調な成長を示している。検索分野のリーダーである同社は、Google Cloudの収益が前年比82%増の248億ドルに急増したと報告した。この数字は、前四半期の63%増の200億ドルを上回り、この期間に関するウォール街の予測である224億60
Googleのロビー・スタイン氏が「TechCrunch Disrupt 2026」に参加
新製品の初期の勢いをつけるのは難しいものですが、数十億人が利用するアプリを変革することは、まったく別の難題です。目標は依然として、迅速に行動し、コンセプトを検証し、ユーザー体験を向上させることにあります。しかし、アップデートの一つひとつが世界中のユーザーに影響を与えるようになると、ローンチ時に有効だった戦略ではもはや不十分になる可能性があります。このジレンマこそが、TechCrunch Disru
大手出版社各社が、AIの学習データをめぐりGoogleを提訴
出版社や著者が、Googleが自社のAI「Gemini」の学習に著作権で保護された素材を使用したと主張し、同社に対して集団訴訟を起こした。アシェット、ケンゲージ、エルゼビア、スコット・トゥロー、S.C.R.I.B.E.などを含む原告側は、Googleがジェミニが許可されていないコンテンツを用いて学習された事実を隠蔽するために、著作権データを改ざんしたと主張している。この訴訟は、クリエイターらがGo
関連特集おすすめ
コメント (0)
0/500

私たちの多くは、Googleストリートビューを使って友人に昔の近所を見せたり、小さな人型アイコンをパリにドロップして、ホテルが流行りのエリアにあるか確認したりしたことがあるでしょう。では、その体験を完全な没入感とインタラクティブ性を持って、つまり通りとその周辺をシミュレートし、天候条件を調整したり、「ザ・デイ・アフター・トゥモロー」のような極端なシナリオを可視化したりすることを想像してみてください。
これがGoogleの最新の統合の背後にあるビジョンです。本日より、Google DeepMindはストリートビューを、多様でインタラクティブな環境を生成できる汎用世界モデルであるProject Genieと結びつけました。この機能はGoogle I/O開発者会議で初披露されました。
「エージェントやロボティクスへの応用、さらに人間の探査にとっても、非常に強力なものです」と、DeepMindのオープンエンドネスチームの研究科学者であるJack Parker-Holder氏はTechCrunchに語りました。「それが常にGenieの核心となるアイデアでした。」
彼は、日光が珍しいロンドンに配備された新しいロボットに関するシナリオを例にこれを説明しました。Parker-Holder氏によると、Genieはバロック様式の建物に日光が反射する稀な瞬間をシミュレートでき、突然の明るさにロボットが驚かないようにすることができます。
プレイヤーを読み込み中…「あるいは、『ニューヨーク市を訪れるが、今の季節ではない』と言うかもしれません」と彼は付け加えました。「雪が降る。雪が積もったあの街区がどう見えるか見てみたいのです。」
過去20年間、Googleはカメラを搭載した車両や「トラッカーバックパック」を着用した個人を用いてストリートビューのデータを収集してきました。このテクノロジーの巨人は、110カ国、全7大陸にわたる2,800億枚以上の画像を蓄積しています。
「ストリートビューは、世界の広範な部分からの画像を提供してくれます」とJackは説明しました。「この豊富な実世界データと、世界全体をシミュレートする能力を組み合わせる可能性を想像してみてください。」
昨年8月、Googleは研究プレビュー用にGenie 3をリリースし、今年1月には米国のGoogle AI Ultraサブスクリプションユーザーにアクセスを許可し、テキストプロンプトや画像からインタラクティブなゲーム世界を作成できるようにしました。その目的は、Genieを教育体験、ゲーム、ロボティクスのトレーニングに活用することです。
Genie 3はすでにWaymoのシミュレーターの1つを駆動し、竜巻や予期せぬ象との遭遇といった「極めて稀な事象」について自動運転車を訓練しています。ストリートビューのデータを組み込むことで、Waymoはより多くの世界的都市でのサービス開始に備えることができます。
Waymoは独自のシミュレーターを使用して、米国の11都市への事業拡大を行い、他のいくつかの都市でそのAIドライバーをテストしています。Parker-Holder氏は、これらのシミュレーションは車の視点からのものである一方、ストリートビューは実在の場所に固定された世界をシミュレートし、人間やロボットなどの他のエージェントへの視点を変換することを可能にすると指摘しています。
Googleは本日、米国の選択されたUltraユーザー向けにGenieにおけるストリートビューの提供を開始しており、グローバルなUltraユーザー向けのより広範なアクセスは数週間以内に提供される予定だと同社は述べています。
DeepMindのプロダクトマネージャーであるDiego Rivas氏は、研究者がこの機能を広く利用可能にすることを目指していると述べました。彼は、ストリートビュー、そしてGenie全般が実験的な段階にあり、精度の面で大幅な改善の余地が残っていると警告しました。
Googleによってデモで示された結果には、かつて住んでいた近所の水下世界シミュレーションなども含まれていますが、印象的で認識可能なものであるものの、まだフォトリアリズムというよりはビデオゲームのグラフィックに似ています。また、これらのモデルは物理法則に関する認識を欠いており、因果関係をまだ理解していません。例えば、雪の降るジョシュuatreeを走る女性のシミュレーションでは、彼女はサボテンや低木をそのまま通り抜けていました。
これと比較すると、Googleの画像生成エンジンNano Bananaは現在インフォグラフィックで完璧なテキストを生成できるようになり、動画生成エンジンVeoは紙船が水流に漂い、煙が大気に拡散し、布が形状に垂れ下がることを理解しています。
物理法則はこれらのモデルにハードコードされていません。それらは、生物のように、受動的な観察を通じて時間とともに直感的にそれを学習します。
「この種のモデルは、精度と品質の面で動画生成よりも6〜12ヶ月遅れている我认为、私たちはそれを解決できるでしょう」とParker-Holder氏は語りました。
12年前にインターンとしてストリートビューチームで働き始めたGoogleマップズのディレクターであるJonathan Herbert氏は、Genieはまだ通りの忠実な再構築を作成できないと指摘しました。彼は、真の突破口はAIの空間的連続性にあると考えています。360度回転した場合、AIは背後の環境を正しく記憶し、シミュレートします。そこから、モデルはその基盤の上に新しい環境を構築することができます。
「私たちは長年にわたり、ストリートビューデータを使用して、世界の中で最も良く、最も豊かなモデルを構築する方法を考えてきました」とHerbert氏は言いました。「マップデータを用いて、新しい方法で、そして長年にわたり新しい種類のAI研究を行うことは、確かに私たちの目標でした。」
Googleはクラウド収益の急増で重厚なAI投資を擁護
アルファベットの株主たちは、同社の巨額のAI支出が適切なリターンをもたらしているかどうかについて公に疑問を呈してきた。最新の財務結果を受けて、これらの懸念は大幅に緩和されるべきである。主要な洞察:広範な企業向けAI統合を背景に、Googleのクラウド部門は堅調な成長を示している。検索分野のリーダーである同社は、Google Cloudの収益が前年比82%増の248億ドルに急増したと報告した。この数字は、前四半期の63%増の200億ドルを上回り、この期間に関するウォール街の予測である224億60
Googleのロビー・スタイン氏が「TechCrunch Disrupt 2026」に参加
新製品の初期の勢いをつけるのは難しいものですが、数十億人が利用するアプリを変革することは、まったく別の難題です。目標は依然として、迅速に行動し、コンセプトを検証し、ユーザー体験を向上させることにあります。しかし、アップデートの一つひとつが世界中のユーザーに影響を与えるようになると、ローンチ時に有効だった戦略ではもはや不十分になる可能性があります。このジレンマこそが、TechCrunch Disru
大手出版社各社が、AIの学習データをめぐりGoogleを提訴
出版社や著者が、Googleが自社のAI「Gemini」の学習に著作権で保護された素材を使用したと主張し、同社に対して集団訴訟を起こした。アシェット、ケンゲージ、エルゼビア、スコット・トゥロー、S.C.R.I.B.E.などを含む原告側は、Googleがジェミニが許可されていないコンテンツを用いて学習された事実を隠蔽するために、著作権データを改ざんしたと主張している。この訴訟は、クリエイターらがGo





家






