谷歌的 Genie 世界模型現在能夠模擬真實的街道,並整合街景功能

我們大多數人都曾使用 Google 街景向朋友展示我們以前的社羣,或者將那個小人圖示拖到巴黎,以檢查我們的酒店是否位於時尚區域。現在,想象一下以完全沉浸和互動的方式體驗這一功能——模擬街道及其周邊環境,調整天氣狀況,甚至視覺化“後天”中的極端場景。
這正是 Google 最新整合背後的願景。從今天開始,Google DeepMind 將街景與 Project Genie 連結起來,後者是一個通用世界模型,能夠生成多樣化的互動式環境。該功能在 Google I/O 開發者大會上首次亮相。
“這對於智慧體和機器人應用以及人類探索來說都極其強大,”DeepMind 開放式團隊的研究科學家 Jack Parker-Holder 在接受 TechCrunch 採訪時表示。“這始終是 Genie 背後的核心理念。”
他透過一個涉及部署在倫敦的新機器人的場景對此進行了說明,在那裡陽光罕見。根據 Parker-Holder 的說法,Genie 可以模擬那些陽光在維多利亞式建築上閃爍的罕見時刻,確保機器人不會因突然的強光而受驚。
正在載入播放器…
“或者,你可能會說,‘我要去紐約市,但不是在這個季節,’”他補充道。“‘會下雪。我想看看那個街區在雪下的樣子。’”
二十年來,Google 一直使用配備相機的汽車和佩戴“追蹤揹包”的個人來收集街景資料。這家科技巨頭已在 110 個國家和所有七大洲收集了超過 2800 億張影象。
“街景為我們提供了來自世界廣大地區的影象,”Jack 解釋道。“想象一下,將這種豐富的現實世界資料與模擬整個世界的能力相結合所蘊含的潛力。”
去年 8 月,Google 釋出了 Genie 3 的研究預覽版,今年 1 月,它向美國的 Google AI Ultra 訂閱使用者開放了訪問許可權,使他們能夠從文字提示或影象建立互動式遊戲世界。其目的是利用 Genie 用於教育體驗、遊戲和機器人訓練。
Genie 3 目前正為 Waymo 的一個模擬器提供支援,以訓練自動駕駛汽車應對“極其罕見的事件”,如龍捲風或意外的大象遭遇。納入街景資料可以幫助 Waymo 為在全球更多城市推出服務做好準備。
Waymo 使用自己的模擬器將業務擴充套件到美國 11 個城市,並在其他幾個城市測試其 AI 司機。Parker-Holder 指出,雖然這些模擬是從汽車的角度進行的,但街景允許模擬以真實地點為錨點的世界,並將視角轉移到其他智慧體,如人類或機器人。
據該公司稱,Google 今天正在向美國部分 Ultra 使用者推出街景在 Genie 中的功能,全球 Ultra 使用者的更廣泛訪問將在未來幾周內開放。
DeepMind 的產品經理 Diego Rivas 表示,研究人員旨在使這一功能廣泛可用。他警告說,街景以及 Genie 總體而言仍處於實驗階段,在準確性方面仍有很大改進空間。
在 Google 展示的影片演示中——包括對我曾經居住過的社羣的水下模擬——結果令人印象深刻且可識別,但仍然類似於電子遊戲圖形,而非照片級真實感。這些模型也缺乏物理意識,這意味著它們尚未理解因果關係。例如,在一個模擬女子在積雪的約書亞樹中奔跑的場景中,她直接穿過了仙人掌和灌木叢。
這與 Google 的影象生成器 Nano Banana 形成對比,後者現在可以在資訊圖中生成完美的文字,或者其影片生成器 Veo,它理解紙船隨水流漂浮、煙霧擴散到空氣中以及布料覆蓋在物體上的現象。
物理並未硬編碼到這些模型中;它們像生物體一樣,透過被動觀察隨時間直觀地學習物理規律。
“我認為,就準確性和質量而言,這種型別的模型比影片落後 6 到 12 個月,所以我認為我們會解決這個問題,”Parker-Holder 說。
Google Maps 總監 Jonathan Herbert 表示,Genie 目前尚無法建立街道的忠實重建,他 12 年前作為實習生加入街景團隊。他認為真正的突破在於 AI 的空間連續性:如果你旋轉 360 度,AI 會正確記住並模擬你身後的環境。在此基礎上,模型可以構建一個新的環境。
“我們長期以來一直在考慮如何利用街景資料構建最好、最豐富的世界模型,”Herbert 說。“毫無疑問,我們的目標是以新的方式使用地圖資料,並用於新型 AI 研究,這已經有一段時間了。”
相關文章
谷歌以雲收入激增為由,捍衛其大規模人工智慧投資
Alphabet 股東已公開質疑該公司在人工智慧(AI)領域的鉅額支出是否帶來了足夠的回報。隨著最新財務結果的公佈,這些擔憂應會大幅緩解。關鍵洞察:得益於企業界對 AI 的廣泛整合,谷歌的雲業務部門正經歷強勁增長。這家搜尋引擎巨頭報告稱,谷歌雲收入同比增長 82%,達到 248 億美元。這一數字超過了上一季度 63% 的增長率(200 億美元),也超出了華爾街對該時期 224.6 億美元的預測。管理層將雲業務的這些增長主要歸因於企業 AI 解決方案和基礎設施的採用。此外,公司還強調,未轉化的
Google 的 Robby Stein 將出席 TechCrunch Disrupt 2026
新產品要取得初步成功已屬不易,但要改造一款擁有數十億用戶的應用程式,則是截然不同的挑戰。目標依然是快速行動、測試概念並改善使用者體驗。然而,當每次更新都會影響全球用戶時,上市初期行之有效的策略可能已不再足夠。這種矛盾正是「Builders Stage」環節——「從最小可行產品(MVP)到數十億用戶:產品決策在規模化時必須如何調整」——的核心所在,這場座談將於 2026 年 TechCrunch D
主要出版商就人工智慧訓練資料一事起訴谷歌
出版商與作者已對谷歌提起集體訴訟,指控該公司利用受版權保護的素材來訓練其 Gemini 人工智慧系統。原告包括阿歇特(Hachette)、Cengage、愛思唯爾(Elsevier)、斯科特·圖羅(Scott Turow)以及 S.C.R.I.B.E. 等,他們指控 Google 篡改版權資料,以隱瞞 Gemini 是透過未經授權的內容進行訓練的事實。此案加入了創作者針對谷歌、Meta、OpenA
相關專題推薦
評論 (0)
0/500

我們大多數人都曾使用 Google 街景向朋友展示我們以前的社羣,或者將那個小人圖示拖到巴黎,以檢查我們的酒店是否位於時尚區域。現在,想象一下以完全沉浸和互動的方式體驗這一功能——模擬街道及其周邊環境,調整天氣狀況,甚至視覺化“後天”中的極端場景。
這正是 Google 最新整合背後的願景。從今天開始,Google DeepMind 將街景與 Project Genie 連結起來,後者是一個通用世界模型,能夠生成多樣化的互動式環境。該功能在 Google I/O 開發者大會上首次亮相。
“這對於智慧體和機器人應用以及人類探索來說都極其強大,”DeepMind 開放式團隊的研究科學家 Jack Parker-Holder 在接受 TechCrunch 採訪時表示。“這始終是 Genie 背後的核心理念。”
他透過一個涉及部署在倫敦的新機器人的場景對此進行了說明,在那裡陽光罕見。根據 Parker-Holder 的說法,Genie 可以模擬那些陽光在維多利亞式建築上閃爍的罕見時刻,確保機器人不會因突然的強光而受驚。
正在載入播放器…“或者,你可能會說,‘我要去紐約市,但不是在這個季節,’”他補充道。“‘會下雪。我想看看那個街區在雪下的樣子。’”
二十年來,Google 一直使用配備相機的汽車和佩戴“追蹤揹包”的個人來收集街景資料。這家科技巨頭已在 110 個國家和所有七大洲收集了超過 2800 億張影象。
“街景為我們提供了來自世界廣大地區的影象,”Jack 解釋道。“想象一下,將這種豐富的現實世界資料與模擬整個世界的能力相結合所蘊含的潛力。”
去年 8 月,Google 釋出了 Genie 3 的研究預覽版,今年 1 月,它向美國的 Google AI Ultra 訂閱使用者開放了訪問許可權,使他們能夠從文字提示或影象建立互動式遊戲世界。其目的是利用 Genie 用於教育體驗、遊戲和機器人訓練。
Genie 3 目前正為 Waymo 的一個模擬器提供支援,以訓練自動駕駛汽車應對“極其罕見的事件”,如龍捲風或意外的大象遭遇。納入街景資料可以幫助 Waymo 為在全球更多城市推出服務做好準備。
Waymo 使用自己的模擬器將業務擴充套件到美國 11 個城市,並在其他幾個城市測試其 AI 司機。Parker-Holder 指出,雖然這些模擬是從汽車的角度進行的,但街景允許模擬以真實地點為錨點的世界,並將視角轉移到其他智慧體,如人類或機器人。
據該公司稱,Google 今天正在向美國部分 Ultra 使用者推出街景在 Genie 中的功能,全球 Ultra 使用者的更廣泛訪問將在未來幾周內開放。
DeepMind 的產品經理 Diego Rivas 表示,研究人員旨在使這一功能廣泛可用。他警告說,街景以及 Genie 總體而言仍處於實驗階段,在準確性方面仍有很大改進空間。
在 Google 展示的影片演示中——包括對我曾經居住過的社羣的水下模擬——結果令人印象深刻且可識別,但仍然類似於電子遊戲圖形,而非照片級真實感。這些模型也缺乏物理意識,這意味著它們尚未理解因果關係。例如,在一個模擬女子在積雪的約書亞樹中奔跑的場景中,她直接穿過了仙人掌和灌木叢。
這與 Google 的影象生成器 Nano Banana 形成對比,後者現在可以在資訊圖中生成完美的文字,或者其影片生成器 Veo,它理解紙船隨水流漂浮、煙霧擴散到空氣中以及布料覆蓋在物體上的現象。
物理並未硬編碼到這些模型中;它們像生物體一樣,透過被動觀察隨時間直觀地學習物理規律。
“我認為,就準確性和質量而言,這種型別的模型比影片落後 6 到 12 個月,所以我認為我們會解決這個問題,”Parker-Holder 說。
Google Maps 總監 Jonathan Herbert 表示,Genie 目前尚無法建立街道的忠實重建,他 12 年前作為實習生加入街景團隊。他認為真正的突破在於 AI 的空間連續性:如果你旋轉 360 度,AI 會正確記住並模擬你身後的環境。在此基礎上,模型可以構建一個新的環境。
“我們長期以來一直在考慮如何利用街景資料構建最好、最豐富的世界模型,”Herbert 說。“毫無疑問,我們的目標是以新的方式使用地圖資料,並用於新型 AI 研究,這已經有一段時間了。”
谷歌以雲收入激增為由,捍衛其大規模人工智慧投資
Alphabet 股東已公開質疑該公司在人工智慧(AI)領域的鉅額支出是否帶來了足夠的回報。隨著最新財務結果的公佈,這些擔憂應會大幅緩解。關鍵洞察:得益於企業界對 AI 的廣泛整合,谷歌的雲業務部門正經歷強勁增長。這家搜尋引擎巨頭報告稱,谷歌雲收入同比增長 82%,達到 248 億美元。這一數字超過了上一季度 63% 的增長率(200 億美元),也超出了華爾街對該時期 224.6 億美元的預測。管理層將雲業務的這些增長主要歸因於企業 AI 解決方案和基礎設施的採用。此外,公司還強調,未轉化的
Google 的 Robby Stein 將出席 TechCrunch Disrupt 2026
新產品要取得初步成功已屬不易,但要改造一款擁有數十億用戶的應用程式,則是截然不同的挑戰。目標依然是快速行動、測試概念並改善使用者體驗。然而,當每次更新都會影響全球用戶時,上市初期行之有效的策略可能已不再足夠。這種矛盾正是「Builders Stage」環節——「從最小可行產品(MVP)到數十億用戶:產品決策在規模化時必須如何調整」——的核心所在,這場座談將於 2026 年 TechCrunch D
主要出版商就人工智慧訓練資料一事起訴谷歌
出版商與作者已對谷歌提起集體訴訟,指控該公司利用受版權保護的素材來訓練其 Gemini 人工智慧系統。原告包括阿歇特(Hachette)、Cengage、愛思唯爾(Elsevier)、斯科特·圖羅(Scott Turow)以及 S.C.R.I.B.E. 等,他們指控 Google 篡改版權資料,以隱瞞 Gemini 是透過未經授權的內容進行訓練的事實。此案加入了創作者針對谷歌、Meta、OpenA





首頁






