谷歌的 Genie 世界模型现在能够模拟真实的街道,并集成街景功能

我们大多数人都曾使用 Google 街景向朋友展示我们以前的社区,或者将那个小人图标拖到巴黎,以检查我们的酒店是否位于时尚区域。现在,想象一下以完全沉浸和交互的方式体验这一功能——模拟街道及其周边环境,调整天气状况,甚至可视化“后天”中的极端场景。
这正是 Google 最新整合背后的愿景。从今天开始,Google DeepMind 将街景与 Project Genie 链接起来,后者是一个通用世界模型,能够生成多样化的交互式环境。该功能在 Google I/O 开发者大会上首次亮相。
“这对于智能体和机器人应用以及人类探索来说都极其强大,”DeepMind 开放式团队的研究科学家 Jack Parker-Holder 在接受 TechCrunch 采访时表示。“这始终是 Genie 背后的核心理念。”
他通过一个涉及部署在伦敦的新机器人的场景对此进行了说明,在那里阳光罕见。根据 Parker-Holder 的说法,Genie 可以模拟那些阳光在维多利亚式建筑上闪烁的罕见时刻,确保机器人不会因突然的强光而受惊。
正在加载播放器…
“或者,你可能会说,‘我要去纽约市,但不是在这个季节,’”他补充道。“‘会下雪。我想看看那个街区在雪下的样子。’”
二十年来,Google 一直使用配备相机的汽车和佩戴“追踪背包”的个人来收集街景数据。这家科技巨头已在 110 个国家和所有七大洲收集了超过 2800 亿张图像。
“街景为我们提供了来自世界广大地区的图像,”Jack 解释道。“想象一下,将这种丰富的现实世界数据与模拟整个世界的能力相结合所蕴含的潜力。”
去年 8 月,Google 发布了 Genie 3 的研究预览版,今年 1 月,它向美国的 Google AI Ultra 订阅用户开放了访问权限,使他们能够从文本提示或图像创建交互式游戏世界。其目的是利用 Genie 用于教育体验、游戏和机器人训练。
Genie 3 目前正为 Waymo 的一个模拟器提供支持,以训练自动驾驶汽车应对“极其罕见的事件”,如龙卷风或意外的大象遭遇。纳入街景数据可以帮助 Waymo 为在全球更多城市推出服务做好准备。
Waymo 使用自己的模拟器将业务扩展到美国 11 个城市,并在其他几个城市测试其 AI 司机。Parker-Holder 指出,虽然这些模拟是从汽车的角度进行的,但街景允许模拟以真实地点为锚点的世界,并将视角转移到其他智能体,如人类或机器人。
据该公司称,Google 今天正在向美国部分 Ultra 用户推出街景在 Genie 中的功能,全球 Ultra 用户的更广泛访问将在未来几周内开放。
DeepMind 的产品经理 Diego Rivas 表示,研究人员旨在使这一功能广泛可用。他警告说,街景以及 Genie 总体而言仍处于实验阶段,在准确性方面仍有很大改进空间。
在 Google 展示的视频演示中——包括对我曾经居住过的社区的水下模拟——结果令人印象深刻且可识别,但仍然类似于电子游戏图形,而非照片级真实感。这些模型也缺乏物理意识,这意味着它们尚未理解因果关系。例如,在一个模拟女子在积雪的约书亚树中奔跑的场景中,她直接穿过了仙人掌和灌木丛。
这与 Google 的图像生成器 Nano Banana 形成对比,后者现在可以在信息图中生成完美的文本,或者其视频生成器 Veo,它理解纸船随水流漂浮、烟雾扩散到空气中以及布料覆盖在物体上的现象。
物理并未硬编码到这些模型中;它们像生物体一样,通过被动观察随时间直观地学习物理规律。
“我认为,就准确性和质量而言,这种类型的模型比视频落后 6 到 12 个月,所以我认为我们会解决这个问题,”Parker-Holder 说。
Google Maps 总监 Jonathan Herbert 表示,Genie 目前尚无法创建街道的忠实重建,他 12 年前作为实习生加入街景团队。他认为真正的突破在于 AI 的空间连续性:如果你旋转 360 度,AI 会正确记住并模拟你身后的环境。在此基础上,模型可以构建一个新的环境。
“我们长期以来一直在考虑如何利用街景数据构建最好、最丰富的世界模型,”Herbert 说。“毫无疑问,我们的目标是以新的方式使用地图数据,并用于新型 AI 研究,这已经有一段时间了。”
相关文章
谷歌以云收入激增为由,捍卫其大规模人工智能投资
Alphabet 股东已公开质疑该公司在人工智能(AI)领域的巨额支出是否带来了足够的回报。随着最新财务结果的公布,这些担忧应会大幅缓解。关键洞察:得益于企业界对 AI 的广泛整合,谷歌的云业务部门正经历强劲增长。这家搜索引擎巨头报告称,谷歌云收入同比增长 82%,达到 248 亿美元。这一数字超过了上一季度 63% 的增长率(200 亿美元),也超出了华尔街对该时期 224.6 亿美元的预测。管理层将云业务的这些增长主要归因于企业 AI 解决方案和基础设施的采用。此外,公司还强调,未转化的
谷歌的罗比·斯坦将出席TechCrunch Disrupt 2026大会
新产品要获得初步关注并不容易,但要对一款拥有数十亿用户的应用进行转型,则是一项截然不同的挑战。目标依然是快速行动、验证概念并优化用户体验。然而,当每次更新都会影响到全球用户时,发布初期行之有效的策略可能已不再适用。这种矛盾正是“Builders Stage”环节——“从MVP到数十亿用户:产品决策在规模化过程中的转变”的核心所在,该环节是TechCrunch Disrupt 2026大会上的一场炉
主要出版商就人工智能训练数据问题起诉谷歌
多家出版商和作者已对谷歌提起集体诉讼,指控该公司利用受版权保护的内容来训练其Gemini人工智能。原告方包括阿歇特(Hachette)、Cengage、爱思唯尔(Elsevier)、斯科特·图罗(Scott Turow)以及S.C.R.I.B.E.,他们指控谷歌篡改了版权数据,以掩盖Gemini是在未经授权的内容上进行训练的事实。此案加入了创作者针对谷歌、Meta、OpenAI和Anthropic
相关专题推荐
评论 (0)
0/500

我们大多数人都曾使用 Google 街景向朋友展示我们以前的社区,或者将那个小人图标拖到巴黎,以检查我们的酒店是否位于时尚区域。现在,想象一下以完全沉浸和交互的方式体验这一功能——模拟街道及其周边环境,调整天气状况,甚至可视化“后天”中的极端场景。
这正是 Google 最新整合背后的愿景。从今天开始,Google DeepMind 将街景与 Project Genie 链接起来,后者是一个通用世界模型,能够生成多样化的交互式环境。该功能在 Google I/O 开发者大会上首次亮相。
“这对于智能体和机器人应用以及人类探索来说都极其强大,”DeepMind 开放式团队的研究科学家 Jack Parker-Holder 在接受 TechCrunch 采访时表示。“这始终是 Genie 背后的核心理念。”
他通过一个涉及部署在伦敦的新机器人的场景对此进行了说明,在那里阳光罕见。根据 Parker-Holder 的说法,Genie 可以模拟那些阳光在维多利亚式建筑上闪烁的罕见时刻,确保机器人不会因突然的强光而受惊。
正在加载播放器…“或者,你可能会说,‘我要去纽约市,但不是在这个季节,’”他补充道。“‘会下雪。我想看看那个街区在雪下的样子。’”
二十年来,Google 一直使用配备相机的汽车和佩戴“追踪背包”的个人来收集街景数据。这家科技巨头已在 110 个国家和所有七大洲收集了超过 2800 亿张图像。
“街景为我们提供了来自世界广大地区的图像,”Jack 解释道。“想象一下,将这种丰富的现实世界数据与模拟整个世界的能力相结合所蕴含的潜力。”
去年 8 月,Google 发布了 Genie 3 的研究预览版,今年 1 月,它向美国的 Google AI Ultra 订阅用户开放了访问权限,使他们能够从文本提示或图像创建交互式游戏世界。其目的是利用 Genie 用于教育体验、游戏和机器人训练。
Genie 3 目前正为 Waymo 的一个模拟器提供支持,以训练自动驾驶汽车应对“极其罕见的事件”,如龙卷风或意外的大象遭遇。纳入街景数据可以帮助 Waymo 为在全球更多城市推出服务做好准备。
Waymo 使用自己的模拟器将业务扩展到美国 11 个城市,并在其他几个城市测试其 AI 司机。Parker-Holder 指出,虽然这些模拟是从汽车的角度进行的,但街景允许模拟以真实地点为锚点的世界,并将视角转移到其他智能体,如人类或机器人。
据该公司称,Google 今天正在向美国部分 Ultra 用户推出街景在 Genie 中的功能,全球 Ultra 用户的更广泛访问将在未来几周内开放。
DeepMind 的产品经理 Diego Rivas 表示,研究人员旨在使这一功能广泛可用。他警告说,街景以及 Genie 总体而言仍处于实验阶段,在准确性方面仍有很大改进空间。
在 Google 展示的视频演示中——包括对我曾经居住过的社区的水下模拟——结果令人印象深刻且可识别,但仍然类似于电子游戏图形,而非照片级真实感。这些模型也缺乏物理意识,这意味着它们尚未理解因果关系。例如,在一个模拟女子在积雪的约书亚树中奔跑的场景中,她直接穿过了仙人掌和灌木丛。
这与 Google 的图像生成器 Nano Banana 形成对比,后者现在可以在信息图中生成完美的文本,或者其视频生成器 Veo,它理解纸船随水流漂浮、烟雾扩散到空气中以及布料覆盖在物体上的现象。
物理并未硬编码到这些模型中;它们像生物体一样,通过被动观察随时间直观地学习物理规律。
“我认为,就准确性和质量而言,这种类型的模型比视频落后 6 到 12 个月,所以我认为我们会解决这个问题,”Parker-Holder 说。
Google Maps 总监 Jonathan Herbert 表示,Genie 目前尚无法创建街道的忠实重建,他 12 年前作为实习生加入街景团队。他认为真正的突破在于 AI 的空间连续性:如果你旋转 360 度,AI 会正确记住并模拟你身后的环境。在此基础上,模型可以构建一个新的环境。
“我们长期以来一直在考虑如何利用街景数据构建最好、最丰富的世界模型,”Herbert 说。“毫无疑问,我们的目标是以新的方式使用地图数据,并用于新型 AI 研究,这已经有一段时间了。”
谷歌以云收入激增为由,捍卫其大规模人工智能投资
Alphabet 股东已公开质疑该公司在人工智能(AI)领域的巨额支出是否带来了足够的回报。随着最新财务结果的公布,这些担忧应会大幅缓解。关键洞察:得益于企业界对 AI 的广泛整合,谷歌的云业务部门正经历强劲增长。这家搜索引擎巨头报告称,谷歌云收入同比增长 82%,达到 248 亿美元。这一数字超过了上一季度 63% 的增长率(200 亿美元),也超出了华尔街对该时期 224.6 亿美元的预测。管理层将云业务的这些增长主要归因于企业 AI 解决方案和基础设施的采用。此外,公司还强调,未转化的
谷歌的罗比·斯坦将出席TechCrunch Disrupt 2026大会
新产品要获得初步关注并不容易,但要对一款拥有数十亿用户的应用进行转型,则是一项截然不同的挑战。目标依然是快速行动、验证概念并优化用户体验。然而,当每次更新都会影响到全球用户时,发布初期行之有效的策略可能已不再适用。这种矛盾正是“Builders Stage”环节——“从MVP到数十亿用户:产品决策在规模化过程中的转变”的核心所在,该环节是TechCrunch Disrupt 2026大会上的一场炉
主要出版商就人工智能训练数据问题起诉谷歌
多家出版商和作者已对谷歌提起集体诉讼,指控该公司利用受版权保护的内容来训练其Gemini人工智能。原告方包括阿歇特(Hachette)、Cengage、爱思唯尔(Elsevier)、斯科特·图罗(Scott Turow)以及S.C.R.I.B.E.,他们指控谷歌篡改了版权数据,以掩盖Gemini是在未经授权的内容上进行训练的事实。此案加入了创作者针对谷歌、Meta、OpenAI和Anthropic





首页






