2025 年谷歌 I/O 大会展示了生成式媒体的实际应用

在 I/O 2025 大会上,我们通过演讲和实际应用展示了生成式人工智能的能力。我们发布了最新的视频和图像生成模型--Veo 3 和 Imagen 4,并扩大了 Lyria 2 的使用范围。我们还推出了 Flow,这是一款人工智能电影制作工具,可使用我们最先进的生成模型无缝创建电影剪辑、场景和连贯的叙事。
我们还将这些工具整合到我们的年度旗舰活动中:I/O 主题演讲中有 219 张幻灯片是人工智能生成的,48% 的主题演讲视觉效果是使用 Imagen 制作的,80% 的视频以某种形式结合了 Veo 或 Imagen。下面将深入介绍我们是如何利用自己的人工智能工具(包括我们的提示语编写流程)将 I/O 2025 变为现实的:
Veo 2:设计有风格的发言人标题卡
当我们的副总裁兼搜索主管 Elizabeth Reid 上台分享主要的搜索更新时,屏幕上播放了一段简短的视频,显示 Liz 张开手,露出一只精致的橙色折纸仙鹤,仙鹤在她的手掌上方旋转、悬浮。
我们使用由 Veo 2 支持的 AI Studio 和 Vertex AI Studio 的图像到视频功能制作了这段视频和其他演讲者介绍视频。我们收集了演讲者的头像以及他们的兴趣和爱好,并将其融入到提示中。这是我们为研究科学家 Jason Baldridge 制作的标题卡提示:
下面是 Veo 2 的原始输出,经过简单的动画增强,以及观众在舞台上看到的效果:
Imagen 4 和 Veo 3:故事板和电影制作
在 I/O 上放映的几部电影在制作过程中都使用了人工智能工具。开场影片带领观众穿越了一个西部主题的小镇,展开了一段惊心动魄的旅程,随后镜头拉高,彩色气球上写着 "欢迎来到 I/O",拉开了主题演讲的序幕。
制作团队使用了多种人工智能工具来制作这部影片。他们首先使用 Imagen 4 为视频提示生成图像。他们还与谷歌 DeepMind 团队合作,后者使用双子座来完善提示,帮助他们找到合适的语言,以达到预期效果。这是第一个场景使用的提示:
这是他们生成的图像:
然后,团队将这一图像纳入 Veo 3 提示中,其中包括以下指示:"......":
准备好图像和完善的提示后,他们开始使用我们最新的 Veo 3 技术(可通过 Google AI Ultra 计划获取!)制作影片。他们还使用 Veo 3 进行实时调整--在审查输出结果时添加俯拍镜头、更宽的角度和不同的视觉效果。与经常需要重新拍摄场景的传统电影制作不同,该团队可以更快地进行迭代。无需编码:一些团队成员使用 Colab 功能进行基于代码的编辑,而许多其他成员则依靠文本到视频的提示,用自然语言描述编辑和请求。
以下是用于创建影片最终场景之一的提示:
Lyria RealTime:与 Toro y Moi 实时演奏
在 I/O 预展期间,艺术家 Toro y Moi 在现场音乐表演中使用 Lyria RealTime 展示了该模型的最新功能。Lyria RealTime 是我们的交互式音乐生成模型,可让您实时创建、控制和演奏生成音乐。您可以混合和变形乐器、声音、流派等。"这将是一场表演和实验,"他在开始前解释道。"我演奏的一切都是完全即兴的--我和电脑一起演奏,电脑也和我一起演奏。
在演出前的几周里,团队为 Toro y Moi 提供了 Lyria RealTime 原型,以便他测试和完善自己的提示。这帮助他开发了一个创意概念和在演出中使用的提示音。他创建了 16 个声音提示,包括 "混乱的康加鼓手 "和 "音高偏移的英国丛林鼓",并将它们分配给实体 MIDI 控制器上的旋钮。
通过 MIDI 控制器在本地运行 Lyria RealTime,可以让 Toro y Moi 在舞台上使用该模型,并让观众现场观看界面的运行情况。
演出期间,一个使用 Lyria RealTime API 制作并在 MIDI 控制器上运行的应用程序显示在 Toro y Moi 的身后。观众可以看到该应用程序用于创建和控制连续音乐流的选项,以及他在叠加键盘和人声润色时使用的提示。
请使用 AI Studio 中的 Lyria RealTime API 亲自尝试一下。
人工智能工作室:创建人工智能生成的 Swag
我们在谷歌人工智能工作室(Google AI Studio)中使用了几个双子座模型--我们用于快速测试模型和实验提示的免费界面--设计了今年的 I/O 衬衫,上面有一个全新的定制徽标。正如衬衫标签所描述的那样,创意提示是"谷歌 I/O 徽标融化在地面上,彩虹色,插图,摄影棚灯光"。下面是我们的创作过程:
首先,团队在 AI Studio 中选择了 Gemini 2.5 Pro,并通过详细的系统指令提示确定了他们的目标。
设定好这些准则后,他们输入了前面提到的创意提示。然后,Gemini 2.5 Pro 为所需的图像输出生成了一份需求和风格创意列表。例如"核心形状:三个原始形状(整体矩形、细斜线/矩形和圆柱形)的基本几何形状必须仍然清晰可辨、视觉分明,即使在其侧面应用了融化效果。不要扭曲核心结构,使其超出融化效果"。
团队拿到这些书面说明后,便转而使用我们的主力机型--具有图像生成功能的 Gemini 2.0 Flash,根据生成的列表制作各种图像选项。
经过大量实验,他们选出了几个最终设计,包括这个。
值得注意的是,团队还尝试绕过 Gemini 2.5 Pro 的初始提示重写,直接在 AI Studio 中使用 Gemini 2.0 Flash。虽然他们接近了预期效果,但使用 2.5 Pro 重写始终能带来更好的结果和更多的创意细节。结果如何?一些非常酷的 T 恤!
准备好回顾了吗?点击这里了解 2025 年 I/O 大会的重要公告,并通过我们的 I/O 问答测试您的知识水平。
相关文章
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
亚马逊推出“Alexa for Shopping”,同时将Rufus边缘化
亚马逊推出了“Alexa for Shopping”,将 Rufus 购物聊天机器人 Alexa+ 整合到应用程序、网站和 Echo Show 设备中。该助手回答产品查询、比较商品、跟踪价格,并支持购物提醒。它还处理计划中的购物操作和符合条件的自动购买。据该公司称,“Alexa for Shopping”将 Rufus 的产品专业知识与 Alexa+ 的个性化助手上下文相结合。亚马逊表示,Rufus 在 2025 年协助了超过 3 亿客户进行产品研究、比较和购买。GeekWire 报道称,
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
相关专题推荐
评论 (1)
0/500
Veo 3 et Imagen 4 semblent impressionnants, mais j'espère que ces avancées en IA générative ne se contentent pas de faire des jolies images. Qu'en est-il de l'impact environnemental de l'entraînement de ces modèles? Les présentations sont cool, mais je veux aussi voir une vraie réflexion éthique derrière. 😅

在 I/O 2025 大会上,我们通过演讲和实际应用展示了生成式人工智能的能力。我们发布了最新的视频和图像生成模型--Veo 3 和 Imagen 4,并扩大了 Lyria 2 的使用范围。我们还推出了 Flow,这是一款人工智能电影制作工具,可使用我们最先进的生成模型无缝创建电影剪辑、场景和连贯的叙事。
我们还将这些工具整合到我们的年度旗舰活动中:I/O 主题演讲中有 219 张幻灯片是人工智能生成的,48% 的主题演讲视觉效果是使用 Imagen 制作的,80% 的视频以某种形式结合了 Veo 或 Imagen。下面将深入介绍我们是如何利用自己的人工智能工具(包括我们的提示语编写流程)将 I/O 2025 变为现实的:
Veo 2:设计有风格的发言人标题卡
当我们的副总裁兼搜索主管 Elizabeth Reid 上台分享主要的搜索更新时,屏幕上播放了一段简短的视频,显示 Liz 张开手,露出一只精致的橙色折纸仙鹤,仙鹤在她的手掌上方旋转、悬浮。
我们使用由 Veo 2 支持的 AI Studio 和 Vertex AI Studio 的图像到视频功能制作了这段视频和其他演讲者介绍视频。我们收集了演讲者的头像以及他们的兴趣和爱好,并将其融入到提示中。这是我们为研究科学家 Jason Baldridge 制作的标题卡提示:
下面是 Veo 2 的原始输出,经过简单的动画增强,以及观众在舞台上看到的效果:
Imagen 4 和 Veo 3:故事板和电影制作
在 I/O 上放映的几部电影在制作过程中都使用了人工智能工具。开场影片带领观众穿越了一个西部主题的小镇,展开了一段惊心动魄的旅程,随后镜头拉高,彩色气球上写着 "欢迎来到 I/O",拉开了主题演讲的序幕。
制作团队使用了多种人工智能工具来制作这部影片。他们首先使用 Imagen 4 为视频提示生成图像。他们还与谷歌 DeepMind 团队合作,后者使用双子座来完善提示,帮助他们找到合适的语言,以达到预期效果。这是第一个场景使用的提示:
这是他们生成的图像:
然后,团队将这一图像纳入 Veo 3 提示中,其中包括以下指示:"......":
准备好图像和完善的提示后,他们开始使用我们最新的 Veo 3 技术(可通过 Google AI Ultra 计划获取!)制作影片。他们还使用 Veo 3 进行实时调整--在审查输出结果时添加俯拍镜头、更宽的角度和不同的视觉效果。与经常需要重新拍摄场景的传统电影制作不同,该团队可以更快地进行迭代。无需编码:一些团队成员使用 Colab 功能进行基于代码的编辑,而许多其他成员则依靠文本到视频的提示,用自然语言描述编辑和请求。
以下是用于创建影片最终场景之一的提示:
Lyria RealTime:与 Toro y Moi 实时演奏
在 I/O 预展期间,艺术家 Toro y Moi 在现场音乐表演中使用 Lyria RealTime 展示了该模型的最新功能。Lyria RealTime 是我们的交互式音乐生成模型,可让您实时创建、控制和演奏生成音乐。您可以混合和变形乐器、声音、流派等。"这将是一场表演和实验,"他在开始前解释道。"我演奏的一切都是完全即兴的--我和电脑一起演奏,电脑也和我一起演奏。
在演出前的几周里,团队为 Toro y Moi 提供了 Lyria RealTime 原型,以便他测试和完善自己的提示。这帮助他开发了一个创意概念和在演出中使用的提示音。他创建了 16 个声音提示,包括 "混乱的康加鼓手 "和 "音高偏移的英国丛林鼓",并将它们分配给实体 MIDI 控制器上的旋钮。
通过 MIDI 控制器在本地运行 Lyria RealTime,可以让 Toro y Moi 在舞台上使用该模型,并让观众现场观看界面的运行情况。
演出期间,一个使用 Lyria RealTime API 制作并在 MIDI 控制器上运行的应用程序显示在 Toro y Moi 的身后。观众可以看到该应用程序用于创建和控制连续音乐流的选项,以及他在叠加键盘和人声润色时使用的提示。
请使用 AI Studio 中的 Lyria RealTime API 亲自尝试一下。
人工智能工作室:创建人工智能生成的 Swag
我们在谷歌人工智能工作室(Google AI Studio)中使用了几个双子座模型--我们用于快速测试模型和实验提示的免费界面--设计了今年的 I/O 衬衫,上面有一个全新的定制徽标。正如衬衫标签所描述的那样,创意提示是"谷歌 I/O 徽标融化在地面上,彩虹色,插图,摄影棚灯光"。下面是我们的创作过程:
首先,团队在 AI Studio 中选择了 Gemini 2.5 Pro,并通过详细的系统指令提示确定了他们的目标。
设定好这些准则后,他们输入了前面提到的创意提示。然后,Gemini 2.5 Pro 为所需的图像输出生成了一份需求和风格创意列表。例如"核心形状:三个原始形状(整体矩形、细斜线/矩形和圆柱形)的基本几何形状必须仍然清晰可辨、视觉分明,即使在其侧面应用了融化效果。不要扭曲核心结构,使其超出融化效果"。
团队拿到这些书面说明后,便转而使用我们的主力机型--具有图像生成功能的 Gemini 2.0 Flash,根据生成的列表制作各种图像选项。
经过大量实验,他们选出了几个最终设计,包括这个。
值得注意的是,团队还尝试绕过 Gemini 2.5 Pro 的初始提示重写,直接在 AI Studio 中使用 Gemini 2.0 Flash。虽然他们接近了预期效果,但使用 2.5 Pro 重写始终能带来更好的结果和更多的创意细节。结果如何?一些非常酷的 T 恤!
准备好回顾了吗?点击这里了解 2025 年 I/O 大会的重要公告,并通过我们的 I/O 问答测试您的知识水平。
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
Veo 3 et Imagen 4 semblent impressionnants, mais j'espère que ces avancées en IA générative ne se contentent pas de faire des jolies images. Qu'en est-il de l'impact environnemental de l'entraînement de ces modèles? Les présentations sont cool, mais je veux aussi voir une vraie réflexion éthique derrière. 😅





首页






