选项
首页
快讯
内容
MatthewLewis
MatthewLewis
2026-07-21

谷歌DeepMind推出了GenCeption,这是一个基于阿里巴巴Wan2.1框架构建的模型,它将视频生成逆向转化为视觉分析引擎。该模型能在单次前向传播中同时执行五项核心任务,包括深度估计、分割和3D姿态估计。 该模型仅使用7500段单人合成视频进行训练,却能泛化到多人、动物和机器人场景中。小型模型可在6秒内处理81帧图像;大型140亿参数模型则需10秒,同时能保留猫须和毛发等精细细节。

谷歌DeepMind推出了GenCeption,这是一个基于阿里巴巴Wan2.1框架构建的模型,它将视频生成逆向转化为视觉分析引擎。该模型能在单次前向传播中同时执行五项核心任务,包括深度估计、分割和3D姿态估计。 该模型仅使用7500段单人合成视频进行训练,却能泛化到多人、动物和机器人场景中。小型模型可在6秒内处理81帧图像;大型140亿参数模型则需10秒,同时能保留猫须和毛发等精细细节。
评论 (0)
0/300
OR