7月21日,据the decoder消息,谷歌deepmind正式推出genception模型,开创性地将预训练视频生成模型反向重构为多任务视觉理解系统。该模型以阿里巴巴通义万相wan2.1为基础构建,致力于颠覆计算机视觉领域长期沿用的“单任务、单模型”范式。
GenCeption仅需一次前向推理,即可依据文本指令同步完成深度估计、语义分割、3D人体姿态估计等五项关键视觉分析任务。其训练数据量仅为7500段合成视频,显著少于主流同类模型,却在多项指标上达到甚至超越DepthAnything等专用单任务模型的表现。
在泛化性能方面,GenCeption展现出优异的跨域迁移能力,可稳健处理真实场景下的多人视频,以及训练中未出现过的动物、机器人等类别;部分输出结果的细节还原度甚至超过原始训练渲染质量。不过,当前版本在推理速度与多任务协同优化之间的平衡仍有进一步提升空间。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












