谷歌发布了一个新的视频框架:
只需要一张你的头像、一段讲话录音,就能得到一个本人栩栩如生的演讲视频。
视频时长可变,目前看到的示例最高为10s。
可以看到,无论是口型还是面部表情,它都非常自然。
如果输入图像囊括整个上半身,它也能配合丰富的手势:
网友看完就表示:
有了它,以后咱开线上视频会议再也不需要整理好发型、穿好衣服再去了。
嗯,拍一张肖像,录好演讲音频就可以(手动狗头)
用声音控制肖像生成视频
这个框架名叫VLOGGER。
它主要基于扩散模型,并包含两部分:
一个是随机的人体到3D运动(human-to-3d-motion)扩散模型。
另一个是用于增强文本到图像模型的新扩散架构。
其中,前者负责将音频波形作为输入,生成人物的身体控制动作,包括眼神、表情和手势、身体整体姿势等等。
后者则是一个时间维度的图像到图像模型,用于扩展大型图像扩散模型,使用刚刚预测的动作来生成相应的帧。
为了使结果符合特定的人物形象,VLOGGER还将参数图像的pose图作为输入。
VLOGGER的训练是在一个超大的数据集(名叫MENTOR)上完成的。
有多大?全长2200小时,共包含80万个人物视频。
其中,测试集的视频时长也有120小时长,共计4000个人物。
谷歌介绍,VLOGGER最突出的表现是具备多样性:
如下图所示,最后的像素图颜色越深(红)的部分,代表动作越丰富。
而和业内此前的同类方法相比,VLOGGER最大的优势则体现在不需要对每个人进行训练、也不依赖于面部检测和裁剪,并且生成的视频很完整(既包括面部和唇部,也包括肢体动作)等等。
具体来看,如下表所示:
Face Reenactment方法无法用音频和文本来控制此类视频生成。
Audio-to-motion倒是可以音频生成,方式也是将音频编码为3D人脸动作,不过它生成的效果不够逼真。
Lip sync可以处理不同主题的视频,但只能模拟嘴部动作。
对比起来,后面的两种方法SadTaker和Styletalk表现最接近谷歌VLOGGER,但也败在了不能进行身体控制上,并且也不能进一步编辑视频。
说到视频编辑,如下图所示,VLOGGER模型的应用之一就是这个,它可以一键让人物闭嘴、闭眼、只闭左眼或者全程睁眼:
另一个应用则是视频翻译:
例如将原视频的英语讲话改成口型一致的西班牙语。
网友吐槽
最后,“老规矩”,谷歌没有发布模型,现在能看的只有更多效果还有论文。
嗯,吐槽也是不少的:
画质模型、口型抽风对不上、看起来还是很机器人等等。
因此,有人毫不犹豫打上差评:
这就是谷歌的水准吗?
有点对不起“VLOGGER”这个名字了。
——和OpenAI的Sora对比,网友的说法确实也不是没有道理。。
大家觉得呢?
更多效果:https://enriccorona.github.io/vlogger/
完整论文:https://enriccorona.github.io/vlogger/paper.pdf
以上是谷歌发布'Vlogger”模型:单张图片生成10秒视频的详细内容。更多信息请关注PHP中文网其他相关文章!

使用Gemma范围探索语言模型的内部工作 了解AI语言模型的复杂性是一个重大挑战。 Google发布的Gemma Scope是一种综合工具包,为研究人员提供了一种强大的探索方式

解锁业务成功:成为商业智能分析师的指南 想象一下,将原始数据转换为驱动组织增长的可行见解。 这是商业智能(BI)分析师的力量 - 在GU中的关键作用

SQL的Alter表语句:动态地将列添加到数据库 在数据管理中,SQL的适应性至关重要。 需要即时调整数据库结构吗? Alter表语句是您的解决方案。本指南的详细信息添加了Colu

介绍 想象一个繁华的办公室,两名专业人员在一个关键项目中合作。 业务分析师专注于公司的目标,确定改进领域,并确保与市场趋势保持战略一致。 simu

Excel 数据计数与分析:COUNT 和 COUNTA 函数详解 精确的数据计数和分析在 Excel 中至关重要,尤其是在处理大型数据集时。Excel 提供了多种函数来实现此目的,其中 COUNT 和 COUNTA 函数是用于在不同条件下统计单元格数量的关键工具。虽然这两个函数都用于计数单元格,但它们的设计目标却针对不同的数据类型。让我们深入了解 COUNT 和 COUNTA 函数的具体细节,突出它们独特的特性和区别,并学习如何在数据分析中应用它们。 要点概述 理解 COUNT 和 COU

Google Chrome的AI Revolution:个性化和高效的浏览体验 人工智能(AI)正在迅速改变我们的日常生活,而Google Chrome正在领导网络浏览领域的负责人。 本文探讨了兴奋

重新构想影响:四倍的底线 长期以来,对话一直以狭义的AI影响来控制,主要集中在利润的最低点上。但是,更全面的方法认识到BU的相互联系

事情正稳步发展。投资投入量子服务提供商和初创企业表明,行业了解其意义。而且,越来越多的现实用例正在出现以证明其价值超出


热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

记事本++7.3.1
好用且免费的代码编辑器

Atom编辑器mac版下载
最流行的的开源编辑器

适用于 Eclipse 的 SAP NetWeaver 服务器适配器
将Eclipse与SAP NetWeaver应用服务器集成。

SecLists
SecLists是最终安全测试人员的伙伴。它是一个包含各种类型列表的集合,这些列表在安全评估过程中经常使用,都在一个地方。SecLists通过方便地提供安全测试人员可能需要的所有列表,帮助提高安全测试的效率和生产力。列表类型包括用户名、密码、URL、模糊测试有效载荷、敏感数据模式、Web shell等等。测试人员只需将此存储库拉到新的测试机上,他就可以访问到所需的每种类型的列表。

VSCode Windows 64位 下载
微软推出的免费、功能强大的一款IDE编辑器