EMAGE：上传音频就能生成全身动作包括头部、嘴型、身体运动

2024-04-03 12:37

默认

摘要：划重点:⭐️ 提出了 EMAGE 框架，用于从音频和掩码手势生成全身人类手势。⭐️ 引入了新的全面共话数据集 BEATX，结合 MoShed SMPLX 身体与 FLAME 头部参数，提高了建模质量。⭐️ EMAGE 利用掩码手势先验信息进行训..

划重点:
⭐️ 提出了 EMAGE 框架，用于从音频和掩码手势生成全身人类手势。
⭐️ 引入了新的全面共话数据集 BEATX，结合 MoShed SMPLX 身体与 FLAME 头部参数，提高了建模质量。
⭐️ EMAGE 利用掩码手势先验信息进行训练，采用 Masked Audio Gesture Transformer 实现音频到手势生成，取得了最先进的性能。

最近，多所知名大学和研究机构的研究人员共同提出了 EMAGE 框架，旨在从音频和掩码手势生成全身人类手势。

EMAGE技术能实现输入音频生成全身动作，包括头部、嘴型、身体、手部和整体运动，跟之前Meta的audio2photoreal很像。用户只要上传音频（小于60秒），然后点击提交，输出结果将在输出中呈现3分钟。

他们引入了新的全面共话数据集 BEATX，该数据集结合了 MoShed SMPLX 身体和 FLAME 头部参数，进一步提高了建模质量，特别是对头部、颈部和手指动作的建模。EMAGE 在训练过程中利用了掩码手势的先验信息，以提高推断性能。该框架包括一个 Masked Audio Gesture Transformer，有助于联合训练音频到手势生成和掩码手势重建，有效地编码音频和身体手势提示。从掩码手势中编码的身体提示随后分别用于生成面部和身体动作。

此外，EMAGE 自适应地合并了音频的节奏和内容的语音特征，并利用了四个组合 VQ-VAE 来增强结果的保真度和多样性。实验证明，EMAGE 具有最先进的性能，能够生成具有完整的、音频同步的整体手势。

EMAGE 技术的问世将在各个领域产生深远影响，其中包括但不限于教育、医疗、娱乐等领域。研究团队表示，他们的代码和数据集已经公开提供，供学术和工业界使用。

项目入口：https://top.aibase.com/tool/emage

在线体验:https://huggingface.co/spaces/H-Liu1997/EMAGE

更新于：8个月前

EMAGE：上传音频就能生成全身动作包括头部、嘴型、身体运动

最近发表

加速拓展欧洲市场！Tiktok的突围之路

美客多新增美国转运仓模式，十大入驻问题解答！

京东元旦和年货节哪个力度大？年货节一般是什么时候？

淘宝直播间的流量为什么越来越差？怎样获取？

京东买白酒是自营好还是官方店好？买白酒可靠吗？

淘宝退货宝退货需要付运费吗？退货运费谁出？

小红书商业化业务确定2025年三大方向

抖店怎么同步其他平台销量？抖店销量是下单就算吗？

95后是淘宝天猫消费年货的绝对主力！

快手短剧有大动作！

相关文章