真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准

碧海醫心
发布: 2025-02-16 20:42:24
原创
787人浏览过

阿里巴巴通义实验室的最新研究成果emo2,实现了仅需一张肖像照片和任意长度音频,即可生成高度逼真、感染力十足的ai人像视频。该技术突破了以往音频驱动人像视频生成在动作流畅度和表现力上的局限,为虚拟主播、数字人等领域带来革新。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

AIxiv专栏持续报道全球顶尖AI实验室的学术技术成果,至今已发布2000余篇高质量文章。欢迎投稿分享您的研究成果!投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

EMO2的核心创新在于其“末端执行器”引导的生成策略。研究者巧妙地借鉴机器人控制系统中的“末端执行器”(例如机械手)概念,将手部动作作为关键驱动因素。由于手部动作与人类意图关联紧密,且与音频信号的相关性显著,因此优先生成手部动作,再利用逆向运动学和像素先验知识,生成其他身体部位的自然动作,从而避免了传统方法中容易出现的动作僵硬、不协调等问题。

图片

以下是一些EMO2生成的视频示例:

Revid AI
Revid AI

AI短视频生成平台

Revid AI 62
查看详情 Revid AI

真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准

EMO2采用两阶段框架:首先基于DIT模型生成精准的手部动作,然后利用基于扩散UNet的视频生成模型,以手部动作作为引导,合成包含自然面部表情和身体动作的完整视频。实验结果表明,EMO2在动作多样性、流畅度和与音频的一致性方面均显著优于现有方法。 这为音频驱动视频生成技术提供了新的方向。

图片图片图片图片图片

以上就是真假难辨!阿里升级AI人像视频生成,表情动作直逼专业水准的详细内容,更多请关注php中文网其它相关文章!

相关标签:
最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号