FantasyTalking – 革新数字人生成的 AI 框架
FantasyTalking 是什么
FantasyTalking 是由阿里巴巴 AMAP 团队与北京邮电大学联合研发的基于视频扩散变换器的新型数字人生成框架,可从单张静态图像生成动态说话肖像,实现静态肖像的动态化生成,解决了传统虚拟形象生成在动作自然度与身份保持方面的瓶颈,推动数字人技术向 “数字永生” 迈进。
核心功能
- 口型同步 :唇部运动与音频信号时间对齐误差小于 40 毫秒,口型同步误差仅 0.03 秒,能准确识别并同步虚拟角色的口型与输入语音,使角色在说话时的口型与语音内容完全一致,提升角色的真实感和可信度。
- 多维表情控制 :支持 22 组面部肌肉群的独立强度调节,从微蹙眉头到开怀大笑均可量化控制,可根据语音内容及情感信息生成眨眼、皱眉、微笑等丰富的面部动作,使虚拟角色的表情更加丰富和生动。
- 全身动作生成 :可生成全身的动作和姿态,如行走、奔跑、跳跃等,实现自然头部转动、肩部摆动等非语言动作,让虚拟角色在动画中更加自然和流畅。
- 多视角支持 :证件照可秒变 360° 动态形象,支持特写、半身、全身等视角的动态输出,以及 ±45° 侧脸输出,满足不同场景和需求。
- 风格兼容性 :适配写实、卡通等不同美术风格的角色形象,支持多种风格的肖像生成。
- 提示词控制功能 :提供提示词控制功能,调整角色表情和肢体动作,用户可输入提示词对肖像的运动进行可控操纵,满足个性化需求。
- 分辨率调节 :支持分辨率调节,最高可输出 720P 的视频,满足不同场景和设备的显示需求。
技术原理
- 双阶段视听对齐策略 :首先通过片段级训练方案,捕捉音频与整个场景之间的相关性,建立全局视听依赖关系,使模型能学习到与音频相关的非语言线索和唇部动态;接着在帧级训练阶段,专注于与音频高度相关的视觉特征细化,特别是唇部动作,通过唇部追踪掩码确保唇部运动与音频信号精确对齐,提高生成视频的质量。
- 面部专注交叉注意力模块 :传统的参考网络方法会限制视频中人物和背景的大范围自然变化,FantasyTalking 采用面部专注的交叉注意力模块,集中建模面部区域,通过交叉注意力机制解耦身份保留与动作生成,仅需 3% 的额外参数量,就能确保在整个生成的视频序列中保持角色的身份特征,同时解放对背景和人物自然运动的限制。
- 运动强度调制模块 :引入运动强度调制模块,用户可显式控制面部表情和身体运动的强度,不仅限于唇部运动,通过调节运动强度,可以生成更加自然和多样化的动画,满足不同场景和情感表达的需求。
- 基于预训练的视频扩散变换器模型 :基于 Wav2.1 视频扩散变换器模型,具有时空建模能力,能够生成高保真、连贯的说话肖像视频,有效捕捉音频信号与唇部运动、面部表情以及身体动作之间的关系,生成高质量的动态肖像。
支持平台
FantasyTalking 支持在多种操作系统上运行,包括 Windows、Linux 和 macOS 等,用户可以在不同的设备和环境下使用该工具,方便快捷地生成虚拟角色动画。
团队介绍
FantasyTalking 是由阿里巴巴 AMAP 团队与北京邮电大学合作开发的。阿里巴巴 AMAP 团队在人工智能、计算机视觉和深度学习等领域具有丰富的研发经验和深厚的技术积累,其研究成果广泛应用于阿里巴巴的多个业务领域,为用户提供更有价值的产品和服务。北京邮电大学作为中国信息通信领域的知名高校,在通信工程、计算机科学与技术等相关学科具有强大的科研实力和人才培养能力,为项目的研发提供了坚实的理论基础和技术支持。
项目资源
- 项目主页 :https://fantasy-amap.github.io/fantasy-talking/
- GitHub 仓库 :https://github.com/Fantasy-AMAP/fantasy-talking
业务场景
- 游戏开发 :可用于生成游戏角色的对话动画、战斗动画等,提升游戏的视觉效果和互动性,为玩家带来更加沉浸式的游戏体验。
- 影视制作 :帮助影视制作团队快速生成高质量的虚拟角色表演动画、特效动画等,降低制作成本和时间成本,提高制作效率和质量。
- 虚拟现实和增强现实 :为虚拟现实和增强现实应用生成虚拟角色的交互动画、引导动画等,提升用户的沉浸感和体验效果,拓展应用场景和可能性。
- 虚拟数字人 :可用于创建虚拟主播、虚拟偶像、虚拟客服等虚拟数字人,通过输入音频和文本,快速生成富有表情、自然身体动作的动态形象,实现与观众的互动和沟通,提升虚拟数字人的表现力和亲和力。
- 教育领域 :在教育领域,可制作虚拟教师或教学助手,通过生动的表情和动作讲解知识,提高教学效果和学生的参与度,为教育信息化提供新的手段和方法。