fudan-generative-vision

hallo2

fudan-generative-vision

[ICLR 2025] Hallo2: Long-Duration and High-Resolution Audio-driven Portrait Image Animation

AI 简介

Hallo2是一个基于音频驱动的肖像图像动画生成模型,可将静态人像图与语音音频同步生成长时间、高分辨率的口型与表情动画。项目采用扩散模型架构,支持长达60分钟的视频生成,输出分辨率可达4K,并具备良好的唇形同步精度和面部细节表现力。其核心特点是长时序建模能力、高保真纹理渲染及端到端音频-视觉对齐机制。适用于数字人驱动、在线教育视频生成、虚拟主播内容制作及无障碍语音可视化等需要高质量语音驱动人脸动画的场景。

Python
MIT License
3.7k
Stars
536
Forks
289
Watchers
49
Issues

Star 增长

今日0
近 7 天0
近 30 天+4
综合评分60.59
默认分支main