facebookresearch

audio2photoreal

facebookresearch

Code and dataset for photorealistic Codec Avatars driven from audio

AI 简介

该项目实现从语音输入生成逼真数字人视频的技术,支持端到端合成具备光栅化级真实感的Codec Avatars。核心基于PyTorch构建,融合扩散模型(face/body diffusion)与VQ-VAE、引导Transformer等架构,分别建模面部表情、身体姿态及运动时序一致性;提供预训练模型、完整训练/推理流程及Gradio交互式演示。适用于虚拟会议、远程教育、AI助手等需语音驱动高保真数字人呈现的场景。

Python
Other
2.9k
Stars
281
Forks
3
Watchers
6
Issues

Star 增长

今日0
近 7 天0
近 30 天+1
综合评分59.45
默认分支main