
MMAudio
hkchengrex
[CVPR 2025] MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
AI 简介
MMAudio 是一个面向视频到音频合成的多模态生成模型,支持视频输入、文本输入或二者联合驱动高质量同步音频生成。其核心技术包括多模态联合训练机制,可统一利用音视频对和图文音频数据进行训练,并通过同步模块确保生成音频与视频帧在时间上精准对齐。项目基于 PyTorch 实现,提供预训练模型、在线 Demo(Hugging Face/Replicate)及 Colab 快速体验入口,适用于影视后期音效生成、AI 视频配音、无障碍内容生成等需要跨模态时序对齐的场景。
Python
MIT License2.2k
Stars
260
Forks
21
Watchers
9
Issues
Star 增长
今日0
近 7 天0
近 30 天+11
综合评分60.35
默认分支main