zghhui

OmniNFT

zghhui

Code for "OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation"

AI 简介

OmniNFT 是一个面向音视频联合生成的扩散模型微调框架,旨在提升多模态生成中音频与视频的一致性与同步质量。其核心技术包括模态感知的优势路由(分别建模视频、音频及跨模态同步奖励)、层级别梯度手术(抑制浅层跨模态梯度干扰)和区域感知损失重加权(基于注意力图聚焦关键声源区域优化)。项目基于 LTX 系列扩散模型,以 LoRA 形式提供轻量级适配,支持 ComfyUI 部署。适用于需要高保真音画同步的生成任务,如短视频合成、虚拟人驱动、AIGC 内容创作等研究与应用场景。

Python
148
Stars
6
Forks
73
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+7
综合评分2.54
默认分支master