
LoomVideo
MSALab-PKU
Official implementation of LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
AI 简介
LoomVideo 是一个轻量级统一视频生成与编辑模型,支持文本到视频生成、视频指令编辑、图像到视频生成及参考图像驱动的视频编辑四种任务。其核心采用5B参数规模的MLLM+DiT混合架构,通过Deepstack Injection实现多粒度语义注入,Scale-and-Add Conditioning消除token拼接开销,Negative Temporal RoPE支持多图时序建模,显著降低计算成本(推理提速5.41×)且保持高性能。适用于需兼顾效率与质量的视频AIGC研究与应用,如内容创作辅助、教育视频生成、广告素材快速迭代等场景。
Python
73
Stars
2
Forks
1
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天+5
综合评分38.93
默认分支main