
ttt-video-dit
test-time-training
Official PyTorch implementation of One-Minute Video Generation with Test-Time Training
AI 简介
TTT-Video 是一个基于扩散Transformer的视频生成项目,支持长达63秒的高质量文本到视频生成。其核心创新是引入测试时训练(Test-Time Training, TTT)层,在保留CogVideoX-5B预训练模型局部注意力能力的基础上,建模跨片段的长程时序依赖;通过分阶段扩展(3s→9s→18s→30s→63s)实现上下文延伸与风格迁移。技术上融合TTT-MLP内核、双向全局序列建模及文本-视频嵌入交织机制,需H100 GPU与CUDA 12.3+环境。适用于需要长时序连贯性、风格可控的工业级视频生成场景,如广告素材生成、教育视频合成与创意内容原型开发。
Python
MIT License2.4k
Stars
8
Forks
26
Watchers
8
Issues
Star 增长
今日0
近 7 天0
近 30 天+4
综合评分55.26
默认分支main