cvlab-kaist

TrackCraft3r

cvlab-kaist

Official code implementation for TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

AI 简介

TrackCraft3R 是一个基于视频扩散变换器(Video Diffusion Transformer)的单次前向传播密集三维目标跟踪方法。它复用预训练的大规模视频生成模型(Wan2.1-T2V-1.3B),通过轻量级适配(LoRA、I/O投影等)实现对单目视频、深度图与相机参数的联合处理,直接输出稠密像素级3D轨迹。技术特点包括:无需迭代优化、端到端可训练、支持合成数据多源联合训练(Kubric、TartanAir等)、依赖Hugging Face生态加载权重。适用于自动驾驶仿真、AR/VR场景理解、机器人视觉导航等需高效稠密3D运动建模的研究与开发场景。

Python
Apache License 2.0
97
Stars
5
Forks
1
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+1
综合评分42.43
默认分支main