
tdv
ninaddaithankar
PyTorch code for the paper "You Don’t Need Strong Assumptions: Visual Representation Learning via Temporal Differences"
AI 简介
TDV 是一种基于时间差分原理的自监督视频表征学习方法,通过建模‘过去导致未来’这一因果假设,联合训练帧编码器与运动编码器,使当前帧表征加运动表征等于下一帧表征,无需数据增强、掩码或裁剪。项目基于 PyTorch 和 PyTorch Lightning 实现,采用 Vision Transformer 架构,在语义分割任务上媲美 DINO/iBOT,在光流估计和立体深度预测任务上表现更优。适用于需要高质量视频时序建模能力的研究场景,如无监督动作理解、视频预测及下游密集预测任务。
Python
Apache License 2.0104
Stars
6
Forks
2
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+4
综合评分42.94
默认分支main