
jepa
facebookresearch
PyTorch code and models for V-JEPA self-supervised learning from video.
AI 简介
V-JEPA 是一个面向视频的自监督视觉表征学习框架,通过联合嵌入预测架构(Joint Embedding Predictive Architecture)在无标注视频数据上预训练视觉编码器。其核心特点是仅依赖隐空间特征预测目标,无需像素重建、文本模态、负样本或人工标注;支持冻结主干网络+轻量探针的下游迁移,适用于视频理解、动作识别、图像表征等任务。模型在 VideoMix2M 数据集上训练,输出具备时空一致性的高质量视觉表征,可与条件扩散解码器协同实现可解释性可视化。
Python
Other4k
Stars
405
Forks
53
Watchers
50
Issues
Star 增长
今日0
近 7 天0
近 30 天+23
综合评分62.13
默认分支main