facebookresearch

jepa

facebookresearch

PyTorch code and models for V-JEPA self-supervised learning from video.

AI 简介

V-JEPA 是一个面向视频的自监督视觉表征学习框架,通过联合嵌入预测架构(Joint Embedding Predictive Architecture)在无标注视频数据上预训练视觉编码器。其核心特点是仅依赖隐空间特征预测目标,无需像素重建、文本模态、负样本或人工标注;支持冻结主干网络+轻量探针的下游迁移,适用于视频理解、动作识别、图像表征等任务。模型在 VideoMix2M 数据集上训练,输出具备时空一致性的高质量视觉表征,可与条件扩散解码器协同实现可解释性可视化。

Python
Other
4k
Stars
405
Forks
53
Watchers
50
Issues

Star 增长

今日0
近 7 天0
近 30 天+23
综合评分62.13
默认分支main