facebookresearch

vggt-omega

facebookresearch

[CVPR 2026 Oral] VGGT Omega

AI 简介

VGGT-Omega 是一个面向多模态视觉-语言理解的预训练基础模型,基于Transformer架构扩展VGG风格特征编码器,支持图像与文本联合表征学习。其核心特点包括分层视觉骨干、可扩展参数量(1B级)、支持不同分辨率输入(256/512)及可选文本对齐模块;提供开源实现与Hugging Face在线Demo。适用于图像-文本检索、跨模态生成提示、零样本视觉分类等需要强语义对齐能力的多模态任务。

Python
Other
3.4k
Stars
182
Forks
71
Watchers
29
Issues

Star 增长

今日0
近 7 天0
近 30 天+179
综合评分68.79
默认分支main