
lingbot-vision
Robbyant
Self-supervised learning for spatial perception
AI 简介
LingBot-Vision 是一个面向密集空间感知的自监督视觉预训练模型家族,基于 Vision Transformer 架构,核心采用边界中心化的掩码建模(masked boundary modeling)目标,使模型在学习语义表征的同时显式建模物体边界、几何结构与空间关系。支持从 ViT-S/16 到 1.1B 参数 ViT-g/16 多种规模,可作为即插即用的视觉编码器,适用于深度估计、语义分割、视频目标分割、深度补全等需像素级空间理解的下游任务。项目开源、轻量适配,已在 RGB-D 等多模态密集预测任务中验证有效性。
Python
Apache License 2.0650
Stars
21
Forks
55
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+354
综合评分58.03
默认分支main