
MOSS-VL
OpenMOSS
MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.
AI 简介
MOSS-VL 是 OpenMOSS 生态中专注于视觉理解的多模态大模型系列,支持图像与视频的细粒度理解与跨模态推理。其技术特点包括基于绝对时间戳的视频建模、跨注意力旋转位置编码(XRoPE)、多阶段数据/参数/上下文三维扩展策略,以及对长时序视频内容的建模能力。模型已适配 SGLang 推理框架,并提供 Hugging Face 和 ModelScope 等平台的预训练权重与在线 Demo。适用于需要高精度视觉-语言联合理解的研究与应用,如视频问答、多步视觉推理、教育类视觉辅助系统等场景。
Python
Apache License 2.0271
Stars
4
Forks
2
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天+2
综合评分42.3
默认分支main