OpenMOSS

MOSS-VL

OpenMOSS

MOSS-VL is the core multimodal model series within the OpenMOSS ecosystem, dedicated to visual understanding.

AI 简介

MOSS-VL 是 OpenMOSS 生态中专注于视觉理解的多模态大模型系列,支持图像与视频的细粒度理解与跨模态推理。其技术特点包括基于绝对时间戳的视频建模、跨注意力旋转位置编码(XRoPE)、多阶段数据/参数/上下文三维扩展策略,以及对长时序视频内容的建模能力。模型已适配 SGLang 推理框架,并提供 Hugging Face 和 ModelScope 等平台的预训练权重与在线 Demo。适用于需要高精度视觉-语言联合理解的研究与应用,如视频问答、多步视觉推理、教育类视觉辅助系统等场景。

Python
Apache License 2.0
271
Stars
4
Forks
2
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+2
综合评分42.3
默认分支main