
Ovis
ATH-MaaS
A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.
AI 简介
Ovis 是一个面向视觉-语言对齐的多模态大语言模型(MLLM)架构,核心目标是实现图像与文本嵌入在结构层面的深度对齐。其技术特点包括原生分辨率视觉感知、支持反思式推理(thinking mode)、增强的图表理解与空间定位能力,以及对高分辨率图像、多图输入和短视频的统一建模;模型已推出2B/9B/34B等多种参数规模,并提供GPTQ量化版本。适用于需要精准图文理解与推理的场景,如智能文档分析、科学图表解读、工业质检报告生成及教育类视觉问答系统。
Python
Apache License 2.01.5k
Stars
83
Forks
19
Watchers
79
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分53.77
默认分支main