ATH-MaaS

Ovis

ATH-MaaS

A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and textual embeddings.

AI 简介

Ovis 是一个面向视觉-语言对齐的多模态大语言模型(MLLM)架构,核心目标是实现图像与文本嵌入在结构层面的深度对齐。其技术特点包括原生分辨率视觉感知、支持反思式推理(thinking mode)、增强的图表理解与空间定位能力,以及对高分辨率图像、多图输入和短视频的统一建模;模型已推出2B/9B/34B等多种参数规模,并提供GPTQ量化版本。适用于需要精准图文理解与推理的场景,如智能文档分析、科学图表解读、工业质检报告生成及教育类视觉问答系统。

Python
Apache License 2.0
1.5k
Stars
83
Forks
19
Watchers
79
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分53.77
默认分支main