zai-org

CogVLM

zai-org

a state-of-the-art-level open visual language model | 多模态预训练模型

AI 简介

CogVLM 是一个开源的视觉语言多模态大模型,支持图像理解与图文多轮对话。其核心版本 CogVLM-17B 融合 100 亿视觉参数与 70 亿语言参数,支持 490×490 分辨率图像输入,在 NoCaps、GQA、ScienceQA 等 10 个主流跨模态基准上达到领先水平;衍生模型 CogAgent-18B 进一步提升图像分辨率至 1120×1120,并增强 GUI 界面理解与操作能力,在 AITW、Mind2Web 等 GUI Agent 任务中表现突出。适用于需要高精度图文理解、多轮视觉对话及桌面/网页界面自动化交互的研究与应用场景。

Python
Apache License 2.0
6.7k
Stars
452
Forks
68
Watchers
67
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分63.97
默认分支main