
GenLIP
YanFangCS
Official repo for "Let ViT Speak: Generative Language-Image Pre-training"
AI 简介
GenLIP 是一个面向多模态大语言模型(MLLM)的生成式语言-图像预训练框架,旨在仅用单个ViT视觉编码器和自回归语言建模目标,高效预训练强视觉表征能力。其核心特点是摒弃对比学习、双塔结构与额外文本解码器,通过端到端生成式建模实现视觉特征与语言空间的对齐;技术上支持分阶段数据驱动训练,已在文档理解与OCR类下游任务中验证显著增益。适用于需要轻量、统一架构视觉编码器的MLLM构建场景,尤其适合文档图像分析、图文生成与跨模态理解等任务。
Python
Apache License 2.0133
Stars
3
Forks
51
Watchers
7
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分1.81
默认分支main