Yuliang-Liu

MonkeyOCRv2

Yuliang-Liu

MonkeyOCRv2 Vision Encoder — A Document-Native Visual Backbone

AI 简介

MonkeyOCRv2 是一个面向文档理解的视觉基础模型,专为文本密集型文档图像设计。其核心是文档原生的视觉编码器(Vision Encoder),基于 ViT 及 ViTAEv2 架构,支持多语言文本识别、文档解析、公式识别、篡改检测、场景文字检测与重叠文本分割等任务;具备细粒度文本建模能力、跨任务表征学习与跨语言泛化能力。适用于金融票据、政务公文、学术论文、多语种扫描件等结构复杂、版式多样的文档智能处理场景。

Python
180
Stars
25
Forks
2
Watchers
1
Issues

Star 增长

今日0
近 7 天+69
近 30 天+69
综合评分68.14
默认分支main