
MonkeyOCRv2
Yuliang-Liu
MonkeyOCRv2 Vision Encoder — A Document-Native Visual Backbone
AI 简介
MonkeyOCRv2 是一个面向文档理解的视觉基础模型,专为文本密集型文档图像设计。其核心是文档原生的视觉编码器(Vision Encoder),基于 ViT 及 ViTAEv2 架构,支持多语言文本识别、文档解析、公式识别、篡改检测、场景文字检测与重叠文本分割等任务;具备细粒度文本建模能力、跨任务表征学习与跨语言泛化能力。适用于金融票据、政务公文、学术论文、多语种扫描件等结构复杂、版式多样的文档智能处理场景。
Python
180
Stars
25
Forks
2
Watchers
1
Issues
Star 增长
今日0
近 7 天+69
近 30 天+69
综合评分68.14
默认分支main