
DocLayout-YOLO
opendatalab
DocLayout-YOLO: Enhancing Document Layout Analysis through Diverse Synthetic Data and Global-to-Local Adaptive Perception
AI 简介
DocLayout-YOLO 是一个面向文档版面分析的实时目标检测模型,基于 YOLO-v10 架构,专为识别标题、段落、表格、图片等多类文档元素而优化。其核心特点包括:采用 Mesh-candidate BestFit 方法生成大规模多样化合成数据集 DocSynth-300K 进行预训练;引入全局到局部可控感知模块,提升跨尺度元素(如小图标与大文本块)的检测精度。适用于 PDF 解析、OCR 前处理、智能文档理解、学术论文结构化等需要高鲁棒性版面解析的场景。
Python
GNU Affero General Public License v3.02.2k
Stars
167
Forks
9
Watchers
50
Issues
Star 增长
今日0
近 7 天0
近 30 天+11
综合评分59.78
默认分支main