
PureDocBench
zhihengli-casia
PureDocBench: source-traceable benchmark for document parsing across clean, degraded, and real-world settings
AI 简介
PureDocBench 是一个面向文档解析任务的可溯源基准测试集,用于系统性评估OCR与文档理解模型在干净、数字退化及真实退化场景下的鲁棒性与结构还原能力。其核心特点是基于HTML/CSS源文件生成图像与标注,确保文本、公式、表格、图注和阅读顺序等结构信息具备精确的源追踪性,显著降低人工后验标注噪声。支持三类图像退化轨道(clean/digital-degraded/real-degraded),提供细粒度指标(如FormulaCDM、TableTEDS、ROEdit)和诊断分析模块。适用于文档AI算法研发、模型鲁棒性评测及学术研究中的跨场景性能对比。
Python
Other35
Stars
0
Forks
30
Watchers
4
Issues
Star 增长
今日0
近 7 天0
近 30 天+3
综合评分40.3
默认分支main