
PDF-Extract-Kit
opendatalab
A Comprehensive Toolkit for High-Quality PDF Content Extraction
AI 简介
PDF-Extract-Kit 是一个面向高质量PDF内容解析的开源工具包,专注于从复杂、多格式PDF(如学术论文、技术报告、含公式与表格的文档)中精准提取结构化内容。其核心能力包括版面分析、数学公式检测与识别、OCR、文本与图像分离等,整合了多个预训练模型,并采用模块化设计,支持通过配置灵活组合不同解析组件。项目提供标准化评估基准,便于模型选型与效果验证。适用于科研文献处理、知识库构建、AI文档理解前处理等对解析精度和结构保真度要求较高的场景。
Python
GNU Affero General Public License v3.09.8k
Stars
739
Forks
61
Watchers
96
Issues
Star 增长
今日0
近 7 天0
近 30 天+15
综合评分66.11
默认分支main