
olmocr
allenai
Toolkit for linearizing PDFs for LLM datasets/training
AI 简介
olmocr 是一个面向大语言模型(LLM)数据集构建与训练的 PDF 文档线性化工具包,将扫描版 PDF、PNG、JPEG 等图像型文档精准转换为保持语义结构的 Markdown 或纯文本。其核心基于多模态大模型(VLM),支持复杂排版(多栏、图文混排)、数学公式、表格、手写体识别及自动页眉页脚剔除,并按自然阅读顺序重建文本流。适用于学术文献处理、知识库构建、PDF 大模型预训练语料清洗等需高保真文档结构还原的场景。
Python
Apache License 2.019.1k
Stars
1.6k
Forks
100
Watchers
56
Issues
Star 增长
今日0
近 7 天0
近 30 天+1475
综合评分44.58
默认分支main