
Dolphin
bytedance
The official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.
AI 简介
Dolphin 是一个面向文档图像解析的通用多模态模型,专注于从扫描件、照片或数字PDF中精准识别布局结构与语义元素。其核心采用文档类型感知的两阶段架构:第一阶段分类文档来源(数字/拍摄)并预测阅读顺序;第二阶段基于类型动态选择整体式或并行式解析策略,支持文本、表格、公式、代码块等21类元素检测与属性抽取,并集成轻量级VL-OCR能力。适用于智能办公、学术文献处理、金融单据解析及法律文书结构化等需高精度、跨格式文档理解的场景。
Python
Other9k
Stars
770
Forks
69
Watchers
69
Issues
Star 增长
今日0
近 7 天0
近 30 天+3
综合评分64.96
默认分支master