
DeepSeek-OCR
deepseek-ai
Contexts Optical Compression
AI 简介
DeepSeek-OCR 是一个面向多模态大语言模型(MLLM)的视觉文本压缩模型,旨在通过轻量化视觉编码器实现高效图文信息压缩与对齐。其核心特点是将高分辨率图像压缩为紧凑的视觉 token 序列,并与 LLM 语言空间协同优化,支持 vLLM 和 Transformers 双框架推理,在保持 OCR 与文档理解能力的同时显著降低视觉计算开销。适用于文档解析、票据识别、长上下文多模态推理等对延迟和显存敏感的工业级 OCR 与视觉语言任务。
Python
MIT License23.5k
Stars
2.2k
Forks
108
Watchers
249
Issues
Star 增长
今日0
近 7 天0
近 30 天+103
综合评分80
默认分支main