百度近日开源了全新的 OCR 大模型项目 Unlimited-OCR。该项目定位为“One-shot Long-horizon Parsing(一次性长程解析)”,目标是突破传统 OCR 在长文档处理中的性能瓶颈,让模型能够像人类阅读一样连续理解几十页甚至更长的文档内容。项目代码、模型权重以及技术报告均已公开。
项目地址:GitHub – baidu/Unlimited-OCR
一、传统 OCR 的局限:长文档处理一直是难题
OCR(Optical Character Recognition,光学字符识别)技术已经广泛应用于:
- PDF 文档数字化
- 企业档案管理
- 发票与合同识别
- 论文解析
- 表格提取
- 智能知识库建设
但传统 OCR 系统通常采用“页面级处理”方式:
- 将 PDF 拆分成单页图片;
- 对每页进行文字检测;
- 识别文字内容;
- 再人工或程序拼接结果。
这种方式面对几十页、几百页文档时,会出现明显问题:
- 页面之间上下文丢失;
- 表格结构容易破坏;
- 长文本生成速度下降;
- 显存占用随着输出长度增加。
尤其是在基于大语言模型(LLM)的 OCR 系统中,随着生成文本越来越长,KV Cache(键值缓存)会不断增长,导致推理速度下降和显存压力增加。Unlimited-OCR 正是针对这一问题提出新的解决方案。
二、Unlimited-OCR 是什么?
Unlimited-OCR 是一个基于视觉语言模型(Vision-Language Model)的端到端 OCR 系统。
它并不是简单地“识别图片里的文字”,而是希望实现:
输入整份文档 → 模型一次理解 → 输出完整结构化内容
相比传统 OCR,它更接近“阅读理解”。
它支持:
- 图片 OCR
- 多页文档解析
- PDF 文档处理
- 表格理解
- 文档布局分析
- 长文本连续生成
官方将其定义为:
Welcome the Era of One-shot Long-horizon Parsing.
即“一次性长程解析时代”的到来。
三、核心技术:Reference Sliding Window Attention(R-SWA)
Unlimited-OCR 最大的技术创新是提出了一种新的注意力机制:
Reference Sliding Window Attention(R-SWA)
传统 Transformer 在生成长文本时:
输入内容
↓
生成第1个Token
↓
生成第2个Token
↓
……
↓
生成第N个Token
每生成一个新的 Token,都需要关注之前所有 Token。
随着文本增长:
- KV Cache 越来越大;
- 推理速度越来越慢;
- 显存消耗持续增加。
Unlimited-OCR 的 R-SWA 进行了优化:
- 保留视觉输入作为长期参考;
- 对已经生成的文本采用滑动窗口关注;
- 控制 KV Cache 长度保持稳定。
简单理解:
传统模型:
“每写一句话,都重新回忆整篇文章。”
Unlimited-OCR:
“保留关键视觉记忆,只关注当前上下文。”
这种设计让模型能够处理更长文档,而不会随着输出长度显著降低效率。
四、模型规模与性能特点
Unlimited-OCR 模型参数规模约为 30 亿参数(3B),采用视觉语言模型架构。模型文件以开源形式发布,并采用 MIT License,方便研究和商业应用。
其主要特点包括:
1. 超长文档一次解析
Unlimited-OCR 的核心能力:
- 一次 Forward Pass 处理几十页文档;
- 避免传统 OCR 分页处理流程;
- 保持长文档上下文一致。
技术报告指出,该方法能够在标准长度限制下解析几十页文档,同时保持稳定的 KV Cache。(arXiv)
2. 更强的文档结构理解能力
普通 OCR:
图片
↓
文字
Unlimited-OCR:
图片
↓
文字 + 布局 + 表格 + 语义关系
↓
结构化输出
例如:
输入:
年度财务报告 PDF
输出可以理解:
- 标题层级
- 表格关系
- 段落结构
- 页码关联
这对于企业知识库、RAG 系统非常重要。
3. 开源生态支持
Unlimited-OCR 已支持多种运行方式:
- Hugging Face Transformers
- vLLM 推理
- SGLang 服务部署
- ModelScope 模型平台
官方 README 提供了基于 Transformers 的加载方式,例如:
from transformers import pipeline
pipe = pipeline(
"image-text-to-text",
model="baidu/Unlimited-OCR",
trust_remote_code=True
)
五、Unlimited-OCR 与传统 OCR 对比
| 项目 | 传统 OCR | Unlimited-OCR |
|---|---|---|
| 输入方式 | 单页图片 | 长文档 |
| 处理方式 | 页面拆分 | 一次解析 |
| 上下文 | 页面级 | 文档级 |
| 表格理解 | 较弱 | 更强 |
| 长文本生成 | 越长越慢 | KV Cache稳定 |
| 技术路线 | OCR Pipeline | 视觉语言模型 |
| 适合场景 | 简单文字提取 | 企业级文档理解 |
六、应用场景
1. 企业知识库建设
企业通常拥有大量:
- 合同
- 制度文件
- 产品手册
- 技术资料
Unlimited-OCR 可以帮助:
PDF → Markdown → 向量数据库 → AI问答
成为企业 RAG 系统的重要入口。
2. 学术论文解析
科研人员每天需要阅读:
- 论文 PDF
- 实验报告
- 数据表格
Unlimited-OCR 可以减少:
- 手动复制;
- 表格整理;
- 文献转换。
3. 金融与法律行业
金融、法律文件通常:
- 页数多;
- 格式复杂;
- 表格密集。
长文档 OCR 能明显提升:
- 合同审核;
- 风险分析;
- 案件资料整理。
4. 智能办公助手
未来办公 AI 可以直接:
上传:
100页项目报告.pdf
然后询问:
总结第三季度风险
AI 能基于完整文档回答,而不是只读取某一页。
七、安装与使用体验
官方提供基于 Python 的推理方式。
基本环境:
- Python
- PyTorch
- Transformers
- NVIDIA GPU 环境
示例:
git clone https://github.com/baidu/Unlimited-OCR.git
cd Unlimited-OCR
pip install -r requirements.txt
然后加载模型:
from transformers import AutoModel
model = AutoModel.from_pretrained(
"baidu/Unlimited-OCR",
trust_remote_code=True,
device_map="auto"
)
八、未来意义:OCR 正从“识字”走向“理解”
过去 OCR 的目标:
“把图片里的文字识别出来。”
未来 OCR 的目标:
“理解整个文档表达的信息。”
Unlimited-OCR 代表了一种趋势:
OCR + 大语言模型 + 文档理解
正在成为下一代智能办公、知识管理和 AI Agent 的基础能力。
传统 OCR 是“扫描仪的大脑”。
而 Unlimited-OCR 更像:
一个能够阅读、理解并整理资料的 AI 文档专家。
随着长上下文模型的发展,未来 AI 处理几十页、几百页甚至整套企业资料,将可能成为标准能力。
总结
百度 Unlimited-OCR 通过创新的 R-SWA 注意力机制,解决了长文档 OCR 中长期存在的效率瓶颈,实现了“一次性长程解析”。
它的重要价值不只是提高文字识别准确率,而是推动 OCR 从:
文字识别工具 → 文档理解智能体
这一转变。
对于 AI Agent、企业知识库、智能办公和自动化文档处理领域来说,Unlimited-OCR 可能成为未来基础设施级别的重要开源项目。