百度开源 Unlimited-OCR:开启“一次性长文档解析”新时代

55次阅读
没有评论

百度近日开源了全新的 OCR 大模型项目 Unlimited-OCR。该项目定位为“One-shot Long-horizon Parsing(一次性长程解析)”,目标是突破传统 OCR 在长文档处理中的性能瓶颈,让模型能够像人类阅读一样连续理解几十页甚至更长的文档内容。项目代码、模型权重以及技术报告均已公开。

项目地址:GitHub – baidu/Unlimited-OCR


一、传统 OCR 的局限:长文档处理一直是难题

OCR(Optical Character Recognition,光学字符识别)技术已经广泛应用于:

  • PDF 文档数字化
  • 企业档案管理
  • 发票与合同识别
  • 论文解析
  • 表格提取
  • 智能知识库建设

但传统 OCR 系统通常采用“页面级处理”方式:

  1. 将 PDF 拆分成单页图片;
  2. 对每页进行文字检测;
  3. 识别文字内容;
  4. 再人工或程序拼接结果。

这种方式面对几十页、几百页文档时,会出现明显问题:

  • 页面之间上下文丢失;
  • 表格结构容易破坏;
  • 长文本生成速度下降;
  • 显存占用随着输出长度增加。

尤其是在基于大语言模型(LLM)的 OCR 系统中,随着生成文本越来越长,KV Cache(键值缓存)会不断增长,导致推理速度下降和显存压力增加。Unlimited-OCR 正是针对这一问题提出新的解决方案。


二、Unlimited-OCR 是什么?

Unlimited-OCR 是一个基于视觉语言模型(Vision-Language Model)的端到端 OCR 系统。

它并不是简单地“识别图片里的文字”,而是希望实现:

输入整份文档 → 模型一次理解 → 输出完整结构化内容

相比传统 OCR,它更接近“阅读理解”。

它支持:

  • 图片 OCR
  • 多页文档解析
  • PDF 文档处理
  • 表格理解
  • 文档布局分析
  • 长文本连续生成

官方将其定义为:

Welcome the Era of One-shot Long-horizon Parsing.

即“一次性长程解析时代”的到来。


三、核心技术:Reference Sliding Window Attention(R-SWA)

Unlimited-OCR 最大的技术创新是提出了一种新的注意力机制:

Reference Sliding Window Attention(R-SWA)

传统 Transformer 在生成长文本时:

输入内容
 ↓
生成第1个Token
 ↓
生成第2个Token
 ↓
……
 ↓
生成第N个Token

每生成一个新的 Token,都需要关注之前所有 Token。

随着文本增长:

  • KV Cache 越来越大;
  • 推理速度越来越慢;
  • 显存消耗持续增加。

Unlimited-OCR 的 R-SWA 进行了优化:

  • 保留视觉输入作为长期参考;
  • 对已经生成的文本采用滑动窗口关注;
  • 控制 KV Cache 长度保持稳定。

简单理解:

传统模型:

“每写一句话,都重新回忆整篇文章。”

Unlimited-OCR:

“保留关键视觉记忆,只关注当前上下文。”

这种设计让模型能够处理更长文档,而不会随着输出长度显著降低效率。


四、模型规模与性能特点

Unlimited-OCR 模型参数规模约为 30 亿参数(3B),采用视觉语言模型架构。模型文件以开源形式发布,并采用 MIT License,方便研究和商业应用。

其主要特点包括:

1. 超长文档一次解析

Unlimited-OCR 的核心能力:

  • 一次 Forward Pass 处理几十页文档;
  • 避免传统 OCR 分页处理流程;
  • 保持长文档上下文一致。

技术报告指出,该方法能够在标准长度限制下解析几十页文档,同时保持稳定的 KV Cache。(arXiv)


2. 更强的文档结构理解能力

普通 OCR:

图片
 ↓
文字

Unlimited-OCR:

图片
 ↓
文字 + 布局 + 表格 + 语义关系
 ↓
结构化输出

例如:

输入:

年度财务报告 PDF

输出可以理解:

  • 标题层级
  • 表格关系
  • 段落结构
  • 页码关联

这对于企业知识库、RAG 系统非常重要。


3. 开源生态支持

Unlimited-OCR 已支持多种运行方式:

  • Hugging Face Transformers
  • vLLM 推理
  • SGLang 服务部署
  • ModelScope 模型平台

官方 README 提供了基于 Transformers 的加载方式,例如:

from transformers import pipeline

pipe = pipeline(
    "image-text-to-text",
    model="baidu/Unlimited-OCR",
    trust_remote_code=True
)

(Hugging Face)


五、Unlimited-OCR 与传统 OCR 对比

项目 传统 OCR Unlimited-OCR
输入方式 单页图片 长文档
处理方式 页面拆分 一次解析
上下文 页面级 文档级
表格理解 较弱 更强
长文本生成 越长越慢 KV Cache稳定
技术路线 OCR Pipeline 视觉语言模型
适合场景 简单文字提取 企业级文档理解

六、应用场景

1. 企业知识库建设

企业通常拥有大量:

  • 合同
  • 制度文件
  • 产品手册
  • 技术资料

Unlimited-OCR 可以帮助:

PDF → Markdown → 向量数据库 → AI问答

成为企业 RAG 系统的重要入口。


2. 学术论文解析

科研人员每天需要阅读:

  • 论文 PDF
  • 实验报告
  • 数据表格

Unlimited-OCR 可以减少:

  • 手动复制;
  • 表格整理;
  • 文献转换。

3. 金融与法律行业

金融、法律文件通常:

  • 页数多;
  • 格式复杂;
  • 表格密集。

长文档 OCR 能明显提升:

  • 合同审核;
  • 风险分析;
  • 案件资料整理。

4. 智能办公助手

未来办公 AI 可以直接:

上传:

100页项目报告.pdf

然后询问:

总结第三季度风险

AI 能基于完整文档回答,而不是只读取某一页。


七、安装与使用体验

官方提供基于 Python 的推理方式。

基本环境:

  • Python
  • PyTorch
  • Transformers
  • NVIDIA GPU 环境

示例:

git clone https://github.com/baidu/Unlimited-OCR.git

cd Unlimited-OCR

pip install -r requirements.txt

然后加载模型:

from transformers import AutoModel

model = AutoModel.from_pretrained(
    "baidu/Unlimited-OCR",
    trust_remote_code=True,
    device_map="auto"
)

八、未来意义:OCR 正从“识字”走向“理解”

过去 OCR 的目标:

“把图片里的文字识别出来。”

未来 OCR 的目标:

“理解整个文档表达的信息。”

Unlimited-OCR 代表了一种趋势:

OCR + 大语言模型 + 文档理解

正在成为下一代智能办公、知识管理和 AI Agent 的基础能力。

传统 OCR 是“扫描仪的大脑”。

而 Unlimited-OCR 更像:

一个能够阅读、理解并整理资料的 AI 文档专家。

随着长上下文模型的发展,未来 AI 处理几十页、几百页甚至整套企业资料,将可能成为标准能力。


总结

百度 Unlimited-OCR 通过创新的 R-SWA 注意力机制,解决了长文档 OCR 中长期存在的效率瓶颈,实现了“一次性长程解析”。

它的重要价值不只是提高文字识别准确率,而是推动 OCR 从:

文字识别工具 → 文档理解智能体

这一转变。

对于 AI Agent、企业知识库、智能办公和自动化文档处理领域来说,Unlimited-OCR 可能成为未来基础设施级别的重要开源项目。

正文完
 0
评论(没有评论)