百度刚开源了一个叫 Unlimited OCR 的模型,专门解决长文档解析的问题——比如你有一份40页的合同PDF,以前得一页一页识别再拼起来,现在可以一次性从头读到尾,输出完整的结构化文本。
这个模型技术上有个有意思的点:它引入了 R-SWA(参考滑动窗口注意力)机制,模仿人抄写长文时的工作方式——眼睛始终看着原文,手上只保留最近写的那几行作为工作记忆,而不是把所有写过的话都记在脑子里。这样模型的显存占用就不会随输出长度无限增长,解析速度也不会越来越慢。
实测数据:在6000个token输出时,比 DeepSeek OCR 快35%;在权威的 OmniDocBench v1.6 测试中拿到93.92%的综合分,刷新端到端OCR纪录。总参数3B,推理只激活570M,MIT协议开源。
这跟河南的企业有什么关系?
我做AI培训时接触过不少本地企业,文档处理是个真痛点——不是那种听起来很酷的痛点,是财务每月要对几百张发票、法务要看几十页合同、行政要整理各类证照扫描件那种实打实的重复劳动。
之前跟一些企业聊OCR方案,普遍的反馈是:
- 传统OCR(比如百度的PaddleOCR)识别单页没问题,但遇到多页PDF要自己写脚本逐页处理,结果拼起来容易出格式错乱
- 大模型方案(比如直接丢给GPT-4o)能理解内容,但贵,而且长文档容易读到后面忘了前面
- DeepSeek OCR出来后成本降了,但页数一多速度就明显变慢,20页以上的文档体验不好
Unlimited OCR 恰好卡在这个缝隙上:它不是通用大模型,专注做文档解析这一件事;同时解决了长文档越读越慢的问题;3B参数量部署成本也相对可控——一台带24G显存的显卡就能跑。
但模型只是第一步
我观察到一个现象:很多企业不是没有好工具,是不知道怎么把工具嵌到自己的业务流程里。
举个例子:某物流公司每天收到50+份运输合同扫描件,法务要人工提取关键条款(甲乙方信息、金额、违约条款)。Unlimited OCR能一次性解析40页合同输出Markdown,但这一步只是把纸变成字,后面还需要——
- 用规则或另一个模型提取关键信息字段
- 跟现有合同管理系统对接
- 做异常检测(比如金额跟订单不匹配)
- 设定审核流程
这才是完整的解决方案,也是我们做AI培训时反复强调的:AI落地不是装个模型就完了,是把模型嵌进业务流程的最后一公里。
部署门槛到底高不高?
Unlimited OCR 支持 Transformers、vLLM、SGLang 多种部署方式,也提供了 Docker 镜像。最低要求大约是24G显存的GPU(如RTX 3090/4090),对中小企业来说不算天文数字,但也确实不是下载就能用的水平。
如果暂时没有GPU资源,等百度把这套能力接入千帆平台后,按API调用的方式可能更适合中小企业的起步阶段。
代码和模型权重都在 GitHub(baidu/Unlimited-OCR),MIT协议,商用没问题。
相关阅读:
– 传统企业想用AI却不知道从哪开始?这套思路帮你理清
– 办公用AI的6个真实场景:从写邮件到做报表
