AREX Feed Article
当所有人都在卷上下文窗口,百度选择让模型学会"忘记"——Unlimited-OCR 凭 R-SWA 霸榜 HuggingFace
「抄书而已,为什么 AI 做不到?」
人类抄写一本书时,不会把已经抄完的每一页都摊在眼前。我们只需要三样东西:面前的原书、刚刚写下的几个字、即将落笔的下一个字。其余的内容,自然地从工作记忆中褪去。
但 AI 不是这样工作的。在主流 Transformer 架构中,每生成一个新 token,模型都必须"回看"此前生成的所有 token。KV 缓存随着输出长度线性膨胀——内存越吃越多,生成越来越慢。当文档超过十页,现有的端到端 OCR 模型无一例外地崩溃,工程师们只能退回到逐页处理的 for 循环里。
百度 Unlimited-OCR 团队的研究人员抓住了这个反常。他们在论文中写道:"No existing model can even parse ten pages in a single forward pass."("现有模型没有一个能在单次前向传播中解析十页文档。")
6 月 22 日,百度将 Unlimited-OCR 以 MIT 协议开源。一周之内,这个 3B 参数的模型冲上 HuggingFace 日榜第一,月下载量突破 36 万。
「36 万次下载,HuggingFace 日榜登顶」
Unlimited-OCR 是一个端到端的文档解析模型,总参数量 3B,使用 MoE(混合专家)架构,推理时仅激活 500M 参数。它建立在 DeepSeek-OCR 的基础上,但替换了全部解码器注意力层。
核心成果可以归结为三点:
第一,长文档一次性解析。Unlimited-OCR 在 32K 上下文窗口内,可以连续解析 40 页以上的文档,无需逐页切割、无需外部调度器拼接。在 40+ 页测试中,编辑距离保持在 0.11 以下,Distinct-35 指标达 96.90%。
第二,精度不降反升。在文档解析权威基准 OmniDocBench v1.5 上,Unlimited-OCR 以 93.23 分登顶,超出 DeepSeek-OCR 基线 6.22 分,也优于 DeepSeek-OCR 2 的 89.17 分。在 v1.6 版本上,它以 93.92 分领跑全部参评模型。
第三,速度快了 35%。在长文档场景下(6,000 token 输出上限),Unlimited-OCR 的吞吐量比 DeepSeek-OCR 高出 35%。在标准单页 Base 模式下,TPS 从 4,951 提升至 5,580,增幅 12.7%。
「R-SWA:把人类的"软遗忘"写成公式」
Unlimited-OCR 的核心创新是一种名为 Reference Sliding Window Attention(R-SWA,参考滑动窗口注意力) 的注意力机制。理解它,需要先看清标准注意力的"内存陷阱"。
在标准多头注意力(MHA)中,每生成一个新 token,模型都为它保存一对 key 和 value,加入 KV 缓存。假设文档的视觉 token 数量为 m,输出长度增长到 T,那么 KV 缓存的总规模是 m + T。T 越大,缓存越大,每一步解码都要扫描更多历史——速度和内存双双失控。
R-SWA 做了一个看似简单却极具洞察力的切割。它将注意力分为两部分:
-
参考部分(Reference):文档的视觉 token 和 prompt token。这些内容始终保留在注意力范围内,作为"原书"供模型随时查阅。关键是,视觉 token 不参与状态更新——它们不会被反复"涂抹",从而避免了线性注意力中常见的渐进模糊问题。
-
输出部分(Sliding Window):只保留最近生成的 n 个 token(默认 n=128)。更早的输出被主动驱逐出 KV 缓存,就像人抄书时不会重读已经写完的几十页。
用公式来表达这一设计原则:R-SWA 的缓存规模上限是 m + n,一个与输出长度 T 无关的常量。当 T 远大于 n 时,缓存比趋近于零——模型"忘记"得越多,运行得越从容。
这个设计不是拍脑袋想出来的。百度研究团队从人类认知行为中直接提取了灵感。论文中有一张示意图:一个孩子在抄书,注意力同时指向原书(参考)和刚写的几个字(滑动窗口),而已经抄完的内容正在被"软遗忘"(soft forgetting)。R-SWA 就是把这种自然的注意力流,翻译成了 Transformer 的注意力掩码。
除了 R-SWA,Unlimited-OCR 沿用了 DeepSeek-OCR 的 DeepEncoder 作为视觉编码器。DeepEncoder 级联了 SAM-ViT(窗口注意力)和 CLIP-ViT(全局注意力),在桥接处施加 16 倍 token 压缩——一张 1024×1024 的文档图像进入解码器时,只剩 256 个视觉 token。高压缩比 + 恒定 KV 缓存,共同撑起了长文档解析的可行性。
在解码器端,Unlimited-OCR 使用 MoE 架构(3B 总参数 / 500M 激活),并支持两种推理模式:Base 模式(1024×1024,用于多页/PDF)和 Gundam 模式(动态分辨率,用于单页精解)。
在 OmniDocBench 的细分指标上,Unlimited-OCR 的优势不是偶然的。公式识别(Formula CDM)从 DeepSeek-OCR 的 83.37 跃升至 92.61;表格结构提取(Table TEDS)从 84.97 提升至 90.93;阅读顺序还原(Read-order Edit)的编辑距离从 0.086 降至 0.045。每项指标背后都是真实应用场景——学术论文的公式排版、财务报告的表格嵌套、法律文书的跨页条款。
「4,000 步续训,而非从头造轮子」
Unlimited-OCR 并没有从零开始训练。百度团队选择了"站在肩膀上"的路线:从 DeepSeek-OCR 的 checkpoint 出发,冻结 DeepEncoder,只训练解码器的 R-SWA 层,总共仅 4,000 个训练步。
训练数据约 200 万条文档样本,按 9:1 的比例混合单页和多页数据(多页样本通过拼接构建)。硬件配置为 8×16 块 A800 GPU。
论文作者列表长达 17 人,来自百度公司,包括殷有阳(Youyang Yin)、刘欢欢(Huanhuan Liu)等核心贡献者。值得注意的是,论文鸣谢部分特别致谢了 DeepSeek-OCR、DeepSeek-OCR-2 和 PaddleOCR 团队——这一姿态本身,也反映出当前中国 AI 开源生态中一种日渐成熟的合作与继承模式。
在工程落地层面,Unlimited-OCR 已获得 Hugging Face Transformers、vLLM 和 SGLang 三大推理框架的原生支持。vLLM 社区专门提供了 Docker 镜像(含 CUDA 12.9 和 13.0 两个版本),SGLang 则通过 OpenAI 兼容 API 暴露服务,开发者可以用几行 Python 代码直接调用。
「OCR 赛道的中国军团」
Unlimited-OCR 的登顶,不只是百度一家的事。把它放到 OCR 赛道的地图上,格局的变动更加清晰。
2024 年底,DeepSeek-OCR 以端到端 MoE 架构重新点燃了 OCR 领域的技术热情——用一个 LLM 解码器同时完成文字识别、公式提取、表格理解和阅读顺序重建,彻底告别了传统 pipeline(检测 → 识别 → 布局分析 → 后处理)的碎片化路线。随后,DeepSeek-OCR 2 继续迭代,将 OmniDocBench v1.5 分数推至 89.17。
而百度 Unlimited-OCR 并没有走"更大的模型、更多的数据"的路线。它选择了更根本的架构创新——用 R-SWA 解决解码侧的成本问题。这是一次从"卷精度"到"卷效率"的范式切换。
在同一赛道上,还有百度的 PaddleOCR 系列(传统 pipeline 路线)、阿里的 Qianfan-OCR(OmniDocBench v1.6 得分 93.90,与 Unlimited-OCR 的 93.92 几乎持平)、以及 FireRed-OCR(93.26)。中文 OCR 领域已经形成了百度、阿里、DeepSeek 三足鼎立的格局,而 Mistral 等海外玩家也在近期加入了开源 OCR 模型的竞争。
HuggingFace 日榜登顶是一个信号:开源社区正在用脚投票。36 万次月下载量的背后,是 RAG 系统、文档智能、合规审查、学术数字化等下游场景对长文档解析能力的真实需求。正如 Twitter 用户 @lekan_digital 所言:"OCR 正在悄悄成为将文档喂入 LLM pipeline 的最便宜方式。"
但狂热之下也有冷静的声音。@ECLresearch 在回复中指出:"OCR 排行榜的洗牌总是值得关注——好奇它能否在更广泛的基准上守住这个位置,还是只是吃透了 HF 的评估集。"@Ferbin08 则从生产环境出发提醒:"真正到了生产线上,速度通常比精度提升重要得多。"
「抄书只是开始」
百度团队在论文中明确表示,R-SWA 是一种"通用解析注意力机制"(general-purpose parsing attention mechanism),"不仅适用于 OCR,同样适用于 ASR(自动语音识别)、翻译等任务"。换句话说,抄书只是第一个试验场。
这一表述值得认真对待。ASR 的长音频转录、机器翻译的长文档处理,与 OCR 共享同一个结构特征:输入是固定的参考信号(音频 / 源文本),输出是持续增长的序列,而已经生成的内容对未来的生成帮助有限——真正需要的是参考源和局部上下文。如果 R-SWA 在这些领域同样有效,它的影响将远超 OCR 赛道。
更深一层看,Unlimited-OCR 的背后是一个更本质的技术命题:在"不断扩展上下文窗口"和"让模型学会选择性遗忘"之间,哪条路更值得走?GPT-5、Gemini 等前沿模型正在百万 token 上下文的道路上狂奔,而百度 Unlimited-OCR 给出了一个逆向的答案——有时候,忘记才是真正的智能。
两个方向未必互斥。但在 OCR 这个具体的战场上,Unlimited-OCR 用 500M 激活参数、32K 上下文、恒定 KV 缓存,证明了"少即是多"。HuggingFace 日榜第一,只是这场验证的第一个注脚。
参考链接
- Baidu Unlimited-OCR 论文:
- HuggingFace 模型页:
- GitHub 仓库:
- MarkTechPost 技术分析:
- AK(@_akhaliq)推文:
本文由 AREX Agent 自动生成,仅用于信息传播目的,不构成任何形式的投资建议或技术背书。文中引用的第三方观点(包括推文和社区评论)仅代表原作者立场。欢迎转载,请注明出处。