AREX Feed Article
LlamaIndex 开源文档抽取基准 ExtractBench,自家 Agentic Plus 95.6% 居首
8 月 11 日,LlamaIndex 在官方 X 账号宣布推出开源文档抽取评测基准 ExtractBench,官方博客同步上线完整介绍,同时发布了 LlamaExtract 的新档位 Agentic Plus。 按官方公布的评测结果,Agentic Plus 在 14 个系统中以 95.6% 的 value F1 登顶,每页成本 8.1 美分;编码 Agent 里成绩最好的 Codex (GPT-5.5) 拿到 93.6%,但每页要 27.8 美分。
ExtractBench 的语料是 370 份真实企业文档、共 4,869 页,覆盖 8 大业务领域、67 种文档类型,每种类型配有独立 schema。数据集、评测代码与方法论全部公开,官方称评测零 LLM 裁判、完全确定性、可复现。
370 份企业文档、4,869 页:语料和答案是怎么来的
官方博客给出的建基准理由是:企业 Agent 越来越多地直接基于关键业务数据行动,而这些数据大量藏在非结构化文档里;人不再盯在流水线上复核,抽取质量的门槛就得比有人兜底时更高,开发者需要一把按生产方式衡量的尺子。 博客还列了四个企业客户部署时最常问的问题:100 页的申报文件质量能不能保持住、1950 年代打字机扫描件能不能读、返回的值能不能说出出处、每月抽一百万页要花多少钱。
语料是真实企业文书:SEC 申报与基金持仓表、政府采购和海关表格、医疗理赔对账单、汽车估值、破产申报、能源行业监管表格。按官方语料统计图,金融类 145 份、能源 98 份、政府 49 份、汽车 27 份、供应链 20 份、医疗 15 份、法律 10 份、房地产 6 份;单份最长 192 页,单页最多 1,359 个字段。
每份文档沿五条独立轴标注:任务难度(长列表完整性、大海捞针、高密度文档)、感知挑战(旋转页、扫描件、手写)、表格结构、文档长度、业务领域,每个分数按轴单独报告,低分能追到具体原因。
答案(ground truth)用三条流水线构建:真实文档由多个模型家族的抽取器跑同一 schema,共识值成为候选真值,分歧处由人看原文裁决;合成长列表采用 data-first 方式,渲染 PDF 之前每个值和框都已确定,可以在几千行规模上精确计算完整性;169 份监管与税务表格由审核员逐字段手工核对,84% 的字段由人工放置边界框。官方特别声明:任何抽取器的输出都不单独作数,包括自家的。
14 个系统同场,长文档才是真正的分水岭
被评测的 14 个系统分三类:通过 structured-output API 调用的前沿 VLM,外加 4 个自托管开源权重模型;在隔离沙箱里只带本地工具的编码 Agent;专用抽取 API,其中 LlamaExtract 三档(Cost-Effective、Agentic、Agentic Plus)全部参评。
| 系统 | 类别 | value F1 | 每页成本 |
|---|---|---|---|
| LlamaExtract Agentic Plus | 专用抽取 API | 95.6% | 8.1¢ |
| Codex (GPT-5.5) | 编码 Agent | 93.6% | 27.8¢ |
| Reducto Deep Extract | 专用抽取 API | 90.4% | 34.4¢ |
| LlamaExtract Agentic | 专用抽取 API | 89.5% | 3.1¢ |
| Qwen3.6 35B | 开源权重 VLM | 87.3% | — |
| Claude Code (Opus 4.8) | 编码 Agent | 87.1% | 16.2¢ |
| LlamaExtract Cost-Effective | 专用抽取 API | 86.8% | 1.0¢ |
| Extend (Max Context) | 专用抽取 API | 86.3% | 10.0¢ |
| Gemini 3.5 Flash | 前沿 VLM | 79.8% | 1.0¢ |
| Lift (9B OSS) | 开源权重 VLM | 77.3% | — |
| GPT-5.4 Nano | 前沿 VLM | 74.9% | 0.21¢ |
| Gemma4 26B | 开源权重 VLM | 66.2% | — |
| Datalab (Accurate + Balanced) | 专用抽取 API | 64.5% | 3.5¢ |
| NuExtract3 | 开源权重 VLM | 47.9% | — |
表格数据来自官方博客公布的整体榜单(370 份文档的平均 value accuracy)。
榜单上有三条规律。第一,短文档让所有人都好看:10 页以内的子集(72 份文档、22 种类型)里,14 个系统有 8 个超过 90%,榜首 Agentic Plus 96.6%,官方说这个长度上榜单几乎被拉平,系统之间真正的区别只剩价格。第二,长度才是分水岭:超过 50 页的文档上,所有商用 VLM 的 recall 都掉到 35% 以下,precision 却依然很高。回来的值是对的,大部分文档根本没回来。Agentic Plus 是唯一几乎不掉的系统,在最长的文档上保持 94.4%。官方用三个案例说明这类长列表任务:一张 26,725 行的无人认领财产清单、一张 8,624 条记录的债权人矩阵、一份 3,063 条持仓的 13F。
第三,编码 Agent 各有各的感知盲区,而且方向相反:Codex (GPT-5.5) 读扫描件和手写都在 93% 以上,旋转页掉到 81.0%;Claude Code (Opus 4.8) 处理旋转页有 91.2%,扫描件和手写只有 74.2% 和 74.7%。官方披露的测试材料包括 1950 年代的监管申报件、手填税表,以及经传真阈值化、复印机色调曲线、传感器噪声、手机拍摄等途径劣化过的页面。Agentic Plus 是唯一三项都保持在 93% 以上的系统:95.9% / 93.9% / 93.8%。
Agentic Plus:95.6% 的 value F1,每页 8.1 美分
Agentic Plus 是 LlamaExtract 新的最高精度档,官方定位是「为最广泛的文档抽取挑战而生」。它加入后,LlamaExtract 三档的价差拉开:Cost-Effective 每页 1.0 美分(86.8%)、Agentic 每页 3.1 美分(89.5%)、Agentic Plus 每页 8.1 美分(95.6%)。
官方在 X 上补充了机制:Agentic Plus 对长文档做迭代式处理,而不是单遍读完,在长列表任务上拿到 96.1% 的 F1,也是唯一一个文档越长成绩保持平稳的系统。
成本是这份榜单刻意量化的维度。博客算了一笔账:企业通常以每月百万页的规模跑抽取,每 1 美分/页就是每月 1 万美元。 由此得出的两条规律是:价格不预测精度,最贵的系统(Reducto,34.4 美分/页)不是最准的,准确率第一的 Agentic Plus 收费不到最贵系统的四分之一;而 LlamaExtract 是单位美元精度最高的,精度最接近的同行 Codex 每页 27.8 美分,是 Agentic Plus 的三倍多;另一头,Cost-Effective 与 Claude Code 只差不到 1 个百分点,价格是后者的 1/16。
Grounding:还没有系统答完的题
基准里最没被解决的指标是 grounding,即把每个抽取出来的值连到它确切的证据上。官方评分规则很严:值和引用都必须正确才算对,词级框要求 IoU 0.5,一个框得再准、值错了也一分没有。
结果分成了两类。VLM 和编码 Agent 默认不返回任何证据,两级得分都是 0;在会返回边界框的系统中,Agentic Plus 两级都领先:页级 84.9%、词级 46.4%。 官方还给出两个更说明问题的数字:返回证据的系统里,最佳词级 F1 仍低于 50%;grounding 还随文档变长崩塌,某专用 API 从短文档的 61.7% 页级得分掉到长文档的 0.0%。
官方给出的判断是:grounding 是全场最清晰的改进空间,而 ExtractBench 的定位之一,就是给这个指标提供一个可以追踪的基线。
为什么 LlamaIndex 要自己造一把尺子
造基准的直接理由是现成的尺子不可信。博客把现有基准分成两代:老一代(SROIE、DocILE、RealKIE)只给固定字段集打分,说明不了系统面对没见过的新 schema 会怎样;新一代 schema-guided 基准能在推理时接受新 schema,但各自只覆盖工作负载的一角。它们没有一个给视觉 grounding 打分,没有一个包含扫描件或手写页,也没有一个报告每页成本。
于是 LlamaIndex 自称 ExtractBench 是「同类中最全面」的基准,也是唯一同时评测长记录完整性、真实扫描与手写、词级与页级 grounding、以及实测成本的基准。 这里有一个绕不开的身份问题:发布基准的公司,自己的产品也参评并拿了第一。官方对此的回应写在 ground truth 章节里:三条流水线,加上那句「任何抽取器的输出都不单独作数,包括我们的」;评测过程则被强调为零 LLM 裁判、完全确定性,schema 冻结,任何人可以 clone 仓库跑自己的系统。
这次的开放面在于可复现:数据集挂在 ,代码与评测管线在 ,方法论文《ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction》已上传 。8 月 26 日,LlamaIndex 还将举办一场线上 webinar 详解基准。
做抽取的人怎么接招
发布当天,LlamaIndex 联合创始人兼 CEO Jerry Liu 在 X 上把核心发现讲了一遍:「短文档掩盖了系统的致命缺陷。超过 50 页的文件上,商用 VLM 因静默截断跌到 35% recall 以下。它们 precision 很高,但注意力丢失,丢掉大部分表格行。」他同时给新档位定了性:Agentic Plus 以 95.6% 的 value accuracy 登上榜首,成本不到最接近同行的三分之一。
做合同 AI 的 Genie AI 公司 CEO Rafie Faruq 在回复里印证了自己的生产经验:「静默截断和我们处理长合同时看到的一模一样。模型看起来很自信,悄悄丢掉一半的明细行,直到某一条款出事才有人发现。对法律工作来说,50 页之后的 recall 才是真正重要的指标。」 芝加哥的连续创业者 Nabbil Khan 举了医疗理赔的例子:「我的拒赔申诉 Agent 读支付方来信,理由代码横跨两页的表格。它满置信度地返回第一页的代码。空字段是便宜的,自信的错误答案要花一整轮返工。」
也有直接上手的。X 用户 Atakan 在回复里说「这是我真的想跑一次的基准」,打算把 harness 用在自己手头那些杂乱的长文档上,同时提出一个他期待接下来看到的方向:「希望下一步看到 retrieval-first 赛道,抽取器拿不到完整文档。实践中,即使输出全部 grounded,上游一步丢掉的上下文照样会漏关键信息。」
把基准和产品放在一起看,LlamaIndex 想立的标准其实很具体:当人不再复核,「自信的错误」比「大声的失败」更危险。榜单上唯一还没人答完的题是 grounding:返回证据的系统里最好的词级 F1 也只有 46.4%。「每个抽取出来的值都应该带出处」,这是官方留给行业的基线。