AREX Feed Article
Cohere Parse 5 全面可用:每千页 1.5 美元,自测 ParseBench 79.2 分
8 月 27 日,Cohere 发布文档解析视觉模型 Parse 5 并宣布全面可用(GA):经 Cohere API、Model Vault、Microsoft Foundry 与 AWS SageMaker 四条渠道提供,API 定价每 1,000 页 1.5 美元。官方与同日上线,推文发布于 UTC 13:08,称这是「市面上性价比最强的文档解析模型」,并强调把每页价格压到行业低位。
Cohere 在博客中自报 ParseBench 三维护均分 79.2,对比 Mistral OCR 4 的 74.5、LlamaParse(Cost Effective)的 78.3 与 AWS Textract 的 53.3,并称吞吐 4.5 页/秒。需要先说明口径:这些基准数字均出自 Cohere 自家评测,博客没有声称经过独立机构验证,其中还包括 Cohere 按自己更新后的规则对全部竞品重新打分。
「以前你得二选一,现在不用了」
公告发出 48 分钟后,Cohere 联合创始人 Aidan Gomez(其 X 账号简介为「cofounder @cohere」)发推解释这款产品的位置:Parsing turns out to be one of the biggest bottlenecks to LLMs being able to make effective use of enterprise data. Previously, you had to choose between high-quality understanding that is unscalable and costs $$$ or shit quality lossy-parsing that is scalable. NOT ANYMORE(解析是大模型用好企业数据的最大瓶颈之一;以前你只能在「质量高但不可扩展、还烧钱」和「可扩展但有损」之间二选一,现在不用了)。
几个小时后他又补了一条,只评论博客里那张图:「The x axis is log scale」(横轴是对数刻度)。博客对这张图的说明是:价格轴采用对数刻度,是为了容纳跨度很大的价格区间。
Cohere 负责 AI 搜索的副总裁(其 X 简介为 VP AI Search @Cohere)、SBERT 作者 Nils Reimers 在引用转发中说得更直白:解析 PDF 仍是企业 RAG 的主要瓶颈,「你要么低成本低质量,要么高质量但价格高得让人却步。我们来改变这一点:Parse v5 是我们的第一款公开模型,后面还会有很多」。
截至检索时(发布约五个半小时后),官方公告推文已获得约 530 次点赞、35 次转推、15 次引用转发和约 3.8 万次浏览,均为检索时刻的快照数据。
文档解析怎么就成了企业 AI 的瓶颈
Gomez 所说的「瓶颈」有具体所指。博客把 Parse 的用途描述为:把企业批量文档这类复杂的多模态文件(表格、嵌入图片等)转成结构化、机器可读的数据,供文档索引、RAG 与 agent 检索使用;典型场景是理赔单、合同与发票的批量处理。ParseBench 的内容保真维度衡量的正是文本遗漏、幻觉与阅读顺序错乱,解析质量直接决定下游拿到的数据。
Cohere 的解法是把解析放进一条产品线里。Parse 5 被放进 Compass 检索栈,与 Embed、Rerank 配套,覆盖文档摄取、解析、分块、嵌入、索引、混合检索到两段式检索的完整链路,支持 .xlsx、.docx、.html 等格式,内置 SharePoint 与 Google Drive 连接器和文档级访问控制;受监管行业还可以把模型部署到自有基础设施上。
这是 Cohere 近两周内第二次加码文档理解:8 月 12 日它刚开源了自称「最小的视觉语言模型」North Micro Vision(Apache 2.0 许可),主打文档理解场景;这一次 Parse 5 走托管服务渠道。两条线指向同一个市场:让企业把批量文档变成可检索、可自动化的数据。
ParseBench 三维护均分 79.2:Cohere 自测口径
博客给出的核心数字来自 ParseBench,一个衡量「适合 agent 使用的解析质量」的基准。Parse 5 在三个维度上均分 79.2:表格结构抽取 87.0、内容保真 86.6、语义格式 64.0。对比组里,专用解析模型最高的是 LlamaParse(Cost Effective)78.3,其后是 Mistral OCR 4(74.5)与 Databricks AI Parse(72.4);超大规模云厂商方案明显落后,AWS Textract 53.3、Google Document AI 57.3,差距超过 20 分。在 Cohere 的评测集里,只有 GPT-5.5(84.4)、Opus 4.8(84.3)和 Gemini 3.5 Flash(81.8)三个通用大模型分数更高。
这套数字的测量口径值得单独说明。博客脚注称,所有 ParseBench 分数采用 2026 年 8 月的最新评估规则,其中包含一项修复:此前加粗/标题检测会让 Semantic Formatting 分数虚高;为了「公平比较」,Cohere 用更新后的规则对全部竞品重新打分。也就是说,竞品分数同样是 Cohere 自己评出来的。
另一个边界是:基准只覆盖 5 个维度中的 3 个。Layout 与 Chart 维度被排除,理由是超出产品范围:Parse 输出阅读顺序的 Markdown,不为文本输出逐元素边界框(只对表格和图片输出),图表数据抽取「计划在下一个 Parser 版本中」实现。
吞吐方面,Cohere 称单张 H100 上为 4.5 页/秒,8 卡节点合计 36 页/秒(每分钟 2,160 页)。博客配图给出同配置对比:Chandra OCR 2 为 3.75 页/秒,Deepseek-OCR 2 为 3.21 页/秒,dots.mocr 为 2.05 页/秒;Cohere 称吞吐测试只比较开源模型,全部用 vLLM 服务。
每千页 1.5 美元,与「最具吸引力象限」
定价是这次发布最直接的竞争动作:Cohere API 每 1,000 页 1.5 美元。博客称这个价位面向「数十万到数百万页」的高吞吐负载,并把价格-性能画成散点图:横轴是每千页价格(对数刻度),纵轴是 ParseBench 三维护均分,左上角绿色区域标注「最具吸引力象限」。Cohere Parse 与 Cohere Parse(Model Vault)两个点,以及 GPT-5.5、Opus 4.8、Gemini 3.5 Flash 等通用大模型的点,都画在同一张图上。
同样自报的成本账还延伸到部署方式。Cohere 称在 50% GPU 利用率下,Model Vault 相比 API 的推理成本低 23%,满负荷时可节省 61%。它举了一个应付账款(accounts payable)场景:每月约 1,300 万页文档,用 Model Vault 替代 API 每月可省约 1.2 万美元(一年 14.4 万美元);相比每千页 10 美元的超大规模云厂商方案,单这一个工作流一年可省约 147 万美元。
分发上,Parse 5 同时进入 Cohere API、Model Vault、Microsoft Foundry 与 AWS SageMaker 四条渠道,模型标识为 parse-v5.0(API 示例为 POST )。博客称其支持九种主要世界语言,输出干净的 Markdown,能识别表格与嵌入图片;试用方面提供免费的 Space 体验。
只测三个维度,图表抽取要等下一版
对「只报 3 个维度」最先提出疑问的是社区。自称 AI Lead @ ABX 的 Mo 在引用转发里先问:为什么只报 ParseBench 的三个维度?他随后给出自己的判断:单遍视觉语言模型作为文档解析管线正在快速过时,因为在图表、视觉定位这类具体维度上太难调试;Parse 5 更适合充当抽取框架的「主干」,以它为主干的框架或许能在全部 5 个维度上超过许多模型,而不是只在这 3 个维度上比较。他还提醒,单次处理耗时直接关系买家决策。他最后写道,很欣慰这个赛道有了更多玩家。
博客自己也没有回避这些边界:图表数据抽取要等下一版,文本不输出逐元素边界框,Semantic Formatting 的评分规则在 8 月刚刚被修改并据此重评了全部竞品。79.2 分、4.5 页/秒和每千页 1.5 美元,目前都出自 Cohere 自家测试,ParseBench 也只覆盖 5 个维度中的 3 个。在独立评测与图表抽取能力补上之前,「最强性价比」仍然只是厂商口径,这也是拿到 1.5 美元报价的买家需要自己核对的数字。
参考链接
- Cohere 官方博客《Introducing Parse: Enterprise document intelligence at scale》(2026-08-27):
- Cohere 官方推文,Parse 5 发布公告(2026-08-27,UTC 13:08):
- Aidan Gomez 推文「瓶颈与二选一」(2026-08-27):
- Aidan Gomez 推文「横轴是对数刻度」(2026-08-27):
- Nils Reimers 引用推文(2026-08-27):
- Mo(@goesbymo)引用推文(2026-08-27):
- Cohere 官方推文,North Micro Vision 开源(2026-08-12):