AREX Feed Article
Prior Labs 发布 TabPFN-3.5:称在 TabArena 与 BeyondArena 排名第一,API 与 MCP 两周五折
2026 年 9 月 15 日,Prior Labs 发布表格基础模型(tabular foundation model)TabPFN-3.5。公司在中称其为「当前最准确、最可扩展的表格基础模型」,在 TabArena 与 BeyondArena 两项基准上排名第一;给出的对比数字是,它在 BeyondArena 上比此前的整体第一领先约 150 Elo。
与模型同批上线的,还有面向「结果比算力更重要」场景的更新版 Thinking 模式,以及处于 alpha(早期版本)阶段的低延迟版本 TabPFN-3.5-Fast。据公司称,Fast 比基础模型快至多 6 倍。发布渠道包括 Prior Labs API、SAP AI Core、AWS SageMaker 与开源 tabpfn 包;9 月 15 日至 29 日,API 与 MCP 用户使用 3.5 系列时按标准 token 费率五折计费,标准费率在 9 月 29 日恢复。
两项基准的构成与分层结果
TabArena 与 BeyondArena 的定位不同。按技术报告页的描述,TabArena 是「持续运行的 IID(独立同分布)基准」,收录 51 个精选数据集与 27 种以上方法,其中包含 10 种以上表格基础模型;BeyondArena 收录 142 个数据集,覆盖高维、分组、时间、高基数与文本丰富的场景,也就是标准基准常常略过的部分。
在这些基准里,Elo 按模型两两之间的胜负关系拟合,默认配置的 XGBoost 被校准为 1,000 分。这个口径出自 (2026 年 6 月 29 日发布于 arXiv)。论文评测了 11 个模型与 142 个数据集,结论是当时的表格基础模型在小型到中型 IID 数据上表现最好,但在非 IID、大规模与高维数据上仍落后于传统树模型与深度学习模型。TabPFN-3.5 宣称的改进,正落在这类场景上。
Prior Labs 列出的分层结果包括:在 BeyondArena 上排名第一;在训练行数不超过 10 万的非大数据集上,文本丰富、高基数与高维场景取得最高约 250 Elo 的领先,同一子集里分组数据与最强基线持平。随发布提供的把口径写得更细:在分组、时间与大数据集切片上,经过调参与集成的 MLP(多层感知机)仍保持最高成绩,TabPFN-3.5 缩小了差距;部分较小子切片的置信区间较宽,具体排序需要谨慎解读。
在 TabArena 上,完整报告称 TabPFN-3.5 用 TabFM 十分之一的每样本总耗时,取得对其 84 Elo 的领先,并且在每个时间预算下都有 3.5 家族中的某个版本成绩最高。技术报告页还把七个基准的排名与胜率做成了一张汇总图,涉及的基准是 TabArena、BeyondArena、STRABLE、MulTaBench、RelArena-α、TALENT 与 ScoringBench,图上 3.5 家族的排名均为第一。
图:Prior Labs 技术报告页公布的七个基准排名与胜率汇总,图注标注时间为 2026 年 9 月。
从 2,000 列到 20,000 列:面向「不干净」的数据
公司称,TabPFN-3.5 把特征数上限从上一代的 2,000 列提高到 20,000 列,推荐在 6,000 列以内使用,并把这一变化称为「十倍提升」;和完整报告补充的细节是:6,000 列是「保证强性能」的推荐上限,并非计算上限,把估计器数量调高后最多可以支持 20,000 列,模型也能同时处理 100 万行数据与 6,000 列特征。
更新日志称,这是 Prior Labs 第一个多任务检查点(checkpoint),分类与回归由同一个模型完成;模型可以直接接收原始 pandas 数据框,分类字符串、原始文本与缺失值由模型自行处理,不再需要手工编码、插补、缩放或剔除离群值。完整报告列出的架构变化包括改写逐单元格编码、把模型宽度翻倍,以及改用针对高基数、宽表与分组数据调整过的合成先验。
公司称,对偏斜与零值较多的回归目标(例如理赔金额与客户支出),这一版的改进主要体现在预测分布的质量上,并在评估分布质量的 ScoringBench 上排名第一。公告帖举出的典型场景是「并不干净也不独立」的真实数据:保险理赔表里混着金额与审核结论,交易记录连着商户与客户,工业传感器产生数百个相关读数。针对文本信号,Prior Labs 还提供 Plus 变体,在基础模型之上增加文本处理,面向产品描述、客户评论或内部记录这类字段。
Thinking 用算力换准确率,Fast 用精度换延迟
更新后的 Thinking 模式服务于「结果比算力更重要」的场景。技术报告页称,对比基础版 TabPFN-3.5,它在 TabArena 上再增 44 Elo,在 BeyondArena 上再增约 20 Elo。它的机制是在拟合阶段投入更多计算,拟合好的模型可以复用做后续预测;更新日志列出的适用场景包括跨账户欺诈评分、基于客户历史的流失预测,以及跨门店与跨产品的需求预测。
TabPFN-3.5-Fast 面向延迟敏感场景;公司称这是其首次为这类需求发布 alpha 版本。公告帖与报告给出的口径是:比基础模型快至多 6 倍,比 TabPFN-3 快至多 3 倍,比 TabFM 快至多 140 倍;代价是「少量精度下降」,在 BeyondArena 上它比基础版低 40 Elo,但完整报告称它仍能追平此前的最优水平。完整报告里还有一个背景数字:由于模型宽度翻倍,基础版 3.5 在大训练集上最多比 TabPFN-3 慢 2 倍。公告帖中与速度有关的另一句是:「比紧随其后的模型快至多 20 倍」。
图:技术报告页公布的 TabArena Elo 与每 1,000 样本耗时对比,图注标注时间为 2026 年 9 月。
从 API 到开源包:上线渠道与计价规则
按 Prior Labs 公布的上线信息,3.5 系列按变体分发:API 提供 Plus、Fast 与 Thinking;Prior Labs 的 MCP 服务改用 Plus;SAP 客户可以通过 SAP AI Core 使用 Plus;AWS SageMaker 同为首发渠道,企业侧另有本地部署容器。开源方面,tabpfn 包提供基础模型与 Fast 的权重,供本地推理与研究使用,需一次性接受许可;代码采用 Apache 2.0 许可,权重适用「TABPFN-3.5 License v1.0」。技术报告页称,微软 Azure ML 的上架将在不久后跟进。
计价上,9 月 15 日至 29 日,所有 API 与 MCP 用户使用 3.5 系列时享受标准 token 费率五折,9 月 29 日恢复标准费率;公告帖把这项优惠表述为「两周内 2 倍 token 调用」。更新日志同时说明了几项计量变化:费用按所选模型与操作结算;成功复用 KV cache(把训练集上的计算缓存起来、供后续预测复用的机制)的调用,费用降低 75%;Thinking 的拟合与预测共用同一 token 预算。
配套工具也在更新:tabpfn 9.0.0 内置文本与日期时间预处理,官方在大型表格基准中测得峰值内存下降 41%;tabpfn-client 0.6.0 新增 estimate_cost(),只上传数据集维度与设置即可预估 token 成本。更新日志提醒,切换模型版本需要重新拟合,已有的模型与 KV cache 与创建时的版本绑定。
三则客户说法
技术报告页引用了三则使用者说法,三则均发布在 Prior Labs 的官方页面上:
- Scaleway 的 AI 工程师 Jean Pablo Fuquen:「零样本推理超过了我精心调参的模型,在我的回测里一直排在最前。TabPFN 证明我们可以转向只做推理的基础模型。」
- Beside 的 Corentin Garet:「水平与我花一周搭出的 ML 模型相当,而操作只是点几下。」
- Marshmallow 的数据科学负责人 Kacper Wieczorek:「在真实保险数据集上,TabPFN 不做任何调参就超过了梯度提升模型。而且它能给出预测置信区间,这对风险类应用非常有用。」
评测方与基准的来历
这批排名、Elo 与速度数字,全部出自 Prior Labs 自己发布的公告、技术报告、完整报告与更新日志。技术报告页声明,报告记录了评测协议、数据集、模型配置、运行环境与完整结果;完整报告由 Prior Labs 团队署名。这些材料的性质是厂商公告与厂商评测。
两项基准的来历:TabArena 属于开源基准生态;BeyondArena 出自 2026 年 6 月的论文,作者来自弗莱堡大学、曼海姆大学、INRIA 等机构,其中数位同时署名 Prior Labs。对准备评估 TabPFN-3.5 的团队来说,可核对的公开材料是报告写明的评测协议与数据集,以及这两项基准的开源代码;至于这批「第一」在第三方手中的复现情况,本文引用的材料中没有对应的结果。