AREX Feed Article
Google 发布 TimesFM-3 自称 SOTA,权重却限非商用
8 月 31 日 17:52(UTC,即北京时间 9 月 1 日凌晨 1:52),发布推文,宣布时序基础模型 TimesFM-3:自称 SOTA(state-of-the-art,业界最优),单次前向即可完成多元时序预测,在主要基准上「显著超越」其他预测模型。官方同日上线,称模型已在 GitHub 与 Hugging Face 提供;截至本文写作时,该推文获得 430 次转发、4,615 次点赞与约 29.6 万次浏览。
与权重一起上架的还有许可问题。写明,TimesFM-3 以 TimesFM Non-Commercial License v1.0 发布,与 2.5 及以前版本权重采用的 Apache-2.0 不同。前 Automattic AI 负责人 James LePage(据其 X 账号简介)在中写道,他为 TimesFM-3 写了分析文章,「遗憾的是条款不允许我们托管它」。
三个基准的「第一」:目前只有 Google 自己的口径
博客称,TimesFM-3 在 Gift-Eval、FEV-Bench、Time 三个公开基准上,点预测与概率预测指标的平均排名均位居所有预训练基础模型之首,对比对象包括 Chronos-2、Toto 2.0 系列和自家上一代 TimesFM-2.5;即使关闭跨序列信息、按单变量模式评测,它也能匹配或超越其他模型。
GitHub 仓库的发布说明给出了更具体的口径:fev-bench 的 100 个任务上排名第一,TIME Benchmark 的 50 个数据集、98 个评估任务上排名第一,GIFT-Eval 上在所有基础模型中排名第一。
这些「第一」目前都出自 Google 自己的发布材料。独立分析站点 tsfm.ai 在中提醒:基准证据来自 Google 的发布材料,而不是一篇带任务级完整表格和消融实验的新论文;平均排名会掩盖效应量,一个模型可能在许多任务上以微弱优势排名第一,也可能在少数任务上大幅领先;预训练数据与评测集的重叠,也需要用公开权重和基准代码复现审计,在独立复现出现之前,这些结果不应被视为定论。
tsfm.ai 的结论是:TimesFM-3 是「有力的新默认候选」,而不是「全能冠军」。
330M 参数,一次前向算出整个预测区间
TimesFM-3 有 3.3 亿(330M)参数,预训练语料超过 1 万亿个时间点。Google Research 研究科学家 Ayush Jain 与 Rajat Sen 在博客中写道,直到 2025 年 9 月的 2.5 代,TimesFM 都严格限于单变量预测。
3.0 原生支持多元场景,可同时预测多个目标序列,并接受两类额外输入:只知历史的过去协变量,以及历史与未来都已知的「过去-未来协变量」,如促销计划、天气预报。
机制上,模型把每个序列切成 32 步的 patch(时间块),token 排成二维网格,交替使用两种注意力:因果时间注意力沿时间方向横向传播,完整变量注意力(full variate attention)在同一时刻跨序列纵向传播,用于学习序列间的相关。
解码环节变化最大:前代逐 patch 滚动生成预测,延迟高且误差会累积;3.0 采用连续 patch 掩码(Contiguous Patch Masking),对未来区间贴上掩码占位 token,一次前向就把整个预测区间填满,同时输出 9 个分位数(第 10 至第 90 百分位)。
模型卡显示其配置为 20 层 transformer(维度 1280、16 注意力头),上下文与预测区间的 patch 长度分别为 32 和 64。
博客用一个冰淇淋销售例子说明多元预测的差别:把促销计划作为协变量传入后,蓝色多元预测线在每个促销日捕捉到约 20% 的销量抬升,红色单变量预测线对此毫无反应。
代码 Apache-2.0,3.0 权重却改挂非商用许可
TimesFM-3 的权重许可,与这个系列此前的发布方式明显不同。的许可声明写道:源码按 Apache-2.0 发布,2.5 及以前版本的权重也保持 Apache-2.0;但 3.0 的预训练权重暂时按独立的 timesfm-non-commercial-license-v1.0 分发,限于非商用、非生产使用,「商用或生产使用默认预训练权重不被允许」。
对社区的直接后果是,这套权重既无法被社区站点托管,也不能直接进入商用生产。tsfm.ai 称,公开权重只适合研究、评测和许可允许范围内的内部对比,不能直接作为商用预测服务、需求计划或面向客户应用的模型;需要原生多元模型上生产的团队,应把 Chronos-2、TiRex-2、Moirai 等替代方案留在备选里。
商用路径尚未落地。博客结尾称 TimesFM-3 现已在 GitHub 和 Hugging Face 提供,BigQuery 集成将在「未来几周」上线;在那之前,BigQuery 的 AI.FORECAST 命令可用的仍是 TimesFM-2.5。tsfm.ai 认为,BigQuery 集成可能提供受支持的商用通道,但其可用性、条款、功能与定价要等真正落地后再评估。
发布当晚:有人准备实测,有人被许可挡在门外
推文发出后数小时内,社区反应分化。自称过去一年一直在用 TimesFM 2.5 的用户 bob yau 在中说:「我会试试,期待测试这个。」
AI 资讯账号 Marktechpost(简介自称「X 上最快的 AI 开发新闻引擎」,粉丝超过 1.1 万)当晚,标题为「Google AI 发布 TimesFM-3:用于多元时间序列预测的 3.3 亿参数零样本基础模型」。
谨慎与质疑同样存在。账号 VibeBuildNotes 写道:「预测可能是 AI 最被低估的用例之一。如果它在基准之外也站得住,那就是件大事。」面向 AI 开发流水线的 BridgeApp 则看重单次前向:agent(智能体)可以组合部署频率、事故量、云开支与团队容量等信号,「在风险变成阻碍之前就把它暴露出来」。
也有用户对配图本身提出疑问,账号 Shelterium 回复:「等等,为什么你们的主图是 AI 生成的?说真的?」
从单变量到多变量,TimesFM 走了两年
TimesFM 系列始于 2024 年,论文《A decoder-only foundation model for time-series forecasting》()获 ICML 2024 接收。2025 年 9 月 15 日发布的 2.5 代把参数量降到 2 亿(200M)、上下文扩展到 16k,但仍是单变量模型,协变量支持要靠 2025 年 10 月补上的 XReg 模块。
产品化同步推进:BigQuery ML 提供 AI.FORECAST 命令,2026 年 2 月集成进 Google Sheets,另有 Vertex Model Garden 入口。
tsfm.ai 认为,TimesFM-3 补上了这个系列最大的能力缺口,但进入的是一个明显更强的 2026 年赛场,其中已有 Chronos-2、Toto 2.0、TiRex-2 等原生多元、支持协变量的系统。悬而未决的是两件事:一篇带任务级结果的完整论文与独立复现,以及 BigQuery 集成上线后的条款与定价。在那之前,公开权重只允许研究用途,「SOTA」仍是 Google 自己的说法。