AREX Feed Article
1.40 美元 vs 0.07 美元,同一个模型的两种价格
8 月 10 日,AI token 定价追踪平台 发布了一份 GLM-5.2 API 定价分析。Z.AI 官方 API 上,GLM-5.2 输入价格为每百万 token 1.40 美元,输出价格 4.40 美元。但在 20 家第三方托管方那里,同样的模型最低只要 0.07 美元,差了 20 倍。更惊人的是变动速度:这个最低价在约 90 天内从 1.40 美元一路跌到 0.07 美元,跌幅 95%,而 Z.AI 的官方牌价在此期间一次都没有调整过。
与此同时,GLM-5.2 成为了 Mercatus 远期市场上第一个以 token 实物交割的合约标的。在一个价格能在三个月内缩水 95% 的市场里,一份能锁定未来价格的合约直接决定了预算是可预测的还是随机游走的。
五组数字,还原 GLM-5.2 的市场全貌
GLM-5.2 于 2026 年 6 月发布,是一个广泛托管、权重开放的大模型,拥有 100 万 token 上下文窗口、工具调用和 prompt 缓存能力,在公开基准测试的通用智能维度处于第 86 百分位、编程维度第 68 百分位,属于接近前沿但非顶尖的层级。Mercatus 的报告围绕以下五组数字展开:
30 倍价差。 20 家托管方的 GLM-5.2 输入价格分布在 0.07 至 2.10 美元之间,最贵的是最便宜的 30 倍。这是 Mercatus 记录过的所有模型中价差最宽的一次。对比之下,更早发布、被更多审视的 DeepSeek V3.2,托管方价差已经压缩到约 3 倍。
95% 跌幅。 GLM-5.2 的最低可用价格在约 90 天内从 1.40 美元跌到 0.07 美元,而官方牌价纹丝不动。任何在发布时按官方价格锁定年度预算的团队,在一个季度内多付了一个数量级的费用。
一年省 6,400 美元。 一个每天处理 1000 万输入 token 和 100 万输出 token 的生产级工作负载,选官方 API 每年花 6,716 美元,选最便宜托管方只需 336 美元。加上 60% 的缓存命中率后,缓存没有缩小价差,官方与折扣层的价格比维持在约 20 倍。
100 万上下文零附加费。 大多数大上下文窗口模型在超过 128K 或 200K 后会按层级加收费用,GLM-5.2 的完整 100 万 token 窗口按标准费率计费。Mercatus 认为,对于长文档和 agent 类工作负载,这项政策的价值超过大多数托管方折扣。
第一个远期合约。 GLM-5.2 是 Mercatus 远期市场上第一个以 token 实物交割的合约标的,价格在交易时锁定,到期时买方收到真实可用的 token,而非现金差价。
托管方从 0.07 到 2.10 美元,市场远未收敛
Mercatus 汇总的 20 家托管方定价表清晰地分成四个层级。
折扣层(0.07-0.08 美元):StreamLake 和 OpenRouter(路由模式)以 0.07 美元领跑,Novita 以 0.081 美元紧随其后。这一层的输出价格约为 0.22-0.26 美元,缓存输入低至 0.013 美元。
中端层(0.75-1.26 美元):DeepInfra 从 0.75 美元起步,GMI Cloud、阿里云、SiliconFlow、AtlasCloud 等分布在 0.92-1.26 美元区间。
官方平价层(1.39-1.40 美元):包括 WandB、Parasail、Friendli、Together、Venice、Crusoe、BaseTen 在内共 8 家托管方,定价精确锚定官方 1.40 美元。Mercatus 对此的评论很直接——这些托管方按开发者的价目表定价,而非按自身成本,说明没有一家在参与价格竞争。
溢价层(2.10 美元):Cloudflare 和 Fireworks 定价最高,Mercatus 将其归因于速度和平台集成溢价。
报告提醒读者带着比平常更多的怀疑来看这张表。"30 倍的端点差距服务于同一份权重,这不可能是一个稳态市场价格;这是一个尚未收敛的市场。"折扣层可能反映的是促销定价、亏损引流式的路由策略,或者量化后的服务。从价目表上无法判断。
同样的工作负载,一年差出一个工程师的月薪
Mercatus 用一个典型场景把价格翻译成了真实成本:一个每天消耗 1000 万输入 token 和 100 万输出 token 的生产级 assistant,无缓存:
- 官方 API(1.40 / 4.40 美元):每天 18.40 美元,每月 552 美元,每年 6,716 美元。
- 最便宜托管方(0.07 / 0.22 美元):每天 0.92 美元,每月 27.60 美元,每年 336 美元。
如果加上 60% 的缓存命中率(agent 和 RAG 系统的典型值),官方 API 降到每天 11.56 美元、每年 4,219 美元;最便宜托管方降到每天 0.58 美元、每年 211 美元。
缓存没有缩小 GLM-5.2 的官方与折扣层之间的价差。在 DeepSeek V3.2 上,官方 API 的缓存折扣足够深,可以逆转托管方之间的排名;在 GLM-5.2 上,折扣层缓存价格(0.013 美元)对官方缓存(0.26 美元)的优势与输入端一致,都是约 20 倍。缓存用得越多,绝对省钱金额越大,但价格比维持在约 20 倍。
但 Mercatus 抛出了整个成本分析中最关键的问题:折扣层卖的是不是你以为的那个产品?如果是量化版、上下文截断版,或者临时促销价,你把生产环境搬过去,换来的可能是一个带着倒计时的完全不同产品,而非更便宜的 GLM-5.2。这个问题从价目表上无法回答——这正是 Mercatus Token Index 的混合基准测试和远期市场实际成交价所要解决的问题。
GLM-5.2 比 DeepSeek V3.2 便宜还是贵?取决于你问谁
Mercatus 把当前市场上托管最广的两个开放权重模型放在一起,结果同时支持两个相反的结论:
- 比官方价:DeepSeek V3.2 输入 0.28 美元、输出 0.42 美元,比 GLM-5.2 的 1.40 / 4.40 美元便宜 5 到 10 倍。
- 比最低价:GLM-5.2 的 0.07 / 0.22 美元反超 DeepSeek V3.2 的 0.20 / 0.32 美元,同时上下文窗口是后者的 6 倍(100 万 vs 16.3 万)。
- 比缓存价:DeepSeek 的官方缓存输入 0.028 美元远低于 GLM-5.2 的 0.26 美元,缓存重度使用者选 DeepSeek 更划算。
报告最后的判断是:"哪个模型更便宜"在报价单市场上没有稳定答案。上季度已经变了两次,下季度还会再变。真正决定选择的是上下文需求、缓存比例,以及工作负载对折扣层风险的容忍度。
90 天跌掉 95%,不是偶然
Mercatus 认为整个页面最重要的数字不是价差,而是速度。GLM-5.2 的最低可用价格在约 90 天内从 1.40 美元跌到 0.07 美元,跌幅 95%。官方牌价全程未动。
这就是足够多的托管方盯上同一个开放权重模型之后会发生的事。Mercatus 此前在《为什么 token 价格不同》中已经记录了同样的模式:挂牌价格会持续分化,因为没有机制把它们拉回一起。按发布价锁预算的团队一季度内多付了一个数量级;5 月选了当时最便宜托管方的客户已经被重新定价了两次;任何还在 1.40 美元这条线上的托管方,正在和比自己便宜 95% 的对手同台竞争。
价格底下是 GPU 经济学:自有高利用率机群的托管方可以追着地板跑,靠租赁 GPU 跑服务的托管方做不到。Mercatus 认为这在很大程度上解释了为什么托管方价格表会呈现出四个泾渭分明的层级。相关算账逻辑在 Mercatus 早前的《每个 token 的成本》中有完整展开。
市场第一次有了一个 token 远期价格
一个季度能跌 95% 的市场,正是远期合约存在的理由。2026 年 8 月,GLM-5.2 成为第一个在 Mercatus 远期市场上交易的模型合约:价格在交易时锁定,到期以 token 实物交割——买方收到的是真实可用、能调 API 的 token,而非现金差价。
对于买家,这意味着可以在今天就锁定下个月的 GLM-5.2 成本,不用猜哪个定价层级能活过下一轮重新定价。对于托管方,意味着可以把未来的闲置产能提前兑换成签约收入。而每一笔成交都在印出一个价格,开始搭建这个市场从未有过的东西:一条远期曲线。合约的完整机制、订单簿、结算方式和曲线的信号解读,在 Mercatus 的《token 交易所如何运作》中有详细说明。
不是 GLM-5.2 独有的困境
GLM-5.2 的 30 倍价差是 Mercatus 追踪的一系列定价分析中的最新一章,而非孤例。此前 DeepSeek V3.2 的托管方价差约 3 倍,远小于 GLM-5.2,但 Mercatus 的判断是:价差会随着模型被更多审视和套利而收敛,GLM-5.2 还太年轻。
另一个参照系是 Mercatus 此前发布的《美国 vs 中国 token 价格》报告:美国推理成本为每百万混合 token 4.56 美元,中国为 1.12 美元,一个月前差距还是 7 倍,报告发布时已缩到 4 倍。同一个模型在不同区域、不同托管方手里的定价鸿沟,正在成为 AI 基础设施层最透明也最混乱的变量。
GLM-5.2 的案例之所以值得单独成篇,是因为它同时占据了这个趋势的两个极端:价差最宽(30 倍),跌速最快(90 天 95%),并且是第一个催生了市场化定价工具(远期合约)的模型。
市场还没找到价格锚,但开始找了
从报告揭示的数据出发,可以梳理出三种走向。
第一种:价格继续崩。更多托管方入场,折扣层的 0.07 美元不是终点。GPU 效率提升和竞争加剧会继续把价格往下推。GLM-5.2 不是最后一个经历 95% 季度跌幅的模型。
第二种:价差逐步收敛。随着 Mercatus 这类基准测试工具的普及和套利行为增加,30 倍价差会像 DeepSeek V3.2 那样被压缩。但 Mercatus 提醒,在没有强制性价格发现机制的市场里,收敛没有时间表。
第三种:远期合约接管定价。如果远期市场的流动性足够,交易价格本身会变成最诚实的参考价,比任何托管方的价目表都更接近一个模型在那个时间点的真实成本。这对买方的好处显而易见;对托管方则意味着定价权从价目表转移到了交易所。
GLM-5.2 的故事最后停在了一个尚未回答的问题上:在下一个模型发布、重新洗牌之前,这个市场能不能建立起一个真正的定价机制。30 倍价差和 95% 的跌幅已经替这个问题做了足够的铺垫。