AREX Feed Article
Epoch AI 发布「思维成本」报告:同等性能的 AI 成本自 2023 年起每季度下降约 47%,同一 FrontierMath 成绩 18 个月内账单相差 377 倍
9 月 22 日(UTC),AI 研究机构 Epoch AI 在 并同步发布,给出一份关于 AI 价格的量化测算:自 2023 年以来,在给定性能水平上,AI 的成本每季度下降约 47%,折合每年约 13 倍。报告称 AI「比历史上任何其他变革性技术都降价更快」——约为 DNA 测序的 4 倍、算力的 6 倍、锂电池的 18 倍,也是 1892~1973 年间电力降价速度的 54 倍。
报告用一组账单展示这种「思维成本」(cost of thought)的跌落:按 Epoch 的测算,OpenAI 的 o3 在 2025 年 1 月发布时,是,达成这一成绩花了 0.55 美元;今年夏天,GPT-5.6 Luna 取得同样成绩只花 0.0015 美元——18 个月里,同一份成绩的价格相差 377 倍。
对数坐标上最陡的一条线
报告把「同等性能下的成本」与四项技术放进同一张图,并给出了各自的参照速度:美国住宅电价在 1892~1973 年间按每年 1.05 倍的复合速度下降,锂离子电池在 1991~2024 年间是每年 1.16 倍,算力在 1940~2001 年间是每年 1.51 倍,DNA 测序在 2001~2025 年间是每年 1.84 倍;而 LLM(大语言模型)推理自 2023 年以来是每年 13 倍。
Epoch 还认为,有更粗糙的证据显示这一速度至少从 2021 年 11 月——OpenAI 全面开放 GPT-3 商用 API 的时候——就成立。报告给出一个跨三年的对照:GPT-3 在 MMLU 基准上得 43.9 分时,标价是每百万 token(模型计价的最小文本单位)60 美元;2023 年 7 月 18 日发布的开源模型 Llama 2-7B 得 45.3 分,标价 0.20 美元,折合每年降价 31 倍。报告的理由是:两个模型都不是推理模型,完成同样任务消耗的 token 数量应当相近,因此有理由相信,在 MMLU 上拿到 43.9 分的真实成本每年至少下降 13 倍。
另一份账单:GPQA Diamond 上不到 18 个月降了 725 倍
推文里那组 o3 与 GPT-5.6 Luna 的对照,在报告正文里补上了具体日期:o3 于 2025 年 1 月 31 日发布。报告里展开更细的是另一个基准 GPQA Diamond——一份覆盖博士级物理、化学、生物的。Epoch 估计,o3 发布时平均每题花约 0.30 美元,就能在这份测验上达到「75%」的成绩;不到 18 个月后发布的 GPT-5.6 Luna 达到同样水平,每题只要 0.0004 美元。报告称这是不到 18 个月里 725 倍的降价,「好比一辆新车的标价从 5 万美元跌到 69 美元」。脚注交代了口径:这里的 75% 指从瞎猜基线(四选一得 25%)到满分之间 75% 的位置,折合实际得分 81.25%。
借 CAISI 方法,从一次完整运行倒推各档预算下的成绩
宣布推文称,测算基于 Epoch 扩充后的数据集:222 个 AI 模型、最多 11 项基准。报告详述了其中五项主要基准——FrontierMath Tiers 1-3(v2)、OTIS Mock AIME 2024~2025、GPQA Diamond、Chess Puzzles(国际象棋谜题)、Mystery Game Puzzles(一款身份保密的游戏谜题);次要基准包括 SWE-bench Verified(代码能力)、MATH level 5、SimpleQA Verified 和三个 FrontierMath 变体。
方法上的难点是:推理模型的成绩不是一个点,而是一条随推理档位(低、中、高、最大)和预算上限变化的曲线。想知道「某个成绩最便宜要多少钱」,就得知道每个模型在不同花费下能考多少分;全部实测一遍又太贵太慢。Epoch 于是借用了美国联邦 AI 标准与创新中心(Center for AI Standards and Innovation,CAISI)开发的:用一次高预算或无预算运行的完整记录——每道题消耗多少 token、对错与否——推算模型在任意更紧的每题预算下的得分;到时还没答出的题,按瞎猜概率计分(四选一为 0.25,开放题接近 0)。
这个模拟有一个隐患:如果模型事先知道自己有多少预算,也许会表现得更好。Epoch 做了对照实验:把预算上限明确告诉模型再测,成绩确实有所改善,但仍不超过标准条件下直接调低推理档位的结果——两种做法画出的花费-成绩曲线基本重合。另一项补救针对数据本身:此前的评测偏重性能上限,缺少低推理档和小型效率模型,Epoch 直接租用硬件运行开源权重模型、按租金计价,并用五个同时开放 API 的开源模型验证,直接成本与 API 定价的差异小于 30%。
在 Epoch 之前已有多个版本的测算:测得越过高性能门槛的模型每 token 价格每年下降 10 倍,在六项基准上给出每年 9~900 倍——这两项测的都是模型的每 token 挂牌价;则直接比较成本与成绩,得到每年 5~10 倍。推理模型的出现让挂牌价口径越来越失真——OpenAI 在 2024 年 12 月发布 o1 之后,推理模型可以用更多 token,从一个更小、每 token 更便宜的底层模型里拿到好成绩。这份新报告选择刻画每个模型完整的花费-成绩曲线,拟合那条随时间移动的成本前沿——任一时点上,达到某一成绩的最便宜路径。
数学题降得比游戏谜题快,刚到 SOTA 时降得最快
报告同时把总体数字拆到了各项基准上。「无模型」估计(直接在数据网格上逐点计算下一季度的前沿成本降幅,再取几何平均)的结果是:Chess Puzzles 每季度 43.0%,Mystery Game Puzzles 44.0%,GPQA Diamond 47.0%,AIME(OTIS Mock)47.1%,FrontierMath Tiers 1-3 53.1%——五项简单平均 47.0%,与报告首选模型的估计一致。宣布推文把它归纳为:游戏类谜题每季度降 39%~43%,数学题每季度降 50%~52%。
降幅还与这档成绩在能力前沿上的位置有关。按五项主要基准平均,某一档成绩刚成为 SOTA(最先进水平)时,成本每季度下降 66%,约合每年 75 倍;两年后速度放缓一半,为每季度 32%。五项基准中有三项——AIME、FrontierMath、GPQA Diamond——呈现这种「刚到 SOTA 降得最快」的模式;Chess Puzzles 和 Mystery Game Puzzles 是例外,降幅随时间几乎不变,前后只差几个百分点。
Epoch 给出的一种解释是:某档新成绩首次出现时,厂商还能短暂收取溢价;竞争者追上来之后,这类成绩的价格骤降,随后动能衰减。报告的第二张图还显示,八个案例里「第二个达成者」只有一次是开源权重模型(QwQ-32B,AIME 的 25% 档);在报告看来,SOTA 附近最激烈的价格竞争发生在闭源模型之间。
报告自己划出的边界,与评论区的质疑
报告在「局限」一节列出的问题包括:厂商可能专门针对已知基准训练模型(benchmaxxing),为此设计的 Mystery Game Puzzles 把游戏身份保密,其每季度 44.0% 的降幅略低于五项平均,报告称这与「批评成立但不致命」的判断一致;基准成绩不等于有用的工作;报告隐含假设用户永远追逐最便宜的模型,而现实中几乎没有人这样做;三年数据太短,难以精确测量加速与减速;换一种在成绩维度上取平均的方式,结果会变成每季度 42.9%~58.0%;「思维价格」也比「电价」这类概念模糊得多,跨技术比较类似「苹果比橘子」。此外,因为前沿由极值构成、极易被单个数据点撬动,报告放弃了标准误差和显著性检验,自认这些数字是「合理但粗糙的测量」。
9 月 23 日,报告做了一次更新:补引 Demirer、Fradkin 与 Tadelis 2026 年的独立分析,并加入上述关于概念模糊性的警示。脚注注明,是 Toby Ord 的「建设性质疑」促使他们写下这条警示——:图上 AI 从 2021 年到 2026 年降价超过 10 万倍,「真有什么东西便宜过 10 万倍吗?还是某种汇总或代理统计?」
宣布推文下还有更直接的疑问。X 用户 回复称,token 价格下降不等于成本下降,AI 实验室在巨额亏损,超大规模云厂商此前一直在补贴;另有用户追问,这些数字究竟是实际成本,还是补贴后的终端价。就口径而言,报告度量的是「跑完一次评测的账单」——API 价格,或自租硬件的租金——不涉及训练投入的摊销,也不核算实验室整体的盈亏。截至 9 月 24 日,这条推文获得了约 170 万次浏览、8,200 余个赞。
留在报告范围之外的问题
报告还留下一个判断:对任何一款具体模型而言,LLM 服务的超额利润可能转瞬即逝——报告认为这既是当下竞速的结果,也是原因之一。
数据和代码已在 ,另有一个供逐项查看。至于宣布推文结尾的那道「万亿级问题」(the trillion-dollar question)——如果 AI 公司集体放缓 AI 开发,价格是否也会降得更慢——报告正文只写明,产生这一降价模式的行业动态「超出本报告的范围」。