AREX Feed Article
Together AI 同预算实测:GLM-5.3 解决约 17 个 DeepSWE 任务,Fable 5 约 3 个
北京时间 8 月 24 日 10 点 19 分(UTC 02:19),推理服务商 Together AI 的官方 X 账号(@togethercompute,Business 认证)发布对比推文:给 GLM-5.3 和 Fable 5 同样的 100 美元预算,GLM-5.3 完成的工作量超过 Fable 5 的 5 倍("over 5x as much work done")。 在 DeepSWE 上,这相当于 GLM-5.3 解决约 17 个任务、Fable 5 约 3 个,而两者首次尝试的表现几乎一样("perform almost the same on the first try")。
这是 Together AI 围绕 GLM-5.3 与 Fable 5 发布的第三轮成本测算。8 月 23 日它先称 GLM-5.3 单次成功率与 Fable 5 打平、成本约为其五分之一, 随后又在"4 次尝试"口径下把成功率拉到 87.6%(约 16 美元对 21.63 美元),那条推文截至核验时已有约 10 万次浏览。 今天的推文把口径换成了"固定 100 美元预算能买多少产出"。
100 美元如何变成 17 比 3
DeepSWE 是 Datacurve 维护的软件工程代理基准,其公开榜单(v1.1,8 月 20 日更新)上,GLM-5.3 的首次尝试成功率(Pass@1)为 69%±3%、平均每任务成本 3.99 美元;Claude Fable 5 为 70%±4%、21.63 美元。 成功率几乎打平,单任务成本相差约 5.4 倍。
17 比 3 可以直接从这两组数字换算出来:100 美元按 GLM-5.3 的成本约能跑 25 次尝试,乘 69% 的成功率约等于 17 个任务;Fable 5 只能跑约 4.6 次,乘 70% 约等于 3 个。推文正文只给了结论,没有展开计算过程,但换算结果与 Together AI 前一天的数字互相印证:它称 GLM-5.3"4 次尝试"总成本约 16 美元,而 4 乘榜单上的单任务成本 3.99 美元正好约等于 16 美元。
"同预算比产出"是 Together AI 的连续动作。8 月 15 日它发布过对 DeepSeek-V4 Pro 0813 的同类分析:在 DeepSWE 上 pass@4 达 88.5%,单任务成本 0.24 美元,比 GPT-5.6 Sol 便宜 35 倍、比 Fable 便宜 90 倍。
首次尝试打平,单任务成本差 5.4 倍
DeepSWE 共 113 个任务,覆盖 91 个代码仓库、5 种语言。它的卖点是防污染:任务从零撰写而非改编自真实提交,验证器由人手写,所有模型统一跑在 mini-swe-agent 上以保持口径一致。榜单上各模型的 Pass@1 从 36% 到 74% 不等,Fable 5(70%)与 GLM-5.3(69%)几乎贴在一起:Fable 5 每任务 21.63 美元、输出 11.9 万 token、88 步;GLM-5.3 每任务 3.99 美元、输出 8 万 token、124 步。同为 69% 档的还有 Kimi K3(4.65 美元),而 Pass@1 最高的 Claude Opus 5(74%)单任务成本 11.84 美元。排位取决于口径。
模型厂商自己的数字指向同一方向。Z.ai 8 月 14 日发布 GLM-5.3 的博客中,DeepSWE v1.1 一栏 GLM-5.3 得 66.9,Fable 5(带安全回退)得 69.7。
预算口径之外还有相反证据:同一篇博客里,在 Z.ai 自研的 Z.ai Code Bench 上按同等努力水平比较,Fable 5 在 Max 档达到 39.5%,GLM-5.3 为 34.5%。"同等预算"和"同等努力"两种口径下,两个模型各占一头。
重试便宜,代理评测的排位就被改写
首次尝试几乎相同,产出却差出 5 倍,钱大多烧在重试上。Together AI 在 8 月 23 日第一条推文里点破:"重试变便宜之后,经济学就有意思了(The economics get interesting fast when retries are cheap)。"X 用户 lil y(简介自述跟踪中国开源与 AI 生态)说得更直白:代理循环会在工具重试上烧 token,按智谱的原生定价,100 美元能买到的 rollout 次数约为 Fable 5 的 5 倍,"用 pass@k 反复采样,每次都赢过略高的单次准确率"。
单次成功率接近时,可尝试次数就成了决定产出的变量:便宜的模型可以多试几次,昂贵模型试到第三次就要掂量预算。这也是 Together AI 系列评测反复强调 pass@k(多次尝试中至少一次成功)而非 pass@1 的原因。
Together AI 本身是这次测算的利益相关方:它 8 月 16 日刚宣布 DeepSeek-V4 Pro 0813 在其平台上线, 开源模型推理是它的生意;GLM-5.3 的权重按 Z.ai 计划将在发布约两周后开源,届时任何服务商都能提供同一模型。这份对比由利益相关方发布,但底层数据公开可查,结论可以对照榜单复核。
对比的两侧:开源权重与安全化的前沿
两个模型来自两条相反的路线。GLM-5.3 由 Z.ai 于 8 月 14 日发布,与 GLM-5.2 共用同一基座,全部提升来自后训练扩展;官方称它是"最强的开放权重编码模型",在自研 Code Bench 上比 GLM-5.2 提升 50%,DeepSWE v1.1 得分从 46.2 提到 66.9,权重计划在安全评估完成后开源。
Anthropic 的 Claude Fable 5 于 6 月 9 日与 Claude Mythos 5 一同发布,两者同源,Fable 5 是"为通用使用做了安全化"的版本,官方称其能力"超过我们以往发布过的任何模型":定价输入 10 美元、输出 50 美元每百万 token,上线时带安全护栏,平均不到 5% 的会话回退到次强模型 Claude Opus 4.8;6 月 12 日访问一度暂停,7 月 1 日重新部署。
声浪里最尖锐的追问
讨论里有几种声音。风险投资合伙人 Alvin Foo(X 简介:Venture Partner、前 Google 员工)看到了路由机会:"先用便宜得多、性能接近的 GLM-5.3,测试真正失败时再升级到昂贵的前沿模型。智能体编码的未来不是一个模型统治一切,而是在模型之间智能路由。" 法国用户 Damien 质疑参照系本身:"Opus 5 现在又便宜又比 Fable 5 强,为什么还要拿 Fable 5 比?" X 用户 Helmi 追问时间成本:"那花的时间长了多少?"
中文圈里,财经博主 hanqing 的概括最直接:"同样的100刀,GLM-5.3干出17个活儿,Fable 5只有3个——预算效率才是真护城河。"
最尖锐的追问来自 lil y:17 比 3 的差距在多轮仓库级编辑(multi-turn repo-level edits)的任务上是否依然成立?还是优势纯粹来自平行尝试的次数?他暗示,如果答案是后者,两个模型在单次多轮编辑能力上的差距可能远小于预算口径下的 5 倍。这个问题的答案,将决定"5 倍产出"到底是预算效率,还是"便宜到可以反复试"的采样算术。