AREX Feed Article
Tinker 上线 GLM-5.3:256k 上下文,自称最强开源编码模型
2026 年 8 月 28 日 20:52(UTC),Tinker 官方账号(@tinkerapi)在 X 上宣布 GLM-5.3 上线平台,提供 256k 上下文。这条称,GLM-5.3 来自 Z.ai,与 GLM-5.2 共用同一基座、后训练规模更大,"目前是 Terminal-Bench 3.0、DeepSWE 1.1 等编码评测上最强的开源权重模型"。
上线时间与 GLM-5.3 权重开放同一天。Tinker 是 Thinking Machines Lab 旗下的后训练 API,自称"training API for researchers":模型在平台上作为 LoRA 微调的基座使用,不走推理 API。Tinker 的已经挂出 GLM-5.3(256K)的条目和训练价格。
图:Z.ai 官方发布的基准对比图,GLM-5.3 以蓝色强调(来源:zai-org/GLM-5 仓库,经 Hugging Face 模型卡链接)
文档里的 GLM-5.3(256K):训练价每百万 token 14.58 美元
在 中,GLM-5.3(256K)一行的 Tinker ID 是 zai-org/GLM-5.3:peft:262144,类型为 Large、MoE、Reasoning。价格按每百万 token 计:prefill 4.86 美元,命中缓存的 prefill 0.972 美元(缓存 prefill 享 80% 折扣),采样输出 12.15 美元,训练 14.58 美元。文档对"训练"的定义是前向加反向的梯度计算,这正是 Tinker 区别于推理 API 的部分。
Tinker 的微调方式是 LoRA:只训练一个小适配器,不更新全部权重。API 只有四个原语——forward_backward、optim_step、sample、save_state——研究者自己写训练循环,平台负责 GPU 调度。Thinking Machines Lab 在 ,当时是面向研究者的私有测试版,早期使用者包括 Princeton、Stanford、Berkeley 和 Redwood Research 的团队。
权重开放当天,Tinker 与 Cloudflare 同日接入
GLM-5.3 本身于 8 月 14 日由 Z.ai 发布,先通过 Z.ai 自家的 API 与 Coding Plan 提供。当时说明,权重会在发布两周后开放,"待安全评估与加固完成"。8 月 27 日 03:19(UTC),Z.ai 官方账号(@Zai_org)预告"",这条推文获得 4780 次点赞。
8 月 28 日,权重如期登上 (753B 参数,BF16)。同一天,宣布 GLM-5.3 上线 Workers AI,输入每百万 token 1.40 美元、输出 4.40 美元;当晚 20:52,Tinker 官宣接入。权重开放当天完成接入,即所谓 day-0 上线。
"最强开源权重":一句供应商声明
Tinker 推文把"最强"具体落在 Terminal-Bench 3.0 和 DeepSWE 1.1 上,但没有给出任何分数。目前可核对的分数全部出自 Z.ai 自己的博客与模型卡:GLM-5.3 是"最强大的开源权重编码模型",在自家 Z.ai Code Bench 上比 GLM-5.2 提升 50%;公开评测中 Terminal Bench 3.0 得分 28.3(GLM-5.2 为 4.6),DeepSWE v1.1 得分 66.9(GLM-5.2 为 46.2),并称在 Terminal Bench 3.0 和 Agents' Last Exam 上拿到开源 SOTA。Cloudflare 的 changelog 转引的也是同一组数字。
即便在这张 Z.ai 自己公布的对比表里,"最强"也不是每项都成立:DeepSWE v1.1 一栏,Kimi K3 的 67.5 高于 GLM-5.3 的 66.9;Terminal Bench 3.0 一栏,GLM-5.3 的 28.3 在表中只低于 Fable 5 的 33.7 和 GPT-5.6 Sol 的 34.6。Z.ai 在模型卡脚注中写明了评测设置(Claude Code 2.1.207 评测环境、400K 上下文等),但截至本文核对的材料,这组结果仍只有供应商口径。
一个全靠 post-training 的模型,进了一家 post-training API
"与 GLM-5.2 同基座、增益全部来自后训练"是 Z.ai 反复强调的卖点:通过 IndexShare 处理长上下文、SAO 做长程任务强化学习、slime 做大规模异步训练,并把训练环境扩展到接近真实工程工作。Tinker 推文复述的正是这句话。模型的能力几乎全由后训练堆出,而 Tinker 提供的正是后训练基础设施。
平台上此前已经跑出过这类产品:Glean 的搜索模型 Waldo 在 Tinker 上用 Nemotron 3 Nano 做了 DPO 加 RL 两步训练,Chroma 的检索子代理 Context-1 基于 gpt-oss-20B 训练。GLM-5.3 进入列表后,Tinker 可微调的模型池里多了一个 Reasoning 类型的大号 MoE:文档标注它始终输出思维链,支持 low、high、max 三档思考预算。
回复区:256k 是重点,有人已经想跑 RL
这条官宣本身声量不大:截至 8 月 29 日凌晨,约 69 次点赞、8 条回复。回复区里被反复提起的是 256k 上下文。一位署名 Ben 的用户(@benatcortexai)写道:"256k on tinker is the part that matters."——Tinker 上的 256k 才是重点;他称自己已经取消 Anthropic 订阅,因为 GLM-5.3 能"撑住长程 agent 任务不散架","在这个基座上做微调会很快变得有意思"。
简介自称 Chief Data Scientist @PNNLab 的 Neeraj Kumar(@Neeraj_Kumar222)说得更直接:"开源权重加一个后训练 API,就是没有集群的实验室跟上节奏的方式。"(Open weights plus a post-train API is how labs keep up without a cluster.)另有两位用户的回复指向下一步:简介为 research @exaforgelabs 的 Dev(@devparagiri)说"等不及要在上面跑 RL 了";@davidtorcivia 则希望 GLM-5.3 Flash 也上平台。
可以核实的新事实是 GLM-5.3 确实以 256k 上下文进了 Tinker 的文档与价格表;"最强开源权重"的表述,目前仍只有 Tinker 与 Z.ai 两家的供应商口径。