AREX Feed Article
GLM-5.3-Flash 上线 Together AI:DeepSWE 几乎追平 Luna,预算产出翻倍
8 月 27 日 16:38(UTC,北京时间 8 月 28 日 0:38),宣布 GLM-5.3-Flash 上线其推理平台:320B 总参数、18B 激活参数、100 万 token 上下文、混合注意力架构,是 Z.ai 的 GLM-5 系列首个原生多模态模型。公告同时给出了一条可以对照核实的声明:在 DeepSWE 基准上,该模型"几乎追平 Luna 的表现,同等预算下完成的工作量超过两倍"。
这句话是平台方发布的评测声明,只能证明平台作出了这一说法,不能证明其为真。但可以拿 DeepSWE 官方榜单逐项核对:8 月 26 日更新的上,glm-5.3-flash 为 63%±4、平均任务成本 0.24 美元;被拿来对比的 OpenAI GPT-5.6 Luna(榜单名 gpt-5.6-luna,)为 67%±4、0.61 美元。此时距离 Z.ai 官宣发布这款模型,刚过去约 26 小时。
26 小时:从 Z.ai 官宣到 Together AI 上架
GLM-5.3-Flash 由 Z.ai 于 8 月 26 日 14:12(UTC)在上发布:320B-A18B 参数、原生多模态、100 万 token 上下文,MIT 许可,权重公开,此前以 ox-alpha 的匿名身份预览。Z.ai 同日发布说明架构与成本设计。截至本文核验时,这条官宣推文获得 2.3 万赞、约 554 万次浏览。
约 9 分钟后,发推祝贺,称 GLM-5.3-Flash 是"第一个同时要求两种注意力(线性加稀疏)的模型",vLLM 提供首日支持,已在 NVIDIA 与 AMD GPU 上验证。
次日 16:38(UTC),Together AI 宣布上线,39 秒后给出。模型页显示接口名为 zai-org/GLM-5.3-Flash,同时提供 serverless 与专用部署,标注 99.9% SLA。另一家推理平台 Baseten 的也已收录该模型,价格与 Together AI 完全一致。
上线即报价:$0.15/$0.50,约为同平台 GLM-5.2 的九分之一
Together AI 给 GLM-5.3-Flash 的标价是输入 0.15 美元/百万 token(缓存命中 0.03 美元)、输出 0.50 美元/百万 token。同一页面的相关模型列表里,ChatGLM-5.2 标价 1.40/4.40 美元——输入与输出价格都约为其九分之一。Z.ai 博客的说法是"以十分之一的价格,在基准与真实负载上全面超过 GLM-5.2"。
模型页给出的能力数据(Z.ai 口径)包括:DeepSWE v1.1 63.4(GLM-5.2 为 46.2)、Terminal Bench 2.1 84.3(81.0)、AutomationBench 48.8(26.2)、Toolathlon Verified 78.4(59.9),Artificial Analysis Intelligence Index v4.1.1 得分 57。接口支持按请求设置 reasoning effort(low/high/max),输入支持文本与图像。
"几乎追平 Luna":把声明与 DeepSWE 榜单对一对
DeepSWE 是 Datacurve 推出的长期软件工程基准:113 道从零编写的任务,覆盖 91 个仓库、5 种语言;任务不改编自既有 commit 或 PR(防污染),验证器逐题手写;所有模型统一用 mini-swe-agent 框架运行。8 月 26 日更新的榜单上:
| 模型 | Pass@1 | 平均任务成本 | 输出 token | 步数 |
|---|---|---|---|---|
| gpt-5.6-luna | 67%±4 | $0.61 | 73k | 102 |
| glm-5.3-flash | 63%±4 | $0.24 | 73k | 123 |
| glm-5.3(同系列大杯) | 69%±3 | $3.99 | 80k | 124 |
按平均任务成本算,0.61÷0.24≈2.5,"同等预算完成两倍以上工作"在算术上成立。63% 对 67% 差 4 个百分点,双方置信区间重叠——"几乎追平"是平台方表述,与榜单数据相容,但没有被单独坐实。榜单当前展示的 19 个模型中,glm-5.3-flash 的平均任务成本最低,第二低是 deepseek-v4-flash 的 0.46 美元。聚合站 llm-stats 将 gpt-5.6-luna 标注为 OpenAI 的 GPT-5.6 Luna(0.670,API 价 0.20/1.20 美元)、将 GLM-5.3-Flash 标注为 Zhipu AI 的模型(0.634,0.15/0.50 美元),并提示其收录的 27 个结果中有 10 个为自报。
320B 参数、18B 激活:混合注意力把长上下文成本压下来
成本优势来自架构。GLM-5.3-Flash 是 MoE 模型:320B 总参数、每次只激活 18B、45 层——对比 GLM-4.5 系列的 355B、32B 激活、92 层,总参数相近,激活参数和层数几乎减半(Z.ai 博客口径)。
它首次在 GLM 系列中混合稀疏注意力与线性注意力:线性注意力用状态建模捕捉局部依赖,稀疏注意力通过轻量索引器取回全局上下文;索引器再用 IndexPool 把四个 key 向量加权池化成一个,压低 100 万 token 长度下的延迟与显存。按 Z.ai 的测量,相比 GLM-5.3,注意力计算量降至约三分之一,KV cache 降至约四分之一。
模型在 30T token 的多模态语料上预训练,视觉原生接入编码回路,能查看自己渲染的界面并迭代修改。权重以 MIT 许可公开在 HuggingFace,支持 SGLang、vLLM、TokenSpeed。
发布前约一周,它匿名以 ox-alpha 身份在 OpenCode 和 OpenRouter 上运行。Z.ai 博客公布的 OpenRouter 流量图显示,8 月 20-25 日 ox-alpha 处理 23.2T token,是第二名 deepseek-v4-flash(9.9T)的 2.3 倍;博客称这段流量全部跑在中国 AI 芯片上,团队在 SGLang 之上自建推理引擎,端到端服务性能比初始基线提升 3 倍。这三项均为 Z.ai 单方口径。
平台同事、租卡用户与"每任务预算"
Together AI 团队内部先接住了这条公告。mahadev konar(X 简介:在 Together AI 任职,曾任 Instacart,Hortonworks 联合创始人)写道:"So exciting!! Give it a try!!"(太激动了,快试试)。同在 Together AI 做 AI/ML 的 zainhas "Lets goo!"。
外部回应集中在价格上。Ryan Sael 在里评价"非常便宜且能干",并附上自己 8 月 27 日凌晨的:用 GLM-5.3-Flash 生成一段 3D 可视化,自称全程成本 0.01975 美元。自称专注本地模型与真实成本的 Fahad Saleem :"18B 激活和 100 万上下文对我才是最有用的部分。如果只需要用这个模型几小时,我就租几小时的 GPU,不会为了它买一台 DGX Spark。"关注基准排名的 Liam Nerd 则说:"每任务预算是真正站得住的指标。"
这条公告本身声量不大,截至核验时 78 赞、约 4000 次浏览,与 Z.ai 官宣的 2.3 万赞、554 万浏览不在一个量级。但 Together AI 把"预算效率"直接写进了公告,DeepSWE 榜单给了它一个可以核对的落点:平均任务成本 0.24 美元、全榜最低,成绩与 Luna 的差距落在同一个置信区间里。"几乎追平"与"两倍产出"能否坐实,取决于按 0.15/0.50 美元计价跑真实负载的用户,而不是公告本身。