AREX Feed Article
GLM-5.3 上线 Ollama Cloud:美欧托管、零留存,Flash 先行
2026 年 8 月 28 日 15:12(UTC),Ollama 官方 X 账号(认证企业号,粉丝约 18.1 万) GLM-5.3 上线 Ollama Cloud:模型托管于美国与欧洲、零数据留存("Private. Fast. US and Europe hosted. No data retention."),先提供 GLM-5.3-Flash,GLM-5.3 随后逐步接入("as we bring it GLM-5.3 online")。推文同时给出 Claude Code、OpenCode、Hermes Agent 的一行接入命令,并称 API 端点同样可用,"还可以接入任何其他 harness/应用"。
截至发稿,这条推文获 480 余赞、约 4 万次查看,评论区有 40 余条回复。Ollama 在回复中补充:GLM-5.3-Flash 在周三(8 月 26 日)发布当天就已在云端可用;ollama.com 上 glm-5.3 的模型页也挂出了 glm-5.3:cloud 条目,分阶段上线正在推进。
三条命令和一个 :cloud 标签
接入方式是在模型名后加 :cloud 后缀:
ollama launch claude --model glm-5.3-flash:cloudollama launch opencode --model glm-5.3-flash:cloudollama launch hermes --model glm-5.3-flash:cloudOllama 的 写明,该模型"托管于美国与欧洲",并称与 Ollama 云端所有其他模型一样,遵循 Ollama 隐私政策、零数据留存。给出了同一段说明。
页面上两个云端条目均已可见:glm-5.3-flash:cloud 为 Medium 用量档、1M 上下文、支持文本与图像输入,条目约两天前(8 月 26 日前后)上线;glm-5.3:cloud 为 High 用量档、1M 上下文、仅文本输入,条目在 8 月 28 日才出现,与"先 Flash、后 GLM-5.3"的节奏一致。
两天前,智谱刚把 Flash 开源
8 月 26 日,智谱宣布上线并开源 GLM-5.3-Flash。据,这是 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B;智谱称其常规定价约为 GLM-5.3 的十分之一,限时折扣期间约二十分之一,约为 Claude Opus 4.8 的四十分之一。
发布前,智谱以匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 上大规模测试,中文社区称其为"牛来"。智谱称,测试期间 Ox-Alpha 成为当周两个平台上较受欢迎的模型之一并刷新调用量纪录,测试流量全部由国产芯片提供算力。
同一天 14:28(UTC),Ollama 官方账号发出:"glm-5.3-flash 很快将在 Ollama 云端可用。"两天后正式宣布上线。Ollama 的模型页也记载了这段前史:发布前以 ox-alpha 匿名测试时,它"成为当周最受欢迎的模型"。
18B 激活的 Flash 与 753B 的旗舰
两个模型在云端的分工不同。按 Ollama 模型页介绍,GLM-5.3-Flash 是 Z.ai 在 GLM-5 系列中的首个原生多模态模型,320B 总参数中每次推理只激活 18B,在编码与智能体基准上逼近 Claude Opus 4.8,以约十分之一的成本跑赢 GLM-5.2;支持 1M 上下文、图像与视频输入,MIT 许可,推理强度可按 low/high/max 调节。
Z.ai 公布在模型页的基准中,Flash 在 DeepSWE v1.1 上 63.4 对 GLM-5.2 的 46.2,AutomationBench 上 48.8 对 26.2;在 Artificial Analysis 智能指数 v4.1.1 上以 57 分推进帕累托前沿,模型页配图中该点标注为 0.045 美元(discounted)。
GLM-5.3 是 753B 参数的旗舰。按 Z.ai 在模型页的说法,它与 GLM-5.2 共用基座、提升全部来自后训练,自家 Code Bench 提升 50%;Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9。模型页把两个模型都标注为面向 Claude Code、OpenCode、Hermes Agent 与 OpenClaw 的编码智能体模型。
150 tps 与「Incoming max plan」
官宣之后,Ollama 在评论区补充了几项具体口径。被问到生成速度时,官方账号:"我们在 Ollama 云端测得 glm-5.3-flash 的 p50 约为 150 tps",作为 flash 模型会追求更快,"这对专业场景的用户和企业尤其重要"。提问者是 Ashish(,简介自称 Whatfix 前高级工程师)。
有用户是否与 DeepSeek-V4-Flash 体验相同、以及更高的 max 档位,官方:"flash 模型在 Ollama 云端跑得极快。Incoming max plan(max 计划即将到来)"。另一名用户Qwen 3.8 是否上云,官方"我们绝对在考虑"。面对"其实上线的是 5.3-flash 吧"的,Ollama :"GLM-5.3 正在上线!GLM-5.3-Flash 周三发布当天就已可用。"5.2 万粉丝、简介自称 Principal AI @ Microsoft 的 Mike Gannotti :"GLM5.3 Flash on Ollama is great!"(GLM5.3 Flash 在 Ollama 上很棒)。
「零留存」之外,数据还是离开了大楼
评论区对"美欧托管 + 零留存"的卖点看法不一。账号 (@promptprobe,简介自称由 @bot 运营)说,从 Claude Code 和 OpenCode 里跑 GLM 而不把提示词送出去,"是真正重要的一点";"美欧托管加零留存,是我会最先强调的卖点"。Ibesh Tech()则点出另一层价值:本地跑不动 700B 以上的模型,一条命令就能把它换进 Claude Code、OpenCode 或 Hermes。
唱反调的声音同样存在。Aleksandar Janca()写道:"hosted with no retention is still the data leaving the building"(托管加零留存,数据依然离开了大楼),"大多数企业其实不会做这个决定"。用量是另一个追问点:The Kaz 称 GLM-5.3-Flash"消耗的月度用量比 GLM-5.2 更多";PirateCoder()提问,模型尺寸与 GLM-5.2 相同,为何用量是两倍多。中文用户 9h0st()则建议,接入前先跑三类 smoke test:补丁最小化、工具调用 JSON、长上下文续写,"云端快不快要和失败重试成本一起看"。
回复区留下了关于用量与计价的提问;可核查的下一步已经发生:glm-5.3:cloud 挂上了模型目录,753B 旗舰的云端上线从目录里开始了。
参考链接
- _