AREX Feed Article
antirez 称 GLM-5.3-Flash 完整 llama.cpp 支持将合入 main:vision、ROCm 与反拒绝向量
8 月 29 日 09:51(UTC,北京时间 17:51),在 X 上宣布:GLM 5.3 Flash 的 llama.cpp 支持昨天只是 preview,完整支持即将合入 main——包括 vision、vector steering(这次会一并发布反拒绝向量)、ROCm 支持,以及改进的 Metal 与 DGX Spark 支持()。
这是一条前瞻性声明:合并尚未发生,antirez 没有给出时间点。四分钟后,他贴出 DwarfStar 在 MacBook M5 Max 上运行 GLM 5.3 vision 支持的演示视频,并说明该 vision 支持目前未做量化,以保证最高精度()。截至发稿,宣布推文获得近 200 次点赞、约 7700 次浏览,回复串里已经有人就反拒绝向量提出追问。
昨天只是 preview,完整支持将合入 main
antirez 的原话是:"Yesterday's GLM 5.3 Flash was just a preview. Soon I'll release the actual support merged into 'main' with vision, vector steering (I'll also release the anti-refusal vector this time), ROCm support, improved Metal / DGX Spark support and other fixes."
所谓"昨天",指 8 月 28 日放出的预览:antirez 把支持放上 DwarfStar 的 glm-5.3-flash 分支,宣称 GLM 5.3 Flash 的 Q2 与 Q4 量化可以跑在单台 128GB MacBook 或 DGX Spark 上;两台 128GB MacBook 通过 RDMA 做张量并行跑 Q4,单路生成 37 tokens/s,prefill 约 500 tokens/s("还能更高");当时写的是"ROCm soon"()。一天之后,ROCm 已经出现在合入 main 的清单里。
antirez 的 DwarfStar 与 llama.cpp 关系紧密:仓库 README 写明"这个项目没有 llama.cpp 与 GGML 就不会存在",并向 Georgi Gerganov 及所有贡献者致谢;同时说明 ds4.c 不再链接 GGML,但保留了 GGUF 量化布局、CPU 量化与点积逻辑等源码片段()。5 月的第三方解读干脆把 DwarfStar 4 称为"剥到只剩 DeepSeek-V4-Flash 的 llama.cpp",并注意到 antirez 已把 steering 做成 DwarfStar 的一等公民()。
Q2 90 GiB、Q4 178 GiB:预览分支能跑在哪
预览分支的 README 给出了明确的部署版图():从官方 FP8 checkpoint 转出三档文件,glm53-q2 约 90 GiB,glm53-q4 约 178 GiB,glm53-fp8 约 305 GiB,其中 FP8 只打包了权重,DwarfStar 尚不能执行。Q2 采用 imatrix 引导的 IQ2_XXS gate/up 专家与 Q2_K down 专家,可常驻 128GB M3 Max 或 M5 Max,也能跑在单台 DGX Spark 上;Q4 作为高质量档,适合两台 128GB Mac 张量并行或单台 SSD streaming。模型的 MTP 块已内置在同一个 GGUF 里,用 --mtp 开启;单台 M5 Max 上可以开四个 4096 token 的批处理会话,当作小规模多用户服务器。
验证状态同样是"预览"级别:GLM 5.3 在 Metal 上完成验证,Q2 另在 CUDA 上验证;分支文档明确写着 directional steering、--power 低于 100、--prefill-chunk 等能力暂不支持 GLM。也就是说,vector steering 正是这次合入 main 才补上的部分。DwarfStar 本身面向 Metal(主目标,96GB 以上 Mac)、NVIDIA CUDA(含 DGX Spark)与 ROCm(Strix Halo,如 Framework Desktop)三套后端(),仓库 star 已超过 2 万。
反拒绝向量:还没发布,追问已经来了
vector steering 是 DwarfStar 的运行时激活编辑:方向文件是一张 f32 矩阵,每个层一条归一化的 4096 维方向;推理时按 y = y - scale × direction × dot(direction, y) 修改激活,正 scale 移除该方向,负 scale 放大它,FFN 输出通常是最佳作用点()。
反拒绝向量的特别之处在于它针对的模型。8 月 29 日凌晨,模型路由服务 OrcaRouter 发帖称"GLM-5.3 系列异常抵抗 abliteration":它通常能把拒绝行为驱动到接近零,"这次不行",换更多数据、多方向子空间、逐层约束消融都没有变化;它的假设是 GLM-5.3 的安全策略深度分布在权重中,"很可能是 SFT 加偏好/RL 训练强化出来的,而不是一条干净的线性拒绝方向",并预告将发布本地权重与技术论文()。antirez 在宣布合入 main 时,把"这次一并发布反拒绝向量"写进了括号。
回复串里随即出现针对性追问。用户 Rimas 问:OrcaRouter 报告拒绝策略分布在权重里、没有干净的线性方向,"反拒绝向量在这种情况下针对的是什么?"()。开发者 Gregor 评论:"反拒绝向量才是这里真正的故事。拒绝与不确定性规避在激活空间里挨得很近,动一个往往会带动另一个。"()
"单台 Spark 又慢又超时":抱怨正指向改进项
回复串里最具体的反馈来自 DGX Spark 用户。用户 dr bosconovitch 报告"DGX Spark 的结果不好:在 xhigh 上它只是一直思考、思考"();DevSecOps 工程师 Alfonso Fortunato 写道:"单台 Spark 上太慢,偶尔还会超时。xhigh 下连简单提示都过度思考。还需要打磨。"()这些抱怨与推文承诺的"改进的 Metal / DGX Spark 支持"和"other fixes"直接对应。
另一边是预览支持带来的正面反馈:用户 AIGottaStayFly 说当天试跑"速度难以置信,还帮我配好了新 NAS","正遗憾没有 vision,看这个!"();Liam Nerd 评论道"preview 先行,main 随后"()。
预览期的缺陷不止出现在 DwarfStar 一侧。llama.cpp 本体里,Unsloth 的 Daniel Han(danielhanchen)8 月 26 日开出的草稿 PR #27754「model: add GLM-5-Next (GLM-5.3-Flash)」包含 321.3B 混合线性/稀疏注意力 MoE 与 vision tower,至今未合并;评论区既有 Metal 上长上下文重复 token 崩塌的报告,也有 DGX Spark 长会话无限输出 "????" 的同类缺陷(指向另一条 PR #27752),8 月 29 日早上仍有人在问"有希望很快合并吗"()。
320B 开源三天,DwarfStar 与 llama.cpp 同时跟进
GLM-5.3-Flash 于 8 月 26 日由 Z.ai 发布:GLM-5 系列首个原生多模态模型,320B 总参数、18B 激活,MIT 协议,100 万 token 上下文,此前以 Ox Alpha 之名匿名预览,相关流量全部跑在中国 AI 芯片上()。Z.ai 博客给出的定位是:Artificial Analysis 智能指数 v4.1.1 得 57 分、每任务成本 0.045 美元;DeepSWE 63.4,对 GLM-5.2 的 46.2;发布时本地部署只列了 SGLang、vLLM、TokenSpeed,"其他框架即将就绪"()。
antirez 的跟进几乎与发布同步:8 月 26 日他说"从最初几分钟起就在为 DwarfStar 支持着手"(),8 月 27 日转推"GLM-5.3 的权重明天发布"(),8 月 28 日预览分支上线,8 月 29 日完整支持预告落地。从权重开源到宣布合入 main,前后只有三天。6 月的第三方报道已强调 DwarfStar"明确承认对 llama.cpp 与 GGML 的亏欠",并注意到引擎内置了 vector steering 来引导模型行为。
眼下确定的只有这份清单本身:vision、反拒绝向量、ROCm、改进的 Metal 与 DGX Spark 支持,以及 "other fixes"。合并日期没有给出;vision 目前未量化;FP8 权重还不能执行。回复串里 Rimas 的问题还悬着:当 OrcaRouter 声称 GLM-5.3 的拒绝策略没有干净的线性方向时,这次要发布的反拒绝向量,指向哪里。