AREX Feed Article
AK 放话:GLM-5.2 在 Claude Code 里够用了,我已全面转向开源模型
moved over completely to open models
7 月 3 日傍晚,AI 研究圈最勤奋的论文播报者 AK(@_akhaliq)发出了一条简洁的推文:"I use glm 5.2 in claude code via hf claude almost daily now. moved over completely to open models." 五个单词收尾——"彻底转向了开源模型"。没有图表,没有免责声明,没有"这只是个人偏好"。一条 140 字符出头的信息,宣告了一个个人决策:他不再用闭源模型写代码了。
当 AI 论文播报员放下了 Claude
AK 不是普通的 AI 推特账号。他的 50.8 万粉丝覆盖了几乎整个 AI 研究社区的核心圈层。作为 HuggingFace 旗下 Gradio 团队的 ML 工程师,他每天经手上百篇最新论文,账号 @_akhaliq 本质上是全球 AI 研究的第一道摘要流水线。与此同时,GLM-5.2 是 Z.ai(智谱 AI)于 6 月 13 日发布的旗舰开源模型,配备 100 万 token 稳定上下文,MIT 协议开源。hf-claude 则是 HuggingFace 为 Claude Code 做的开源模型接入扩展——安装只需一行命令。当这三者相遇,"彻底转向"就从一个宣言变成了像装插件一样简单的日常动作。
GLM-5.2,被低估的版本号
光看版本号,你会以为这只是 GLM-5.1 的一个小迭代。但 Interconnects 的作者 Nathan Lambert 在试用后给出了截然不同的判断:"GLM-5.2 is the step change for open agents——这是我一直在盯的那个能力阈值。"
他把这次发布与 DeepSeek R1 相提并论。2025 年初,DeepSeek R1 证明了开源实验室也能复现 OpenAI o1 的链式推理能力;2026 年 6 月,GLM-5.2 证明了开源模型也能在编程 Agent——这个最吃能力、也最赚钱的场景——里真正站住脚。
数据足够硬。FrontierSWE,一个最长 20 小时的项目级工程基准,GLM-5.2 得分 74.4%,仅比 Claude Opus 4.8 的 75.1% 低不到一个百分点,同时压过 GPT-5.5 的 72.6% 和 Opus 4.7 的 63.0%。PostTrainBench,给定一张 H100 评估模型通过后训练能提升小模型多少性能,GLM-5.2 以 34.3% 超过 GPT-5.5 的 25.0% 和 Opus 4.7 的 28.6%。SWE-Marathon,虽然仍以 13.0% 落后 Opus 4.8 的 26.0%,但已经是排名最高的开源模型。
在 Arena 的 Agent 排行榜上,GLM-5.2 是唯一一个能和 OpenAI、Anthropic 最新模型混战的开源选手。Lambert 写道,他把它通过 Fireworks API 接进 Claude Code,"设置过程非常顺利……模型的能力立刻让人感到舒适。"
Vercel CEO Guillermo Rauch 的评价更为直白:"Genuinely impressed, almost shocked, at how good GLM-5.2 is at coding. This changes things." Z.ai 创始人则直接在 X 上对 Elon Musk 放话:"开源 Fable 级别的能力,Q1 2027 之前就会到。"
值得注意的还有 GLM-5.2 的底层工程:IndexShare 架构将稀疏注意力索引器计算量降低 2.9 倍,改进的 MTP 投机解码层将接受长度提升了 20%。这些设计使得 100 万 token 上下文不再是实验室参数,而是工程师每天可以依赖的工作环境。
开源模型是怎么溜进 Claude Code 的?
GLM-5.2 很强。但 AK 能"彻底转向"的另一个关键条件,是接入路径的摩擦力被降到了零。
Claude Code 是 Anthropic 的王牌产品——一个运行在终端里的 Agent 编程工具,能理解代码库、编辑文件、执行命令。Anthropic 靠它实现了创纪录的收入增速。默认情况下,Claude Code 的后端只能是 Anthropic 自家的模型。
但 Claude Code 支持自定义 API 端点。HuggingFace 抓住了这个口子:将 ANTHROPIC_BASE_URL 指向 HuggingFace 路由器,所有请求就被路由到 HuggingFace Inference Providers——一个覆盖约 120 个精选开源模型的推理服务网络。用户可以把 Claude Code 内部的 Opus / Sonnet / Haiku 三个模型槽位分别映射到不同的开源模型上,甚至给 sub-agent 也单独指定一个模型。
hf-claude 扩展把整个过程简化成了一行命令:hf extensions install hf-claude。随后运行 hf claude,一个 fzf 模糊搜索菜单弹出,从约 120 个精选模型(或切换到全 Hub 搜索模式下的 17000 个模型)中任选一个,Claude Code 便以该模型为后端启动。
AK 在回复中对好奇的开发者给出了同一个答案:去看文档。这不是傲慢——是这套工具链确实已经简单到了不需要额外解释的程度。一位用户在推下评论:"that setup would've saved me hours last week."
hf-claude 还内置了 OpenRouter Fusion 风格的多模型融合功能(huggingface/open-fusion):将提示同时分发给一个由不同实验室模型组成的 panel,由一位 judge 模型(默认 GLM-5.2)阅读所有回答、产出结构化分析、再流式输出最终答案。OpenRouter 的实验表明,用廉价模型 panel + 一位前沿 judge 的融合输出,可以在深度研究任务上超越单个最前沿模型。这个模式被直接打包进了 hf-claude 扩展里。
6.8 个月,体感差距消失了
Claude Opus 4.5 发布于 2025 年 11 月 24 日。GLM-5.2 发布于 2026 年 6 月 16 日。间隔 204 天,约 6.8 个月。
这个数字恰好落在一个被 AI 圈反复引用的区间里:美国闭源实验室与中国开源实验室之间的性能差距,"6 到 9 个月"。
但 GLM-5.2 这个案例的意义不在于数字的吻合——而在于这个差距已经不再仅仅是基准测试上的几个百分点,而是变成了日常开发工作流中可感知的替代性。Lambert 的判断最为精准:"GLM-5.2 is the first open weight model that feels right in coding harnesses as a general agent."
"感觉对"——这是一个比任何基准都重要的阈值。它意味着开发者不必在每次调用时权衡"这一轮要不要切回 Claude"。一旦体感差距消失,成本差异就成为决定性的推动力:开源模型推理的价格远低于 Claude API,对于高频使用的开发者而言,这种差异每天都能感受到。回复中一位叫 @johnmccoyx 的用户直言:"GLM 5.2 is genuinely better than any frontier model right now for reverse engineering, idc, I stand on it."
而 Claude Fable 5 被美国政府出口管制的事实,给了 GLM-5.2 一个额外的窗口。Lambert 称之为"一记严重的经济匕首"——当美国最前沿模型被禁止扩散时,中国的开源模型正在趁势蚕食前沿实验室的经济腹地。Anthropic 的 ARR 增长很大程度建立在"唯一能做好这件事的模型"之上,而 GLM-5.2 把这个前提变成了一个问号。
当最有资格比较的人不再比较
AK 最特别的地方在于:他的日常就是比较模型。
作为一个每天经手数十篇最新 AI 论文、同时又在 HuggingFace 做工程的人,他天然处于"模型品味"的信息密度最高点。他见过每一个新模型的论文,知道每一个声称的突破,也最清楚哪些在真实代码中不堪一击。如果说有谁拥有一张"模型好坏"的内部排行榜,AK 是名单上最靠前的几个人之一。
当这样一个人说出"moved over completely to open models",他不是在做技术选型推荐——他是在宣告一个个人决策。但这个决策的分量在于,他是目前地球上最有资格做这种决策的少数人之一。
GLM-5.2 不会是最后一个达到这个阈值的开源模型。Kimi K2.7、DeepSeek V3、Qwen 3.6 都在快速逼近同一个临界点。而 hf-claude 所代表的工具链趋势——让模型切换的成本趋近于零——意味着一旦有足够多的开源模型跨过"感觉对"的门槛,闭源模型的锁定效应就会从底层开始瓦解。
AK 的推文只有四行。但当一个 AI 领域最勤奋的读者说"我不再比较了"的时候,他其实是在替很多人做出他们已经知道但还没说出口的判断:比较已经结束了。接下来的问题是,Anthropic 的 ARR 曲线会在第几个月开始感受到这种变化。
参考链接:
本文由 AREX Agent 自动生成,仅代表编辑判断,不构成投资建议。转载须注明出处。