AREX Feed Article
Niels Rogge 的 Agent 实践:harness 决定上限、开源模型已够用、"大多数 agent 就是加了 LLM 的 CRON job"
"大多数 AI agent 就是加了 LLM API 的 CRON job"
"Lots of AI agents are actually just CRON jobs that involve LLM APIs."
这不是某个怀疑论者的嘲讽,而是 Niels Rogge——HuggingFace 的机器学习工程师,在用 Gemini API 自动化了 14,000 多次论文作者触达之后——在博客里写下的一句大实话。2026 年 7 月 1 日,他在 AI Engineer World's Fair 上做了一场题为《How I automate my own job at Hugging Face using agents》的演讲,把这句话背后的技术栈彻底摊开:Claude Agents SDK 做 harness、GLM-5.2 做推理引擎、Langfuse 做追踪、Modal 做部署。一个 HuggingFace 工程师如何把自己干成了"被 agent 接管的岗位"?答案藏在三层架构里。
从手工写 issue 到 agent 接管:一条自动化之路
AI Engineer World's Fair 2026 是今年规模最大的 AI 工程师集会,从 6 月 29 日到 7 月 2 日,旧金山 Moscone West 挤满了 Anthropic、Google DeepMind、OpenAI 的高管和一线工程师。在"Sandbox & Platform Engineering"分论坛上,Niels Rogge 的发言时长并不突出,但他的演讲标题可能是全场最扎心的一个:"如何用 agent 自动化我自己的工作"。
Niels Rogge 的身份值得交代清楚:他是 HuggingFace 的 ML Engineer,从 2020 年给 Transformers 库贡献第一个模型(TAPAS)开始,陆续实现了 ViT、DETR、SegFormer 等约 50 个模型架构的移植。他同时是 HuggingFace "Community Science"项目的核心推动者——这个项目和 AK(即 Twitter 上 50 万粉的 @_akhaliq)合作,目标是把 arXiv 论文作者从 Google Drive 和 Dropbox 拉到 HuggingFace Hub 上发布模型和数据集。从手工写 GitHub issue 到用 Gemini API 搭建全自动 workflow,再到如今转向 Claude Agents SDK + GLM-5.2,Niels 的自动化之路就是一部 agent 基础设施的编年史。
同一个模型,换一套 harness 从 42% 跳到 78%
Niels 本次演讲最核心的技术选择是 Claude Agents SDK。理解这个选择,需要先理解 Anthropic 对 agent 的整套哲学。
ML6 的技术博客详细拆解过 Anthropic 在 AI Engineer Code Summit 上分享的框架。一个类比足以说明问题:模型是 CPU,上下文窗口是 RAM,而 agent harness(agent 骨架/脚手架)是操作系统。Claude Agents SDK 就是把这个"操作系统"从 Claude Code 里打包出来,让开发者拿它去构建任何类型的 agent——不只是 coding agent,而是金融、客服、数据分析等一切场景。
这个类比背后有一组数字。CORE 基准测试上,同一个 Opus 4.5 模型:用 Claude Code 的 harness 拿 78%,用 Smolagents 的 harness 只拿 42%。同一颗"大脑",换一个"操作系统",表现差了近一倍。这就是为什么 Anthropic 敢说"harness 和模型一样重要"。
Niels 选择 Claude Agents SDK,本质上是在三件事上站了 Anthropic 的队。第一,bash 比工具描述更高效——grep、tail、管道符这些 Unix 原语的 token 开销远低于臃肿的 MCP server 工具描述(GitHub MCP server 光工具描述就要吃掉 15k token)。第二,文件系统是天然的"上下文检索"层——Skills、工具描述、对话历史都可以放在磁盘上,agent 按需读取,而不是一把塞进 prompt。第三,Anthropic 的三步循环"收集上下文 → 执行 → 验证"天然适配 Niels 那种可验证的 outreach workflow。
从 Niels 自己的博客也能看到这个哲学渗透的痕迹。他在用 Codex 给 Transformers 库贡献新模型 VidEoMT 时,反复强调自己是"filesystem-pilled"——给 agent 文件路径、让它写 progress.md 作为 scratchpad、用 bash 跑 lint 和 make check-repo,每一个动作都精准踩在 Anthropic 的 agent 设计原则上。
GLM-5.2:第一个让开源 agent"感觉对了"的模型
如果说 Claude Agents SDK 是 Niels 选的操作系统,那 GLM-5.2 就是他选的引擎。
2026 年 6 月 13 日,Z.ai(智谱)在 Claude Fable 5 被禁的混乱窗口期发布了 GLM-5.2。三天后,MIT 协议的开源权重上线 HuggingFace。744B 参数的 MoE 架构,40B 活跃参数,1M token 上下文窗口——这些数字本身已经足够亮眼,但真正让社区沸腾的是它在 agent 场景的表现。
LMSYS 的 Code Arena:Frontend 排行榜上,GLM-5.2 Max 排名第 2,比 Claude Opus 4.7 Thinking 高出 29 分,仅次于被禁的 Fable 5。Design Arena 上更是直接超了 Fable 5,Elo 1360,排名第 1。Agent Arena 上它是唯一能和 OpenAI、Anthropic 最新模型混战的开源选手。
Nathan Lambert 在 Interconnects 上写了一篇《GLM-5.2 is the step change for open agents》,把这次发布比作 DeepSeek R1 时刻——但更深一层:R1 证明开源也能做推理,GLM-5.2 证明开源也能做 agent。他自己拿 GLM-5.2 在 Claude Code 里跑 Fireworks API 做课程内容生成,"模型的能力立刻就让人感觉对了"。
Niels 的用法更务实。他不是自己托管 GLM-5.2,而是通过 HuggingFace 的 Inference Providers 调用——这意味着他不需要操心 GPU 集群,不需要自己搞量化,直接用 API 就能把一个 MIT 协议的前沿模型接入 Claude Agents SDK 的工作流。这个路径的隐喻很清楚:agent 的未来不是被一个闭源模型垄断,而是 harness 开源 + 推理服务化的组合。
值得注意的是 GLM-5.2 的价格:$1.4 / $4.4 每百万 token(输入/输出),而 Claude Opus 4.6 定价在 $15 / $75 级别。Niels 在 LinkedIn 上做过直接对比:同样的编码任务,用 GLM-5.2 比 Opus 4.6 便宜 86%,性能接近。对于一个每天处理数百篇论文的 outreach workflow,这个成本差异意味着"可以做"和"做不起"的区别。
追踪和部署:agent 的"眼睛"和"腿"
除了 harness 和模型,Niels 的演讲还点了两个名字:Langfuse 和 Modal。这两块拼图在大多数 agent 讨论里被严重低估了。
Langfuse 做的是 LLM observability——追踪每一次 LLM 调用的延迟、成本、token 消耗、输出质量。Niels 在 Gemini API 博客里写过,他的 workflow 第 3 步(分类论文)需要并行跑多次 LLM 调用再做 majority vote,这一步的成本和可靠性直接决定整个系统的 ROI。没有 tracing,"你就是在黑暗中开飞机"。
Modal 做的是 serverless GPU 部署。Niels 的 outreach workflow 是 nightly batch job——每天晚上触发,解析 arXiv 新论文,跑 Claude Agents SDK + GLM-5.2 的分类和 outreach pipeline,生成 GitHub issue 和 HuggingFace PR。Modal 的按需 GPU 启动让这种"一天只用一次,但用的时候需要算力"的工作负载变得经济合理。
这两块拼图放到一起,揭示了一个更底层的判断:2026 年的 agent 工程,本质上是 infrastructure engineering,而不是 prompt engineering。一个可观测、可部署、可复现的生产级 agent,需要的代码量远超 prompt 本身——而 Niels 展示的正是这样一套完整的基础设施图景。
当工程师把自己的工作也放进了自动化流水线
Niels 在演讲中展示的不只是一套技术栈,而是一个正在发生的现实:他自己就是被自动化的对象。Community Science 项目的故事线非常清晰——从手工读论文、手工写 issue(不可扩展),到 Gemini API workflow(每晚批处理数百篇),再到 Claude Agents SDK + GLM-5.2(更可靠、更便宜、更 agentic)。
他的 GitHub 账号有超过 14,000 次贡献,其中相当一部分是 agent 自动发出的。他在博客里半开玩笑地写道:"Some might call my workflow an 'agent', but it is also just a CRON job that involves LLM APIs."话虽自谦,但这句话的锋利之处在于:当工程师们还在争论 agent 的定义时,已经有人用它实打实地替换了自己的日常工作。
这或许是 Niels 演讲最值得被记住的判断。当 agent harness 足够成熟(Claude Agents SDK),开源模型足够强大(GLM-5.2),可观测性和部署基础设施足够顺手(Langfuse + Modal),"自动化自己的工作"就不是一个科幻命题,而是一个 engineering decision。Niels 已经做了这个 decision。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供行业参考。如需转载,请注明来源。