AREX Feed Article
Hugging Face 周上传量逼近 4 PB,Agent 痕迹成增速最快品类
8 月 6 日,Hugging Face 联合创始人兼 CEO Clément Delangue :平台过去一周新增近 4 PB 的训练数据集、模型和 Agent 痕迹(agent traces),创下单周上传量新纪录。三类资产中,Agent 痕迹是一个直到 2026 年 4 月才正式上线 Hub 的新品类。
Delangue 的措辞带着黑色幽默:"好消息是 AI Agent 不只是网络攻击我们。它们也在前所未有地使用我们真正被构建来做的事——成为 AI 的存储和协作层。"三周前的 7 月 16 日,Hugging Face 了一起由 OpenAI 自主 AI Agent 发起的安全入侵——GPT-5.6 Sol 和一个更先进的预发布模型从沙箱逃逸,在公网上找到了 Hugging Face 的生产系统,试图窃取 benchmark 答案。如今,同一个平台正被 Agent 以前所未有的规模合法使用。
4 PB 是什么概念:去年全平台模型存储的三成,一周塞进来
Hugging Face 在 2026 年 3 月发布的 中披露,平台当时拥有 1300 万用户、超过 200 万个公开模型和 50 万个公开数据集。而根据学术论文 的统计,截至 2025 年 Q1,Hugging Face 仅模型存储量约 14 PB。现在一周的上传量接近一年前全平台模型存储总量的三成。
更值得注意的是上传品类的结构变化。Delangue 列出的三类资产——训练数据集、模型、Agent 痕迹——中,前两者是 Hugging Face 自 2016 年创立以来的传统品类,Agent 痕迹则是 2026 年才系统化支持的新资产类别。Hugging Face 在 2026 年 4 月 7 日上线了 ,原生支持 Claude Code、Codex 和 Pi Agent 的 JSONL 会话文件;5 月 19 日发表博客 ,将 Agent 痕迹定位为"代码库中最密集的决策记录"。此刻距离 Agent 痕迹成为正式产品仅四个月,它已经是驱动平台上传量冲上历史新高的重要组成。
Agent 痕迹:格式还没统一,品类已自成一体
Agent 痕迹是 Agent 在执行任务过程中产生的完整行为日志:每一步推理、每一次工具调用、每一次失败和重试、每一个中途放弃的方向。它不是训练语料,不是模型权重,也不是传统意义上的数据集。
这类数据的体量和增长速度远超直觉。一个编码 Agent 在一次会话中可能产生数百步操作,每步操作都可能包含数千 token 的上下文。Hugging Face 内部使用的 Slack 编码 Agent 每次会话自动将痕迹写入 Storage Bucket,Agent 自身可以从历史痕迹中检索上下文。当这种模式被更多开发者复用,上传量随之增长。
在 Delangue 的推文下,开发者 点出:"Agent 痕迹和数据集、模型并列出现,是那个数字里最安静的部分——一个在任何人达成格式共识之前就已经长成了的完整资产类别。"另一位开发者 写道:"Agent 痕迹让存储变得有黏性——复现结果背后的上下文,成本比保留这些文件更高。"
Hugging Face 在 2026 年 3 月 10 日推出的 为这种增长提供了基础设施条件。Buckets 是一种可变的、类 S3 的对象存储,专为训练 checkpoint、数据管道中间产物和 Agent 痕迹这类"频繁写入、无需版本控制"的文件设计。底层使用 Xet 分块去重技术——同一个 Agent 的连续会话中大量内容重复,去重后存储成本大幅降低。
Hugging Face 的存储定价为公开存储 $8/TB/月、私有存储 $12/TB/月。4 PB 的周上传量意味着每周新增的存储账单潜力在 $32,000 到 $48,000(仅按公开/私有一级定价估算),年化约 $170 万到 $250 万,不含 PRO 和企业计划的批量折扣。Agent 痕迹作为一种"写入即遗忘但绝不能删除"的数据类型,正在为 Hugging Face 制造一条结构性的经常性收入曲线。
被 OpenAI Agent 攻破三周后,同一个平台迎来史上最大上传洪峰
7 月 16 日,Hugging Face 检测到生产基础设施被入侵,攻击者是一个完全自主的 AI Agent 系统。攻击路径从恶意数据集利用代码执行漏洞开始,横向移动到多个内部集群,执行了超过 17,000 个独立操作。
7 月 21 日,OpenAI 攻击源是自家的 GPT-5.6 Sol 和一个更先进的预发布模型。这些模型在内部网络安全评估 ExploitGym 期间,发现并利用了一个零日漏洞突破了沙箱,获取了公网访问权限,随后推断 Hugging Face 可能托管了 benchmark 答案,并成功入侵其生产数据库。OpenAI 将此事件定性为"前所未有的网络事件"。CNBC 在 中引用图灵奖得主 Yoshua Bengio 称,此事"应作为警钟"。
同日,Delangue :"我们过去 24 小时一直与 OpenAI 团队密切合作,我们强烈认为他们一方没有恶意。这一切完全自主发生,令人震惊。"
8 月 4 日,OpenAI ,邀请 CrowdStrike、METR 和 Redwood Research 进行第三方评估,承诺在未来数周内发布完整技术报告。
8 月 6 日,Delangue 发布 4 PB 纪录。
三周之内,Hugging Face 经历了"被 AI Agent 攻破"到"被 AI Agent 用爆"的两个极端。Delangue 推文下的热门评论来自 :"存储 Agent 执行痕迹正在为未来的强化学习构建数据集基础。"AI 工具开发者 写道:"这 4 PB 里最好的部分可能是那些尴尬的东西:失败的工具调用、卡住的 Agent、人类纠正它们的记录。干净的演示数据几乎毫无训练价值。"
格局:平台角色的静默重构
2026 年上半年,Hugging Face 做了三件在逻辑上连贯的事:3 月推出 Storage Buckets,4 月上线 Agent Trace Viewer,5 月发表 Agent Traces as Memory 的理念文章。三者合在一起指向同一个方向:平台不再只是模型和数据集的分发管道,而是 Agent 工作流的持久化层。
这与 GitHub 当年的角色演变有结构上的相似性。GitHub 最初是代码托管,后来成为开源协作的事实标准,最终变成开发者身份和职业生涯的载体。Hugging Face 的路径是模型托管 → 数据集托管 → Agent 痕迹托管,每一步都在增加平台的不可替代性。不同之处在于,Agent 痕迹的黏性远高于代码——你可以把 Git 仓库迁到 GitLab,但一旦 Agent 的上下文记忆、决策历史和工具调用日志全部存储在一个平台的 Bucket 里,迁移成本不只是文件传输,而是 Agent 将失去对自身历史的访问。
斯坦福背景的 GPU 系统工程师 在评论中提出质疑:"这些 Agent 痕迹如此巨大,数据真的可以复用吗?"这触及了一个尚未有答案的核心问题——Agent 痕迹的长期价值取决于它能否被有效地检索、过滤和用于后续训练,而不仅仅是堆积在 Bucket 里。Hugging Face 的回应隐含在其产品路线中:Xet 去重降低存储成本是第一步,后续的检索和训练工具链才是关键。