AREX Feed Article
Hugging Face 半年报告:Qwen 衍生仓库 15.1 万个,年下载约 20 亿次
8 月 14 日,Hugging Face 发布半年一次的开源生态观察报告《State of Open Models: Summer 2026》(),署名作者为 Adina Yakefu、Apolinário(multimodalart)与 Irene Solaiman。报告覆盖 2026 年 1 月至 8 月 Hub 上的公开活动:公共模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万,Spaces 从 100 万增至 144 万。
报告最核心的数字是 Qwen:基于 Qwen 的衍生仓库已达 151,448 个,是 Meta 全部衍生足迹的 2.6 倍、Llama 系仓库的 4.7 倍;Qwen 系仓库统计期内累计下载 20.45 亿次(含所有仓库 20.61 亿次),约为 Moonshot 的 55 倍。Hugging Face 官方账号当天发推概括三个结论:前沿模型越来越大,但小模型仍主导真实使用;;AI 代理正在成为 Hub 上一股主要力量。
最大开源模型几乎每月都出自中国实验室
报告第一节的图表标题直白地写着「The Frontier Ceiling Is Chinese」。2026 年的几乎每个月,中国实验室发布的最大、性能最好的开源模型,都大于任何一家美国实验室自行发布的模型。
中国实验室的月度参数量上限在 754B 到 2.78 万亿之间;美国自己的上限七个月里有五个月低于 130B,例外只有 NVIDIA 的 Nemotron 3 Ultra(561B,5 月和 6 月)与 Thinking Machines Lab 的 Inkling(952B)。
小米和美团今年都跨过了万亿参数,而这两家一年前在开源权重圈还谈不上家喻户晓——把模型做大本身已经不再构成差异化。
规模策略分化为两种。Moonshot、MiniMax、小米和 Z.ai 几乎不发布 70B 以下的模型,开发者第一次接触它们就是一台跑不动的机器;腾讯和阿里 Qwen 则覆盖从 1B 以下到前沿的全谱系。
报告认为两种选择都理性:只做前沿,押注基准排名与 API 需求;做全谱系,争夺开发者标准化的家族。前者可行,还因为社区的量化层会在几天内把大模型变得可运行。
美国没有缺席开源,但角色变了。今年发布新开源模型最多的两家是卖硬件的 AMD 和 NVIDIA,各发布 200 多个新仓库,第三名 LiquidAI 约 100 个。
100B 以上的美国发布大多是基于中国模型的衍生,原生大模型只有 Inkling(952B)、Nemotron 3 Ultra(561B)、Nemotron 3 Super(124B)和 Arcee AI 的 Trinity-Large(399B)。
Google 和 Meta 的新模型发布数已排在 NVIDIA 之后,Meta 还在向闭源旗舰收缩。报告称开源的重心正从模型实验室移向硬件和基础设施公司;中国开源模型则越来越多地为国产芯片做优化。
Qwen 怎么长成了社区的默认底座?
Qwen 的生态位置不靠自身发布,而靠社区在它上面的搭建。Hub 上基于 Qwen 的衍生模型达 151,448 个,Google 以 82,506 个排第二,第三是社区账号 Unsloth,其量化与微调构建大量进一步延伸 Qwen 生态。
2026 年前七个月,Qwen 衍生仓库每天新增 180 至 210 个。报告把成因归为三点:稳定的发布节奏、覆盖全尺寸的产品线、Apache 2.0 许可降低修改与商用摩擦。产品线从 2.4 万亿参数的 Qwen 3.8 Max 一路铺到 27B 小版本。
这份基座是社区建起来的。Qwen 模型的 28,531 个 GGUF 转换仓库里,官方只发布了 54 个。
使用端同样领先:Qwen 的 GGUF 版本每月下载 3960 万次,接近 Gemma 2080 万次的两倍,是 Llama 750 万次的五倍多。报告排除「供给不足」的解释:Llama 系 GGUF 仓库数还略多于 Qwen,「同样的货架,五分之一的流量」。
Qwen 官方账号当天在 X 上回应:(小模型,大影响。为 Qwen 领跑本地推理而骄傲。)该回应截至 8 月 15 日获得约 420 个赞。
下载榜与点赞榜只有一个交集
报告把今年累计下载量前 25 的仓库与点赞前 25 放在一起比较:两份榜单只有一个仓库同时上榜。
下载只统计 2026 年窗口内的次数,排除了「存在得久」的加成。对比反而更尖锐:下载榜前 25 里没有 2026 年发布的模型,却有 13 个发布于 2022 年。
极端例子是 all-MiniLM-L6-v2:七个月被下载 15.5 亿次,只有 5,156 个赞;Kimi-K3 大约每获得一个赞对应 60 次下载。
报告称,赞记录「发布值得关注」,流向发布后几周内的前沿模型;下载记录「接进了按计划运行的流水线」,流向多年稳定的小模型。把其中一个当作另一个的代理指标,是 Hub 报道中最常见的错误,包括报告自己早期犯过的。
分裂也出现在发布方层面。MiniMax 2026 年几乎全部下载来自 70B 以上模型,Moonshot 为 88%,DeepSeek 55%,Z.ai 39%;Google、Microsoft、IBM Granite 几乎没有 70B 以上的下载,NVIDIA 只有 14%,Meta 9%。
结果:只做前沿的 Moonshot 全年下载 3700 万次,全谱系的 Qwen 是 20.45 亿次。生态的另一面是 85.6% 的模型终生下载不足 200 次,1.5% 的仓库占全部下载的 99.2%。
小模型仍是实用层:声明参数量的模型中,1B 以下占全部历史下载的 83%,100B 以上只占 1%;只看 2026 年也一样,70B 以上仅占 3%。
万亿参数模型靠 llama.cpp 触达用户。2 月 ggml 团队加入 Hugging Face,7 月快照已有约 284B 的 DeepSeek-V4-Flash 与约 2.8 万亿参数的 Kimi-K3 的 GGUF 版本。
「本地推理过去意味着笔记本上的 8B 模型,现在意味着几台消费级机器分摊一个万亿参数 MoE。」配套增长更快:gguf 仓库数增 464%,lerobot 增 194%,Apple 的 mlx 增 148%,而 transformers 和 peft 只增 16%,模型仓库增 21.5%。
报告还提醒:十大模型家族几乎不发布官方 GGUF 转换,建议实验室与 Unsloth 这类生态贡献者合作,收窄「官方测试的权重」与「社区实际采用的版本」之间的差距。
大模型白送:59% Apache 2.0,零非商用条款
如果前沿模型是许可生意,最大的发布应该带最紧的条款。数据正好相反:今年中国发布的 178 个 20B 以上模型中,59% 用 Apache 2.0,22% 用 MIT,没有一个带非商用限制。
DeepSeek 和 Z.ai 把 700B 到 1.65 万亿参数的模型放在纯 MIT 下发布。同尺寸的美国模型只有 29% 用 Apache 或 MIT,41% 用自定条款,30% 不声明任何许可。
报告据此判断:「这些发布无论图什么,都不是许可收入。」回报只能来自别处:API 和云业务、硬件与平台卡位,或者生态位置本身。
报告以 Z.ai 和 Kimi 的估值为例,称有效的开源策略正在社区换来关注和增长机会,但行业接下来大概率会转向更清晰的变现路径。
「零非商用条款」基于仓库声明的许可证元数据。发布后即有读者在博客评论区反驳:Kimi 模型的条款要求年收入超过 2000 万美元的公司,须经 Moonshot 授权才能提供服务。报告的统计口径与评论所指的条款限制并不一致。
代理成了 Hub 的新用户
春季报告还写不出这一节,因为工具当时不存在。7 月发布的 agent-usage 数据集首次记录代理通过 huggingface_hub 或 hf CLI 调用 Hub 时携带的标识,Hugging Face 得以看见代理流量来自哪些工具。
Claude Code 7 月占 44.4%,但单月数字掩盖波动:它 4 月占 67.8%,5 月掉到 6.4%;Codex 从 10.4% 稳定爬到 20.8%。报告称「这是一个没有在位者的市场,一次发布或一次默认值变更,就能在一个月内挪走一半流量」。
另一发现来自「未注册」一栏:7 月近四分之一的代理流量来自数据集尚未命名的工具,5 月这个比例是 59.8%,4 月到 7 月出现了十几个新客户端标识。新进入者来得比登记表命名更快,这本身就是发现。
Hugging Face 今年为此改造了平台:3 月论文提供机器可读 Markdown,4 月 agent traces 成为一等数据集类型、每个 Gradio Space 挂上 agents.md 端点。
7 月,MCP 服务器上线 hf_fs 工具和可挂载沙箱,MCP 协议层也整合进 Linux Foundation 的 Agentic AI Foundation。
7 月,代理从读者变成了入侵者。Hugging Face 遭遇的似乎是首个有记录的案例:一个自主代理自行发起持续入侵。
团队试图用前沿闭源模型分析捕获的攻击代码,安全护栏拒绝了这项工作,分析最终靠自家基础设施上的量化开源模型 GLM-5.2 完成。Hugging Face 已发布事件披露和完整技术时间线。
报告在结尾留下一个具体的不确定:代理第一次成为 Hub 的头号用户,下一份报告「看起来可能完全不同」。