AREX Feed Article
OpenBMB 开源 Ultra-FineWeb-L1:1T+ tokens 英文语料,自测胜 FineWeb
8 月 20 日,OpenBMB 在 ,并在官方 X 账号同步(UTC 8 月 20 日 13:01)。这是一个面向英文预训练的大规模网络语料:1T+ tokens,约 11.4 亿文档、总大小 2.83TB 的 Parquet 文件,来自 2025 年的六个 Common Crawl 快照,最新到 CC-MAIN-2025-51,采用 Apache 2.0 许可。
数据集页面同时给出自测成绩:用 MiniCPM5-1B 训练 20B tokens 后,Ultra-FineWeb-L1 在 12 项基准的六类宏平均和微平均上,分别比 FineWeb v1.4 高出 0.635 和 0.696 个百分点。这组对比是 OpenBMB 自己的消融实验,发布页面没有给出独立验证。Ultra-FineWeb-L1 定位为数据平台 UltraData 的 L0–L4 分层框架中的 L1 过滤层,同一发布说明还提到,由 Ultra-FineWeb 分类器选出的 L2 子集 Ultra-FineWeb 同步发布。
六个快照、2.83TB、1,144,984,860 行
数据按 Common Crawl 快照组织,每个 dump 一个目录,内部再切成若干 Parquet 分片(data/CC-MAIN-YYYY-WW/…)。每条记录含四个字段:uid(UUID4 文档标识)、content(清洗后的纯文本)、meta(JSON 编码的来源与处理元数据,含 url、language、language_score、warc_record_id、warc_date、source_file)和 dataset_index(数据来源标识)。Hugging Face 页面显示,数据集共 1,144,984,860 行,总大小 2.83TB,核验时近月下载量为 148 次。
许可是 Apache 2.0,页面在许可条款下追加了一条再分发限制:未经原作者或组织书面许可,任何机构、组织或第三方平台不得直接转载、镜像、再托管,或以任何形式对项目产物做商业再包装和再发布。页面同时提醒,语料源自网络内容,使用者还需遵守原始网页各自的权利、许可与条款。
六步清洗:从 trafilatura 2.0 到数据清洗 agent
Ultra-FineWeb-L1 在 FineWeb 处理管线的基础上构建,每个 Common Crawl dump 独立走完六步。
第一步是页面与正文提取:从 Common Crawl 保留有效 HTML 页面,用 trafilatura 2.0 抽取纯文本,剔除评论、导航栏等非正文内容。相比 FineWeb 管线,正文提取工具升级到了 trafilatura 2.0。第二步用 fastText 做语言识别,只保留高置信度的英文文档。第三步是启发式过滤,沿用 FineWeb 的思路处理重复内容、低质量文档、样板文本和异常行结构。
第四步做敏感字段替换,把识别出的邮箱、IP 地址、电话号码、身份证号和信用卡号替换成合法占位符。第五步是 MinHash 去重,与 FineWeb 一致,只在每个 dump 内部识别近似重复文档,不做跨集合去重。第六步是定制清洗,用 UltraData 的数据质量检查工具和数据清洗 agent 优化清洗规则,针对残余 HTML、编码损坏与乱码、不可见字符、损坏内容、异常文档长度做定向处理。
0.635 与 0.696 个百分点是怎么测出来的
评测沿用 FinePhrase 的评测设置和 FineWeb 的消融方法:12 个基准、六个类别、3-shot、单一随机种子。大多数任务采用 Cloze Format,把评测构造成下一 token 预测,页面称相比标准多选题,这种方式能减少小模型受指令跟随和答案格式的干扰,评测信号更稳定。12 个基准是 ARC、MMLU Redux、SQuAD v2、DROP、OpenBookQA、XCSQA、WinoGrande、PIQA、HellaSwag、GSM8K、WikiTableQuestions 和 TriviaQA。
对照实验选了 CC-MAIN-2025-26(这是 FineWeb v1.4 覆盖的最新 Common Crawl 快照),两组数据出自同一快照,分别过 FineWeb v1.4 和 Ultra-FineWeb-L1 两条管线。两组都用 MiniCPM5-1B 训练 20B tokens,设置完全相同:32 张 GPU、micro batch 16、global batch 512、Muon 优化器、初始学习率 0.000522、最低学习率 0.0000522。
训练结束时,FineWeb 的宏平均、微平均为 9.033%、8.484%,Ultra-FineWeb-L1 为 9.668%、9.180%。再把 L2 选择加入对比:Ultra-FineWeb-from-FW 达到 9.954%、9.414%,Ultra-FineWeb-from-L1 达到最高的 10.379%、9.798%,页面据此称 L1 清洗与后续质量选择带来互补收益。
在 UltraData 的 L0–L4 阶梯上,L1 只是入口
UltraData 是 OpenBMB 的,2026 年 2 月 8 日上线时引入 L0–L4 分层数据管理框架。Ultra-FineWeb-L1 在其中承担通用网络数据的 L1 过滤层,为后续的 L2 选择和 L3 精炼打底。
L2 是 Ultra-FineWeb:由 fastText 分类器(2025 年 6 月 16 日上线的 openbmb/Ultra-FineWeb-classifier)选出,含约 1T 英文 tokens 和 120B 中文 tokens。其英文部分基于 FineWeb 构建,中文部分来自 IndustryCorpus2、MiChao、WuDao、SkyPile、WanJuan、ChineseWebText、TeleChat 和 CCI3 八份语料,详见 。L3 是 Ultra-FineWeb-L3,通过 Q&A 对生成和多风格改写精炼,含 400B+ 英文 tokens、200B+ 中文 tokens,2026 年 5 月 28 日发布,页面称这是据其所知最大的开源中文预训练合成语料。
这条数据线的历史可以追溯到 2025 年:5 月,技术报告《Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data》(编号 2505.05427);5 月 15 日 Ultra-FineWeb 登上 Hugging Face 数据集趋势榜第一;6 月 6 日 Ultra-FineWeb-en/zh 随 MiniCPM4 系列发布;2026 年 5 月 25 日,面向端侧场景的密集 1B 模型 MiniCPM5-1B 发布,Ultra-FineWeb 已是其核心预训练网络数据,本次评测用的正是这个模型。
与 FineWeb 的对照也点出了 L1 的差异:FineWeb v1.4 覆盖到 CC-MAIN-2025-26,Ultra-FineWeb-L1 覆盖到 CC-MAIN-2025-51。页面称,据其所知,这是覆盖最新 Common Crawl 快照的开源网络预训练语料。
发布后 12 小时:122 次点赞、3 条回复
截至 8 月 21 日核验时,这条推文获得 122 次点赞、21 次转发、50 次收藏,浏览量约 4000 次,回复 3 条、引用推文 1 条。
三条回复都是概括性肯定。自称 AI(SaaS)增长专员的 Aaliya 写道:"Open access to data like this can help many AI builders." 自称 AI 教育者的 Alice The Ai Expert 写道:"Better data, better models. The future of LLMs just got a boost." 唯一一条引用推文来自自称阿育王大学计算机专业学生、从事 ML 研究的 Dhruman Gupta,只有一个词:"Nice"。
0.635 和 0.696 两个百分点的依据,目前只有 OpenBMB 自己的消融实验。在社区用相同设置跑完复现之前,这份成绩单只能当作作者声明来读。