AREX Feed Article
Gensyn 发布 open-1b:自称业界首个可审计 AI 模型,公开 80,957 步训练证明供跨硬件逐位核验
9 月 15 日,Gensyn 发布公告,宣布推出语言模型 open-1b,并称其为「业界首个可审计 AI 模型」。公告对「可审计」的定义是:同时交付模型、训练配方与可验证证明,让第三方可以独立审计训练的任意阶段——在自己的硬件上逐位(bit-for-bit)重放训练步骤,并与公开的哈希比对。该公告经 发布, 等平台转载;「首个」「可审计」均为 Gensyn 的单方表述。
伴随发布公开的显示,这次训练共 80,957 个优化步、810 个区段(每区段 100 步),每一步的状态哈希都已提交。截至 9 月 16 日本文核验时,记录里已有 11 个步骤的重放结果被接受,全部处于临时(provisional)状态;810 个区段没有一个完成确认。
交付物:一个 1.61B 模型、完整数据集和每步哈希
按 的说明,open-1b 是一个 24 层、仅解码器(decoder-only)架构的模型,总参数 1.61B,其中非嵌入参数 1.08B,训练序列长度 4,096,采用 int8 量化感知训练(W8A8,LSQ)。预训练消耗 4,000 亿 token,数据来自 DCLM-Baseline、FineWeb-Edu、The Stack v2、Proof-Pile-2 四个开放许可语料;之后又在 Dolma 3 混合数据上做了 930 亿 token 的中期训练(mid-training)。
这次发布的清单包括: 上基础、mid-training、指令微调三款检查点(Apache 2.0 许可);完整预训练数据集及检索工具;;每 100 步一个的中间检查点(含完整优化器状态);全部 80,957 步的状态哈希;一个在消费级硬件上重放训练步骤的;以及一份 29 页的。
Gensyn 在博客里用一张「开放谱系」图给自己定位:闭源模型只给输出;开放权重模型给权重;开放配方模型给权重和配方;「可审计」这一档则给出模型、配方和证明,核验方式是「任何一步,在你自己的机器上」。这张图的分类与举例(ChatGPT、Claude、Llama、OLMo)都由 Gensyn 自己给出。
Gensyn 联合创始人兼 CEO Ben Fielding 在公告中说:「可审计 AI 意味着模型的决策不必来自 Anthropic 或 OpenAI 模型那样的黑箱」。公告称,这套工具让人可以检查塑造模型的数据、逐步核验训练过程,并理解模型为何得出某个结论。技术报告使用的说法是「首个完全可审计的开源 LLM」,博客的说法是「没有实验室交付过的东西」。
换一块硬件就对不上:浮点加法不满足结合律
按 Gensyn 技术报告的解释,只开放权重和配方仍不足以支撑核验,问题出在浮点数。浮点加法不满足结合律:同一组数字改变相加顺序,末几位结果就会不同,而 GPU、CPU 乃至不同代 GPU 的相加顺序都不一样。常见框架的「确定性模式」只保证同一台机器上重复运行结果一致;换一块硬件,发布的检查点就无法与训练方声称的结果逐位对上。即便训练方完全诚实,别人也无法精确复现,因而无法核验。
Gensyn 的解法是给训练全程规定固定的执行顺序。RepOps 是它的可复现算子库:固定求和的归约顺序,统一「乘加」运算的约定,让次正规数(subnormal)在所有硬件上得到一致处理,并用基于计数器的随机数发生器保证同一索引得到同一份随机数。数据侧,训练数据被定义成一条只取决于随机种子和语料、与集群规模无关的规范流:48 张 GPU 的集群和一台笔记本会按相同顺序枚举出相同的训练窗口。通信侧,确定性集合通信替换了厂商实现,使单台设备可以逐个重放集群里每张 GPU 的前向与反向计算,得到与集群一致的梯度。
落到审计上,每一步都会生成一个状态哈希,把上一步的哈希、数据批次摘要、模型权重、梯度、优化器状态五项绑定在一起;哈希链让记录具备防篡改性质,每个区段的哈希还汇总为 Merkle 根(哈希树根哈希),并可为任一步生成包含证明(inclusion proof)。审计流程因此很直接:挑一步,加载它之前的检查点,重放这一步,把算出的哈希与已公布的哈希比对。博客把这一设计概括为:训练仍以中心化方式完成,但把模型验证搬到了去中心化节点上,以避免去中心化训练自身的前期成本和通信问题。
Gensyn 在博客中强调,可审计性无法事后加装:这套核验工具不能用来审计 Llama 或 GPT,可证明性必须从训练第一步就设计进去。技术报告同时写明这种审计的边界:它不消除模型中的偏见,但可以让审计者对模型中可能存在哪些偏见有确切把握。
已接受记录分布在 5 个区段,单步重放 0.5~19.2 小时
按每 100 步一个区段展示审计状态,最后一段 57 步。核验时,已接受的记录分布在 5 个区段,署名贡献者 4 个(adam、ben、ben2、Johnny,记录注明名字为自报);另有 7 条重放「认领」正在进行中,例如第 103 步与第 12,104 步。记录页写明:单步审计在所属区段完成确认之前保持临时状态;810 个区段仍全部开放。
所有被接受记录的时间都在 9 月 11 日至 14 日之间,早于 9 月 15 日的公开公告。这些重放跑在不同硬件上:NVIDIA H100 上的单步用时约 0.5~2.8 小时,Apple M5 与 M4 Pro 上为 8.6~19.2 小时。Gensyn 在博客中把核验设计成集体过程:单台笔记本做不完 80,957 步,但由许多台机器各认证一步,就能拼出完整记录。
可复现的代价:约 5% 的 MFU,基准低于 OLMo 2 1B
这次训练在 Google Cloud 的 6 个节点、共 48 张 H100 上完成,80,957 步消耗 4,000 亿 token;实际训练时间 27.8 天,日历跨度 29.5 天,全程因工程问题分成 7 段完成。技术报告写明:可复现运行时的模型 FLOPs 利用率(MFU)稳定在约 5%;博客称该运行时比同硬件、同配方的优化 PyTorch 栈慢约 5 倍,报告则称 MFU 比不可复现的优化算子低一个数量级。报告自己的总结是:用算力性能换可复现性。
在 OLMo 2 的评测套件上,open-1b 预训练检查点的开发基准平均分为 25.4,OLMo 2 1B 为 31.9;经中期训练后,open-1b 为 26.8,而 OLMo 2 1B 为 43.7(OLMo 2 1B 的训练 token 量约为 open-1b 的 10 倍)。Gensyn 在博客中表示,希望外界以「可验证性」而非模型能力来评判 open-1b,并承认由于可复现开销和资源限制,它在基准上落后。
转发来自团队与投资方,核验仍待外部参与
发布当天,Gensyn 在 X 上以「第一个你不需要信任的模型」为题宣布 open-1b()。公告推文的引用与转发中,可以看到公司团队与投资方的表态:联合创始人兼 CTO ,把任一检查点用自定义算子重跑,可在 NVIDIA 与 Apple 硬件上获得逐位一致的结果;Eden Block 创始人 open-1b 是「世界上首个可被第三方审计的基础模型」。Eden Block 出现在公告列出的投资方名单中,名单里还有 a16z crypto、CoinFund、Galaxy Digital、Maven 11 等。
博客把参与核验的回报写得很直白:没有报酬、没有代币、也没有排行榜积分,回报是把名字留在这条记录上。记录页上,剩余 80,946 步仍全部开放,等待重放核验。