AREX Feed Article
Periodic Labs 发布 Neon:用 1,300 张 H200 后训练开源模型,称在内部材料分析基准上超过 GPT-6 Astra
9 月 15 日(北京时间 9 月 16 日凌晨),Periodic Labs 的 Liam Fedus 在 X 上宣布:公司只用 1,300 张 H200 GPU,加上数月的自有实验数据,对一个开源模型做了 mid-training(中期训练)与强化学习(RL),训练出材料分析模型 Neon;他称 Neon 在公司的分析基准上超过了 GPT-6 Astra。
这次发布还包含三篇博客:、与。公告称 Neon 是一个 1 万亿参数模型,已经部署进 Periodic 位于 Menlo Park 的高通量实验室,负责分析实验数据;研究博客给出了任务细节:Neon 要解读 X 射线衍射(XRD)图谱,判断一次合成实验到底做出了什么。
实验、模型与决定下一步的闭环
Fedus 是 Periodic Labs 的;他的显示,他曾任 OpenAI 后训练副总裁(VP of Post-Training)。他在里把 Neon 拆成三块:实验室、研究、基础设施;他还称 Neon 是一个早期样本:独有实验数据与高效基础设施,能用相比前沿系统更有限的算力训练出表现出色的专用科学模型。
按他的描述,Menlo Park 的实验室产出新数据,模型从中学习,再帮团队决定下一步试什么;帖子附了一段视频,他称那是「来自我们实验室的真实画面」。Periodic Labs 当天补充:过去一年,他们在搭建高通量实验室和面向大规模物理实验的基础设施,寻找更好的超导体与磁体;「最初的实验是我们手工跑的,现在实验在实验室里连续运行」。
公告还把材料发现描述成三段循环:先基于稳定性与性质的预测判断该做什么,再预测怎么合成,最后弄清实际得到的是什么、是否具备想要的性质;判定结果修正假设,进入下一轮。Fedus 说,他们最先关注的是超导体、磁体和半导体材料。
一道要做几小时的衍射分析题
Neon 要读的图谱来自粉末样品:X 射线打上去,仪器测量它如何散射;晶体中原子的周期性排列让每个晶相产生一组特征峰,峰位反映晶格间距与晶体对称性,强度取决于有哪些原子、各占多少。研究博客指出,合成实验的产物往往是目标相、未反应原料和意外副产物的混合物,多相图谱互相重叠,连专家也难分辨。
一次成功的 XRD 分析要综合合成条件、以往实验、热力学计算和晶体结构数据库;研究博客说,复杂样品的解读可以花掉专家几个小时,在有公认解的图谱里,平均每个拟合包含五个相。随着实验室规模化,人工解读已经跟不上实验产出的速度,公司称自动化能把科学家的时间腾出来,去监督更多实验。
FrontierXRD:134 个样本上的 55.3%
公司称 FrontierXRD 是其最难的内部评测集:134 个样本全部来自 Periodic 自己的实验室,是连人类专家也要花数小时才能解决的复杂多相案例。评分交给一套由 Opus 5 与 GPT-5.6-Sol 组成的 LLM(大语言模型)评委集成,评委口径先与专家评分做过校准;所有参与对比的模型都跑在同一套 Periodic 自研的 harness(运行框架)上。
在这套评测里,Neon 的成功率是 55.3%,被后训练的基座模型在起点上的成功率是 2.7%,公司称提升约 20 倍。公司披露,Neon 对 GPT-6 Astra 与 Claude Fable 5.1 都取得了更高的成功率与更低的单次分析成本,处在成本与性能的帕累托前沿上。
成本口径也一并公开:外部模型按标准 API 价格估算(假设多轮 agent 调用可以完美命中缓存),Neon 按每 H200 小时的系统吞吐折算,H200 价格按每小时 2.5 美元计。
公司还做了一个泛化测试:用 198 条来自未被纳入 mid-training 与 RL 的化学体系的实验室 XRD 数据考 Neon,它同样超过了这些前沿模型;研究博客同时说明,这一测试比 FrontierXRD 容易。博客还附了交互式演示,可以看到 Neon 对三个样例图谱的推理过程。
mid-training、RL 与一个当评委的 LLM
Neon 的起点是开放权重模型 Kimi K2.6。第一步是科学 mid-training:把学术文献、代码与实验数据混成多模态语料继续训练,建立更广的科学理解;公司称这套专有语料目前每月翻倍,早期的消融实验显示,mid-training 提高了后续 RL 阶段的奖励与 FrontierXRD 成功率。
RL 的难题是奖励从哪来:XRD 分析的对错无法靠拟合质量廉价验证,还要靠专家判断每个相是否被图谱支持、化学上是否合理。公司的做法是把专家判断做成一套带推理的 LLM 评委:先请一批材料相关专业的博士专家按详细评分标准标注数千张图谱(每张由三位专家标注),再比对一致性,专家彼此的一致率为 77.2%,LLM 评委集成与专家的一致率为 74.6%,与专家共识的一致率为 84%。
工具层也有一组对照。Periodic 的 harness 配备实验室上下文、内部材料结构与模拟数据库以及 XRD 分析软件;同一模型(Claude Opus 5,高推理强度)下,这套 harness 在 FrontierXRD 上的成功率是 Claude Code 加标准开源数据库(COD、Materials Project)与软件(BGMN)这一组合的 3.8 倍,成本相近。
训练、推理与沙箱的效率改造
基础设施博客披露,Neon 的最终训练跑在 mid-training 与 RL 两个阶段的峰值用量是 1,300 张 H200,公司称集群利用率保持在 95% 以上。研究博客还给出一个对照:Astra 的训练算力据报超过 10 万张 Blackwell GPU。
为了把每个 GPU 小时用足,Periodic 在开源栈上做了大量改造:在相同 GPU 上,训练吞吐是 Megatron 基线的 4.1 倍;对 SGLang 的贡献让推理提速,相同批量下 1 万亿参数模型的解码速度从每请求每秒 10 个 token 提到 25 个 token;把 Megatron 检查点转成推理格式的时间从 30 分钟压到 1 分钟。
在 64 张 GPU、64K 上下文条件下,这些优化把显存峰值需求从 320 GB 压到 132 GB,使 Kimi K2.6 能在 64 张 H200 上做全参数训练。
他们还为 RL 自建了沙箱 pbox,起因很具体:最早的 RL 循环把训练、推理与模型自己写的代码混在一起跑,直到模型写出一段申请 80 GB 内存的代码,导致整个任务失败。pbox 跑在 Slurm 已分配节点的空闲 CPU 上;与测试过的一家领先托管沙箱服务相比,1 MiB 文件往返速度(p50)快 4.5 倍,总吞吐是对方的 3.3 倍。
这些改进中不少被贡献回了上游:Megatron-LM、SGLang、Miles。
回复里的祝贺与追问
发帖约一个半小时后,PyTorch 联合创始人 Soumith Chintala 在回复里写道:「这真的令人印象深刻,祝贺 @periodiclabs 的各位搭起了完整的物理反馈闭环」()。
也有人追问 Fedus 说的「开源模型」到底是哪一个()。研究博客给出了名字:Kimi K2.6。
按公告,公司正在扩展这一方法,训练 AI 去主导科研活动、开发合成流程,并决定下一个实验做什么。而「超过 GPT-6 Astra」这项对比,从基准、评测流程到成本口径,目前都出自 Periodic 自己的披露。