AREX Feed Article
微软研究院放出 Skala 1.1:GMTKN55 夺 32 金,CP2K 先行接入
8 月 20 日,微软研究院官方 X 账号 宣布发布深度学习交换关联泛函 Skala 1.1(推文时间戳为 UTC 8 月 20 日 16:00,即北京时间 8 月 21 日 0 点)。给出这轮更新的核心数字:Skala 1.1 在化学基准套件 GMTKN55 的 55 个类别中拿到 32 个第一,加权平均误差 2.8 kcal/mol——按官方口径,这一精度超过当前领先的全局(远程分离)杂化泛函,计算成本仍维持在 meta-GGA 半局域泛函的水平。
博客标题《Broadening access to Skala creates a faster path to predictive DFT》与推文口径一致:推文称新版本「provides greater accuracy, expanded accessibility across the computational chemistry ecosystem, and a living benchmark to track computational performance」,即更高的精度、在整个计算化学生态中更广的可及性,以及用于追踪计算性能的活基准。具体到行动上,微软研究院宣布 Skala 现已接入开源量子化学软件 CP2K,Psi4、FHI-aims、ORCA、VASP 四个软件包的集成正在进行;性能追踪则落在上。Skala 是微软研究院 AI for Science 团队开发的神经网络交换关联泛函,用于 Kohn-Sham 密度泛函理论(DFT)计算;DFT 是官方博客所称的化学、材料科学、催化、能源技术和药物发现等工作流背后的计算引擎。
GMTKN55 夺 32 金:2.5 倍数据换来的精度
按照微软研究院的说法,Skala 1.1 是 Skala「连续改进」路线的第一次完整展示:新模型比首个公开版本多训练了 2.5 倍的数据,在主族热化学、反应动力学和分子结构预测等关键任务上精度显著提升。官方博客用「泛函动物园」对比来解释这条路线:传统上,新泛函不断累积、并不淘汰旧泛函;Skala 则让每个新版本取代上一版本,在数据、架构和训练策略改进的同时保持相同的实际计算成本。
精度提升的数据基础是微软研究院的 MSR-ACC(Microsoft Research Accurate Chemistry Collection)高精度参考数据集合。官方称,Skala 1.1 的训练数据新增了电子亲和能、非共价团簇等类别,在扩大数据规模的同时增加了多样性。除能量外,官方还宣称 Skala 1.1 能给出高精度的电子密度、偶极矩和分子几何。模型本身不大:显示其约 38.5 万参数,推荐使用的 skala-1.1 采用逐原子打包网格、多个非局域层和对称收缩;架构示意图显示,输入包括密度 ρ、密度梯度模 ‖∇ρ‖ 和动能密度 τ 等 meta-GGA 特征,经逐点处理后,在原子处的粗网格上进行非局域消息传递。旧版 skala-1.0 的 traced 模型仍可通过 load_functional("skala-1.0") 加载。在「风险与局限」一节写明:这不是生产模型,建议研究人员在应用前进一步测试。
CP2K 已可用,Psi4、FHI-aims、ORCA、VASP 在途中
可及性这轮的主角是软件生态。微软研究院宣布,Skala 已与 CASUS 研究中心(Center for Advanced Systems Understanding,Thomas D. Kühne 教授团队)合作完成 CP2K 集成。CP2K 是有 25 年以上历史的开源软件,擅长大规模体系与长时程分子动力学模拟。为验证集成质量,双方开发了一套集成测试套件,在 GMTKN55 代表性子集上,CP2K 与 PySCF 两种实现的平均绝对偏差(MAD)在 0.1 kcal/mol 以内,只有一个对应挑战性自由基体系的离群点;相关实现细节见双方联合论文《Molecular Implementation of the Machine-Learned Skala Exchange-Correlation Functional in CP2K through GauXC》。
其余四个软件包的进度并不相同:开源包 Psi4 的集成「正在积极进行」,官方称与 PySCF 版社区版配合后,Skala 将出现在三个主流开源量子化学包里;FHI-aims、ORCA、VASP 则属于「与开发者紧密合作、目标是广泛可用」的阶段。此前的分发通道仍然保留:Skala 通过 PySCF、GPU4PySCF 和 ASE 提供社区版,GitHub 仓库采用 MIT 许可,README 同时列出 Azure AI Foundry 上的模型服务,模型也托管在 Hugging Face 上。
「快不快」被做成了一份持续更新的报告
性能基准是这轮发布里最具体的新机制。微软研究院推出了一个基准测试工具(benchmarking harness)和一份持续更新的性能报告(living performance report),放在 上,会随新优化不断更新。报告覆盖 H2 到约 400 个非氢原子的分子规模,硬件从 2 线程 CPU、16 线程 CPU 到 NVIDIA A100 GPU,并与 r2SCAN(meta-GGA 非杂化)、B3LYP(GGA 杂化)和 M06-2X(meta-GGA 杂化)三种传统泛函对比。
报告的核心结论与官方博客一致:GPU 上 Skala 的计算成本与 meta-GGA 非杂化泛函相当;CPU 上小分子约有 10 倍于 meta-GGA 的开销,但在约 15–20 个非氢原子(约 500 个原子轨道)之后消失。基准的用途有两端:对实现者,可以用它验证自己的 Skala 实现是否达到参考水平;对使用者,可以用它预估自己体系的计算成本。报告记录的软件版本为 Skala 2026.9、PySCF 2.10.0,还附带了进程冷启动、首次评估开销等细节说明。
一条与「泛函动物园」相反的路线
Skala 1.1 是这条路线上的第二步。2025 年 6 月 17 日,微软研究院 AI for Science 团队在 《Accurate and scalable exchange-correlation with deep learning》(Luise et al.)介绍 Skala;GitHub 仓库创建于 2025 年 6 月 5 日,此后以社区版形式开源。论文开篇的论述是:DFT 预测的可靠性受限于对未知交换关联泛函的近似,传统改进路线依赖越来越复杂的手工设计泛函形式,由此产生精度与效率的长期权衡;Skala 用可扩展的神经网络直接从数据学习非局域表示,绕开这些越来越昂贵的手工特征。论文中的关键数字与这次发布相同:GMTKN55 上 2.8 kcal/mol 的误差、超越主流杂化泛函的精度,同时保留半局域 DFT 的低计算成本。训练数据方面,MSR-ACC 的原子化能子集是与澳大利亚新英格兰大学的 Amir Karton 教授合作、用 W1-F12 复合协议(基于 CCSD(T))生成的,模型卡还列出了 NCI-Atlas、GDB9、BH9 等公开数据集。2026 年 8 月发布的 1.1 版本被官方描述为「连续改进范式」的首次验证——同一个模型家族靠数据扩张与训练改进迭代,而不是引入越来越昂贵的手工设计特征。
社区的第一批问题:QE 和 ABINIT 什么时候接入?
截至本文检索时,发布推文获得 93 个赞、23 次转发,但评论区已经出现对下一步的追问。用户 在推文下直接问「When QE and Abinit?」,即开源平面波代码 Quantum ESPRESSO 和 ABINIT 何时支持;用户 则表示此前只用势函数做分子动力学,「肯定会试试这个」。微软研究院目前只确认了五个软件包:CP2K 已经可用,Psi4、FHI-aims、ORCA、VASP 在集成中,对 QE、ABINIT 和其他代码的排期没有给出任何时间表。精度、生态、性能三条线里,这是唯一没有明确时间表的变量。