AREX Feed Article
微软 Skala 泛函上线 CP2K:CASUS 确认精度跃升、效率保持
微软研究院 AI for Science 开发的 AI 交换关联泛函 Skala,现已通过开源计算化学软件 CP2K 开放使用,研究者可以在 CP2K 中对更大的分子体系做量子力学模拟,并获得更高精度。微软研究院在(8 月 20 日)与(8 月 21 日)先后宣布此事,了相关进展。
支撑"更高精度"的最具体数字来自 CASUS 与微软团队 8 月 19 日发布的:在 dietGMTKN55 基准上,CP2K 中 Skala-1.1 实现的聚合平均绝对偏差(MAD)为 1.255 kcal/mol,与 Skala 参考值 1.235 kcal/mol 只差 0.020 kcal/mol。微软博客补充的跨代码一致性检验显示,CP2K 与 PySCF 两种实现之间的 MAD 差在 0.1 kcal/mol 以内。CASUS 主任 Thomas D. Kühne 说,CASUS 是"微软之外第一个确认 Skala 收益的团队"。
Skala 模型计算出的苯分子交换关联(XC)能量密度:内环是六个碳原子,外环是六个氢原子,能量密度最高的环状区域集中在碳原子周围(图片来源:F. Pöschel/CASUS,)。
微软之外第一个确认收益的团队
按新闻稿的说法,微软研究院与 CASUS 的 CP2K 团队于 2026 年初启动集成工作;当年春天,微软研究院在一个会议上预告了这次集成,此后社区"定期来问进度"。CASUS 科学计算核心(Scientific Computing Core)的首席作者 Franz Pöschel 回忆:"虽然我们对这种关注感到高兴,但也感到了交付的压力。"
8 月中旬,双方公布了首批合作结果。Pöschel 说:"我可以确认,在我们这个具体测试案例中,Skala 让模拟精度有了明显的跃升(a noticeable leap in the accuracy)。"预印本作者来自 CASUS 与 HZDR(Pöschel、Johann Pototschnig、Frederick Stein、Andreas Knüpfer)、微软研究院 AI for Science(Thijs Vogels、Stefano Battaglia、Sebastian Ehlert)以及苏黎世大学(Jürg Hutter),Kühne 为通讯作者。
Kühne 解释 CASUS 接这个项目的原因:"微软研究院 2025 年展示的结果令人印象深刻,尤其是某些 DFT 计算中精度与计算效率的结合。我们看到了在 CP2K 里评估这一方法、理解它对我们社区相关问题适用性的机会。"
神经网络怎么让电子密度"互相影响"
密度泛函理论(DFT)在 1998 年获得诺贝尔奖,是许多模拟应用的基石。Kühne 对它的核心短板有一句直白概括:"DFT 的'阿喀琉斯之踵'是所谓的交换关联泛函(exchange-correlation functional)。"近年来为 DFT 开发的交换关联泛函越来越精细,但最精确的那些计算量太大,只能用于粒子数很少的体系。
Skala 换了个做法:训练一个神经网络去学习"不同区域的电子密度如何相互影响",而不是再引入一层数学公式。新闻稿称,这使它成为最早可用的 AI 交换关联泛函之一。
预印本把机制写得更具体:Skala 是一个学习的增强因子泛函(learned enhancement-factor functional),输入是 meta-GGA 式的局域特征——自旋密度、密度梯度、动能密度——但最终的增强因子并非局域量:原子分区的网格消息会把不同积分点的信息耦合起来,再生成增强因子。
Skala 也在持续迭代。微软博客称,Skala 1.1 的训练数据是第一版公开版的 2.5 倍,在 GMTKN55 基准(55 个化学问题类别)上取得 2.8 kcal/mol 的加权平均误差,并在其中 32 个类别排名第一,超过当下最好的全局(range-separated)混合泛函。
微软把这种"每个新版本取代旧版本"的做法,与传统"泛函动物园"(functional zoo)式的积累区分开。
密度矩阵进 GauXC,能量、势和力回 CP2K
集成工作的技术核心是接口。按预印本的描述,CP2K 向外部库 GauXC 提供几何、高斯基组、自旋分辨的原子轨道密度矩阵和 MPI 通信子;GauXC 负责构建分子积分网格、评估 XC 能量、原子轨道势矩阵以及可用的核导数,再返回 CP2K。
接口同时接受全电子和价电子密度矩阵——后者来自 GTH 赝势或分子有效芯势(ECP),这让 def2 基组下的重元素计算也能走同一条路径。
验证分两步。先用 Perdew–Burke–Ernzerhof(PBE)泛函把经 GauXC 的路径与 CP2K 原生实现对比,把实现误差与泛函本身的差异隔离开;再对 Skala 做有限差分能量检查、力验证和分子 virial 诊断。
微软博客补充说,双方为 Skala 建了一套集成测试(integration tests),确保"在不同程序与设置下,Skala 的精度和速度保持一致",并给出数字正确的结果。
微软研究院 AI for Science 高级研究员 Sebastian Ehlert 解释为什么优先选 CP2K:"要提高采用率,Skala 应该出现在社区已经工作的地方。CP2K 多年来一直是计算化学研究的基石,自然是集成的优先对象。"
混合泛函的精度,meta-GGA 的价格
微软给 Skala 的定位是:精度对标最贵的全局混合泛函,成本按半局域泛函计。预印本引言中的表述是,Skala 在主族化学上达到与先进混合泛函相当的精度,成本更接近半局域 DFT。
Skala 1.1 与 r2SCAN、B3LYP、M06-2X 在 A100 GPU 与 CPU 上的 SCF 迭代耗时对比(图片来源:Microsoft Research 博客)。
微软博客给出的实测是:在 GPU 上,Skala 1.1 的成本与 r2SCAN 相同,体系超过约 1000 个轨道后,混合泛函反而更贵;在 CPU 上,Skala 对小体系有一定开销,分子超过 20-30 个原子后开销消失。
为了跟踪性能随版本的变化,微软还发布了"活的性能报告"(living performance report)和基准测试工具,供各软件包开发者验证自己的 Skala 实现。
能算上万原子的 CP2K,下一步是固体与液体
CP2K 是开源的 DFT 计算平台,主打大体系、长时间尺度的动态模拟。按新闻稿的说法,它依靠高效算法和并行机制,能处理数千到数万原子的体系,常用于电池材料、催化剂、半导体和蛋白质研究。
最近,CP2K 还加入了用 AI 模型预测分子能量与力的功能;微软博客则强调它有超过 25 年的开发历史。
对 Skala 而言,接入 CP2K 只是第一步。新闻稿称,Skala"不是一个静态近似",接下来将支持周期固体(金属、半导体)和液体的模拟;微软博客还披露,Skala 正在集成进 Psi4、FHI-aims、ORCA 和 VASP。
Kühne 的预期是:"微软研究院对研究伙伴要求很高。我们相信,在初步成功之后,这次合作会带来更多成果。"目前开放的仍是分子体系模拟,周期固体与液体的支持,是这份路线图里尚未兑现的下一项。