AREX Feed Article
ORNL 与 IonQ、NVIDIA 联合研究称,生成式 transformer 直接生成量子优化电路,100 变量基准上单轮耗时稳定在约 28 秒
9 月 16 日,IonQ(NYSE: IONQ)发布,介绍了一项由 Oak Ridge National Laboratory(ORNL)主导、与 IonQ、NVIDIA 和田纳西大学诺克斯维尔分校(University of Tennessee, Knoxville)合作的研究:训练过的生成式 transformer 可以直接生成量子优化电路,跳过传统方法里「跑一遍、测一次、改参数、再跑」的试错调参循环。论文在本周的 IEEE Quantum Week 2026 上展示(会议 9 月 13 日至 18 日在多伦多举行),编号 。
论文报告的直接对照来自一个 100 个决策变量的密集高阶基准。IonQ 称,此前的 DQAOA 方法在子问题规模从 4 增到 12 时,电路寻优耗时从约 34 秒升到超过 11 分钟;团队在中给出的数字是 33.80 秒和 683.99 秒。生成式方法在测试过的每个规模上都维持在约 28 秒。
被替换掉的那一环
IonQ 的新闻稿把流程写得更具体:混合量子优化把大问题拆成小块,逐块求解再合并结果,而每一块都需要一条定制的量子电路。传统做法靠试错调参把这条电路调出来,流程是运行、测量、调整参数、重来,往往重复数百次。块越大,答案通常越好,调参开销同步上升,两者构成一道取舍。
论文里被替掉的环节更具体。作为对照的 DQAOA 依赖迭代式变分优化:处理每个子问题时,都要反复执行量子电路、更新经典参数。研究中用来生成训练样本的 ADAPT-QAOA 还要更贵一层:它按能量梯度的幅度从算子池里挑算子,每插入一个算子,就要对全部变分参数做一次全局重优化。论文把「DQAOA 拆解+生成式电路综合」这套组合命名为 DQAOA-GPT。
教材是保留下来的近最优电路
为了让模型学会写电路,团队先用传统方法造训练数据:对大量随机采样的子问题跑 ADAPT-QAOA,只保留达到质量阈值的近最优电路,再把子问题和电路分别序列化成 token,用预测下一个 token 的方式训练一个 decoder-only transformer。IonQ 的描述是,这与大型语言模型属于同一类模型,只是训练数据从文本换成了电路。
在模型输入侧,子问题的线性、二次与三次交互项以「索引+系数」token 的形式直接给出;一套 201 个取值的共享系数词表,同时用于表示问题系数和电路里的参数。子问题还会被投影成一张带权图,由 FEATHER 图嵌入提供额外的结构描述。论文专门作了一个说明:图投影只是粗粒度的结构摘要,不是对高阶目标的精确降维,精确的交互系数仍单独输入模型。
推理时抽 10 条候选,只接受让全局能量下降的更新
到了推理阶段,模型直接给出候选电路,不再回到参数优化循环。论文报告的设置是:每个子问题的每一轮抽样 10 条候选电路,采样温度 0.8,10 条全部模拟并打分,取能量最低的一条用于更新全局解。
更新规则是贪心的:只有当候选解让原问题的总能量下降时才会被接受,因此迭代过程中全局能量不会上升。这条规则也是生成式电路能被放进优化主循环的前提:单条电路不必都好,只要候选里能挑出更好的那次更新。
论文界定的耗时口径是完整的单轮推理流水线:图投影、FEATHER 嵌入计算、GPT token 生成、用 CUDA-Q 模拟全部 10 条候选电路,以及候选比特串的 HUBO 能量评估,而不是只算最后被采纳那一条电路的执行时间;训练开销不计入这套口径。
两条曲线:精度接近,耗时走势分叉
基准问题有 100 个决策变量、交互密集,并包含三次交互项,设定受材料优化场景启发,相对精度所用的参考解取自此前一篇分布式量子优化工作给出的最好已知结果。子问题规模从 4 到 12(IonQ 的表述是 4 量子比特到 12 量子比特),两种流程跑在同一块 GPU 上:ORNL 的 Defiant2 系统里的单块 NVIDIA H200,电路模拟走 NVIDIA CUDA-Q,后端是 cuQuantum。
精度方面,论文图 3(a) 中两条曲线随子问题变大都在上升:子问题规模为 4 时,DQAOA 的相对精度是 0.38,DQAOA-GPT 是 0.36;到规模 12 附近,两条曲线都落在 0.75~0.78 区间,误差棒大幅重叠。IonQ 把生成式方法这一段的趋势概括为「模型生成的答案质量大致翻倍」。
耗时方面,DQAOA 从 33.80 秒涨到 683.99 秒,DQAOA-GPT 在每个规模上都维持在约 28 秒。IonQ 称,两套流程跑在完全相同的 GPU 加速环境上,因此比较是受控的,差异主要来自 DQAOA-GPT 用生成式电路综合加固定次数的候选评估,替换掉了迭代式变分参数优化。IonQ 的新闻稿同时说明,两种方法都是量子方法,这项研究比较的是电路生成方式,不涉及量子求解器与经典求解器的对比。
全在模拟器上完成,每个子问题规模各训一个模型
论文里的每一条电路都是模拟执行的,没有跑在量子硬件上:全部计算在 ORNL 的 Defiant2 系统上用 CUDA-Q 完成,模拟后端是 NVIDIA cuQuantum。论文摘要把这项工作定位为「基准规模验证」,并把框架描述为通向更大规模 HPC-QC 环境组合优化的一个基础;IonQ 的新闻稿沿用了这一定位。
单块 GPU 的配置是为公平比较而设。论文指出,各子问题彼此独立,框架天然可以跨多块 GPU、多个节点并行,并行执行预计能进一步压低总运行时间,但这部分被列为后续研究。
还有两处成本不在论文给出的推理耗时口径内。其一,训练数据本身来自被替换掉的 ADAPT-QAOA 循环,模型学到的是这些近最优电路的分布;其二,每个子问题规模对应一个单独训练的模型,子问题规模改变,就要重新训练。
最佳论文奖,与 ORNL 说出的下一步
把这篇论文列为 Quantum–GenAI Co-Design & Co-Discovery(QGDD)轨道的第 3 名,列出的作者与论文一致。IonQ 在 9 月 15 日的中称,公司在本届会议共获得四项最佳论文奖,论文从 857 份投稿中选出,会议共评出 27 项最佳论文;9 月 16 日的新闻稿则说,这篇论文是 IonQ 在本届会议上被接收的九篇论文之一。ORNL 主导了这项研究,作者分别来自 ORNL 国家计算科学中心与材料科学与技术部、IonQ、NVIDIA 和田纳西大学诺克斯维尔分校,其中 Abhinav Rijal 是田纳西大学物理与天文系的研究生。
IonQ 量子应用研发副总裁、论文共同作者 Martin Roetteler 把传统代价称为「调参税」:「在混合量子优化里,更好的答案传统上都伴随着高昂的调参代价。在这个基准上,生成式 AI 取代了迭代调参循环,而且随着量子子问题变大,解的质量在提升。把这笔开销拿掉,你就能在答案真正有意义的规模上工作。」他称,这个结果为混合量子优化的规模化提供了一条潜在路径。
论文作者、ORNL 国家计算科学中心的 In-Saeng Suh 与 Seongmin Kim 表示,这项工作把生成式 AI、量子计算和高性能计算放在一起处理大规模复杂优化问题,AI 可以成为量子电路综合的一个新计算层。两人说:「我们正在把这一框架推广到真实的科学与工程应用,并在更大的 HPC 系统上扩展,以处理规模和复杂度更高的问题。」
NVIDIA 量子产品总监 Sam Stanwyck 的表态落在工具链上:「让开发者从一开始就构建以 AI 为核心的量子算法,像 CUDA-Q 这样的工具正在为量子计算及其应用的下一代进展打下基础。」
IonQ 在新闻稿的前瞻性声明中,把「这些方法未来在量子硬件上执行」列为预测事项之一。