AREX Feed Article
腾讯混元发布 EvolveScaler,论文报告最难档 14 个模型 avg@5 中位数降至 11.3
9 月 15 日,腾讯混元在 X 账号 发布基准 EvolveScaler,主题是「信息演化(Information Evolution)」:记录会被撤回、更正、补录,读者读完之后,世界还在变。发布帖用它自己的例子开场:把一份 40 天的 RPG 日志读完,然后回答「第 7 天跳过小 Boss,还能不能打赢最终 Boss」,而这个答案不在日志里,必须把世界重放一遍。
帖子给出的三组数字是:117 个原型、159 个问题算子、5 个难度档、每样本最多约 1,200 个事件;14 个模型在最难档的 avg@5 中位数降到 11.3;改用它的数据做训练,在 8 个分布外(out-of-distribution,OOD)基准上平均提升 5.25 分。帖子链接的于 9 月 8 日提交到 arXiv、9 月 9 日修订到第 2 版,作者来自腾讯混元团队、中国人民大学高瓴人工智能学院和香港中文大学;提供了框架图、语料统计与可交互的结果表。下文所有规模与成绩均出自发布帖、论文和项目页,属于发布方自报口径。
一条记录被撤回,答案就不在原文里了
论文给这类任务的定义是:在持续交互中,长上下文编码的是一个持续演化的过程,而不只是一份固定记录;后来的事件可以修订或撤销先前的信息,从而改变哪些内容仍然有效、哪些结论还能成立。论文把由此产生的上下文称为「信息演化上下文」,并把它与多数已有的长上下文基准区分开:后者的上下文在推理期间基本不变,后面的记录不会动摇早先证据的有效性;多轮基准大多考察指令保持与跨轮连贯,很少把更新语义写成一个可执行、可控制的状态过程。
项目页用四个场景说明这类上下文长什么样:团体聚餐的安排(时间从 18:30 改到 19:00、有人退出、一条「改吃烧烤」的提议被撤回)、家庭账本(一笔订单的退款到账、重复记的账被更正)、足球比赛的文字直播(VAR 判定进球无效)、网购退货(商品质检后退款、聊天里的口号算噪声、另一笔订单与本次结算无关)。四个场景的最终问题各不相同,有的问净支出,有的问谁进的球最多,有的问如果某笔订单被取消、余额会变成多少;项目页给每个答案都标注了 code-verified(代码验证),并注明由图中的重放过程算出。
这套设计不把答案写在句子里。每条记录只暴露局部变化,比如「库存 +2」,运行中的总量从不写进上下文,模型必须先判断哪些记录算数,再按顺序把它们累加起来。论文说,这正是信息演化在长度和轮数之外多出来的一层难度:两段长度和轮数都相近的交互,如果一段只是不断累积有效信息、另一段反复修订和作废前面的记录,难度可以差得很远。
先写状态机,再让它把语言打印出来
EvolveScaler 的构建顺序和常见的合成数据流程相反。人先写出操作规范,规定状态怎么转移、哪些记录有效、难度怎么调节、答案怎么算;再由一个强 LLM 把规范编译成一个自包含的 Python 模拟器,硬约束被写成状态转移的守卫和运行时断言。论文举的例子是:库存扣减只有在余量足够时才合法;退款必须指向一笔有效付款,且不能超过那笔付款尚未结清的金额。
模拟器要通过几道检查才会被保留:在抽样的随机种子上执行成功、保持所有标注的不变量、在确定性重放下复现同一个状态,并产出一份与参考答案一致的原子检查清单。通过之后,执行它就是渲染过程,事件历史变成多轮自然语言上下文;重放同一段历史就是监督过程,程序状态直接给出参考答案和检查清单。论文把这套分工压缩成一句:LLM 提出可执行的机制,重放出来的程序状态决定监督信号。
反事实问题走的是同一条路:重放时先把指定的事件剔除,再重算所需的状态视图,这就是「第 7 天跳过小 Boss」的算法实现。项目页把两条路线摆在一起对照:常见做法是「先生成、再标注」,让模型写一段长对话,再由人或另一个模型回头推断标签,代价是一致性随上下文变长而衰减、金标准答案本身也是模型的意见、难度只能描述不能设定,也没有机制保证问题可答;EvolveScaler 走的是「先规定、再渲染」,答案由重放计算而不是评判得出,难度是参数,可答性在样本出厂前就已检查。
十个原语怎么长成约 35,100 条训练样本
论文用十个原子原语描述每一个任务原型:实体、时钟或区块、事件模式、状态变量、转移约束、有效性规则、噪声通道、难度控制、问题算子和答案程序。117 个原型由二十多名标注者撰写,覆盖 12 个主题。论文列出的细节包括 3,410 个具名实体(每个原型中位数 28 个,范围 19~52)、928 个事件模式(中位数 8 个,范围 5~15)由 2,784 种自然语言写法实现、549 个被持续跟踪的状态量、1,852 条带符号的更新声明、1,019 条有效性规则(来自 756 个状态标签,其中 404 个无效、352 个有效)、442 个干扰模板,乱序记录的比例为 0.02~0.05,无效记录的比例为 0.10~0.14。
难度分五档,通过区块数、每区块事件数、无效记录比例、补录距离、实体交错程度与反事实深度一起加码,每个样本从约 7 个事件到约 1,200 个事件,单个样本包含 3~55 个区块。采样方式是对每个模拟器和每个难度档抽 60 条训练实例和 1 条留出实例,最终得到约 35,100 条训练样本和 585 条经过验证的评测实例,每档各有 7,020 条训练样本与 117 条留出样本。159 个问题算子分成 7 个族、4 个组,覆盖排序与比较、聚合与画像、审计与反事实推理、定位四类访问模式。论文称,标注者另外检查了合成数据的逻辑一致性,在随机抽取的 117 条实例中没有发现错误。
难度拉开模型差距:最短档 3.6 分,最难档 49.7 分
评测用 585 条留出实例,按事件数与演化复杂度分 very_short、short、medium、long、very_long 五档,最难的一档即 very_long,每个实例让模型独立回答五次。判分环节不看前文对话,只把最终问题、模型回答和一串原子检查项交给 gpt-oss-120b 作为评判模型,按默认推理参数逐条判断断言是否满足。论文用两个指标:avg@5 是五次回答的平均通过率,反映响应级可靠性;pass@5 是五次里至少成功一次的实例比例。
给出的分档结果是,14 个前沿与开源模型 avg@5 的中位数从最短档的 71.2,依次降到 67.8、50.5、21.9,在 very_long 落到 11.3。在这 14 个系统里,整体得分最高的是 GPT-5.5-xhigh,全档 pass@5 为 82.7、avg@5 为 72.8,very_long 档 avg@5 为 59.3;very_long 档有六个模型的 avg@5 低于 10,只有三个 GPT-5.5 变体超过 30,DeepSeek-V4-Preview-Pro 以 29.7 接近这条线。难度也放大了模型之间的差距:最短档 14 个系统的 avg@5 落在 59.0~81.7,very_long 档拉开到 4.8~59.3;GPT-5.5-xhigh 与 GLM-5.1 在最短档只差 3.6 分(78.5 对 74.9),到 very_long 档差 49.7 分(59.3 对 9.6)。同一个家族内部,推理强度从 medium 提到 high、xhigh,very_long 档 avg@5 从 37.9 升到 47.5 和 59.3。
作为训练数据:八项平均分从 33.17 涨到 38.42
论文还测了这个基准作为训练数据的价值:用一个内部 A3B 模型做继续训练,算法是 GRPO,样本取自混合难度档,用量分别为 200、2,000 和 6,000 条,然后在八个独立构建、实例不在训练数据里的分布外基准上评测,分别是 MultiChallenge、InverseIF、IF-Bench、MARS、CL-Life、CL-Bench、MRCR 和 AA-LCR。八项平均分从基座的 33.17 依次升到 35.60、37.45、38.42,6,000 条时比基座高 5.25 分,且八项全部高于基座:MARS +9.50、MRCR +7.59、MultiChallenge +7.33、AA-LCR +6.41、InverseIF +4.89、CL-Bench +2.33、IF-Bench +2.10、CL-Life +1.85。
论文另做了一组对照:在同样是 6,000 条样本的训练预算下,把 short、medium、long 三档各取 2,000 条的混合设置,在八个基准上都优于只用单一难度档的设置。作者据此认为,多种轨迹尺度提供了互补的监督。
失败集中在净变化聚合,适用范围目前只到离散状态
论文对失败回答做了人工标注,每条失败回答只按它最先违反的检查项记一个主标签,覆盖十个模型。净变化聚合是每个被报告模型里占比最大的一类,占标注失败的 46.2%~55.9%(GPT-5.5-xhigh 最低,46.2%;Doubao-1.8-high 最高,55.9%),对应的情况是记录选对了、带符号的效果却加错了。检索与计数占 16.8%~21.1%,两类合计至少 64.6%、最多 73.1%。排序与并列决胜占 19.2%~29.8%,在 GPT-5.5-xhigh 上最高,而这恰好也是聚合错误占比最低的模型。记录有效性判断(Invalid-Record Handling)的占比从未超过 5.5%,比较结论错误从未超过 8.5%。论文提醒,由于每条回答只带一个主标签,这些比例不能被当作彼此独立的错误率:一个早期的有效性错误,之后可能表现为检索、计数或聚合失败。
公开材料方面,论文挂在 arXiv 的 cs.AI 分类,同时标注 cs.SE;项目页除了框架图和统计图表,还提供了可切换难度档的模型对比表与训练结果;GitHub 上的在 README 里写明自己是这篇论文的官方页面,首页指向项目页。
论文同时给出了范围限定:EvolveScaler 目前处理的是离散、可由程序指定的状态转移,把它扩展到部分可观测、连续和多模态的设置,被列为后续工作方向。