AREX Feed Article
Perplexity 公布「提示引导自蒸馏」后训练研究:GLM 5.2 线上 A/B 测试中工具调用失败率相对下降 21.2%
北京时间 9 月 23 日凌晨 4 时 21 分(UTC 9 月 22 日 20 时 21 分),Perplexity 经 X 企业认证的官方账号 @perplexity_ai :团队用「提示引导自蒸馏」(hint-guided self-distillation)结合拒绝采样微调,对自家 Computer 智能体模型做后训练,把 AI 的失败转化为训练数据,让模型从自身错误中学习。推文给出的核心数字是:在真实流量 A/B 测试中,较晚训练的检查点把工具调用失败率相对降低了 21.2%。
补齐了口径(数据归 所有):方法应用于 GLM 5.2 权重,线上实验每臂约 10 万用户,工具调用失败率从 2.24% 降到 1.77%。同一组数据里,用户强不满率在两个检查点之间没有统计显著变化;收益集中在工具可靠性,而不是整体任务成功率。原始研究博客在本文核查时多次尝试均无法打开,以上数字目前均为公司自报口径。
失败会话进入训练池之前:裁判先定责
据 AlphaSignal 转述,训练数据取自由 GLM 5.2 提供服务的可入池会话;用户选择退出(opt-out)和被标记含个人可识别信息的会话,在上游就被剔除。一个 LLM(大语言模型)裁判先给任务难度评级,例子随后分成两类来源:带追问纠正或不满信号的用户反馈会话,以及含失败调用的工具错误会话(失败调用由规则或模型审查识别)。
判断最终回复是否满足用户请求,由另外两个 LLM 裁判负责;对投诉驱动的例子,则由三个裁判指认该为失败负责的回合,至少两个同意才算成立。Perplexity 报告说,投诉前最后一个助手回合真正是问题根源的情形只占一半左右,只对着最终回复训练很可能打错靶子。
已知类型的工具违规走确定性检查,例如向只接受 day、week、month 的工具传入 recency_filter: "year";模糊失败再交给 LLM 裁判。
一个回合三条路:模仿、纠错、留作上下文
转述解释了拒绝采样微调(RFT)的常规思路:给生产会话打分,保留成功样本,让模型模仿其轨迹。但成功会话里也可能藏着薄弱的中间步骤,而被丢掉的失败恰恰暴露 schema(参数格式)违规、错误参数和被忽略的用户约束。Perplexity 因此把每个回合分到三条训练路径:
- 「模仿」:成功会话里的非错误回合按交叉熵损失训练,提高已记录 token(词元)出现的概率;
- 「纠错」:带有效提示的错误回合按 KL 散度损失训练,把模型的 token 分布拉向它自己在提示条件下的预测;
- 「留作上下文」:没有有效提示的失败会话回合,保留在输入历史里,但不产生任何训练损失。
第三条路保住了上下文,又不教模型复刻失败轨迹里的每个动作。提示本身还有一条硬约束:只能使用错误发生前就已经知道的信息。转述称这是为了压低后见之明偏差,用户在抱怨里第一次说出的偏好,不能反过来变成「模型早该照办」的指令。
同一个检查点,一次当老师、一次当学生
这一步改造自 2026 年 1 月 26 日提交 arXiv 的 (On-Policy Self-Distillation,在策略自蒸馏):论文里同一个 LLM 既当老师又当学生,老师能看到特权信息(如已验证的推理轨迹),学生只看到问题,训练目标是最小化两条分布在学生自身生成轨迹(rollout)上的逐 token 差异。
Perplexity 把这套思路放到 上,那是 zai-org 以 MIT 许可证开源、面向长程任务的模型。据转述,同一个检查点在已记录的会话上做两次前向:老师这一遍拿到纠正提示,学生这一遍只看原始上下文;两遍都用 teacher forcing(教师强制,即沿已记录轨迹逐 token 预测),老师的预测不参与梯度计算(detach)、只当固定目标,学生要学会在没有提示的情况下复现老师的下一个 token 分布。
推理时模型拿不到任何提示。训练的意图是把纠正内化:让原始上下文自己就足以产出更好的动作。转述还提到,保留对成功回合的交叉熵模仿,是防止老师和学生「靠忽略相关上下文来互相匹配」的锚点。
提示本身值多少:985 个留出回合的预检
训练开始前,团队先验证提示里有没有纠错信号。在 985 个工具错误的留出回合(不参与训练的保留样本)上,只加提示就把工具错误回避率从 75.1% 提到 93.7%,涨了 18.6 个百分点;采取纠正动作的回合占比从 60.6% 升到 82.3%。用户反馈回合上,拿到提示后被判「已修复或正走向修复」的比例大约翻了一倍。
转述同时划清了这组数字的边界:它们测的是提示携带的纠错信号,不测模型蒸馏之后实际留住了多少。
线上 A/B:工具错误降了,强不满率没动
离线数字分三层:原始 GLM 5.2 的离线工具错误率 2.79%,只做 RFT 降到 1.35%,RFT 叠加 OPSD 再降到 0.87%。但转述明确,这几个离线检查点分别用不同数据训练,这组数字无法单独归因 OPSD 的贡献。
线上 A/B 把两个用同一套配方先后训练出的检查点各分配了约 10 万用户。在记录了状态的工具调用里,失败率从 2.24% 降到 1.77%,下降 0.47 个百分点,公司口径为相对下降 21.2%,达到统计显著。强不满率两个检查点分别为 2.58% 和 2.54%,差异没有统计显著性;任务级基准分数也表现参差:更低的工具错误率并不稳定带来更高的整体任务成功率。
转述末尾把限制列得同样具体:自动裁判可能误分类错误;一个被纠正的回合,仍可能通向失败的任务。
还没关闭的问题:博客打不开,复测缺位
发稿前,本文尝试了研究博客的 www 域名、裸域名和网页存档三条路径,均无法打开;所有数字因此只能回到两个来源:官方推文,它只给出「工具调用失败率相对下降 21.2%」这一项,和 AlphaSignal 的转述。
推文发布约十二小时后(北京时间 9 月 23 日下午的核实时刻),它获得约 7.8 万次浏览、271 个点赞、24 次转发。在博客恢复访问之前,21.2% 这个数字暂时只有 Perplexity 自己能够佐证。