AREX Feed Article
Liquid AI 开源 Antidoom:22.9%→1%,推理模型再也不"鬼打墙"
TL;DR: Liquid AI 开源了 Antidoom,一个基于 Final Token Preference Optimization(FTPO)的训练方法,专治推理模型中的 doom loop——模型反复输出 "Wait, let me reconsider..." 直到上下文窗口耗尽。Qwen3.5-4B 的 doom-loop 率从 22.9% 暴跌至 1%,LFM2.5-2.6B 从 10.2% 降至 1.4%,所有 benchmark 分数随之全面提升。训练成本仅数小时,全栈开源。
22.9% 到 1%,一个 token 的差距
Qwen3.5-4B 推理模型在难题上有 22.9% 的概率陷入"doom loop"——反复输出同一段文本直到上下文窗口耗尽。Liquid AI 刚刚开源的 Antidoom 方法将这一数字打到 1%,而且只修改了一个 token。
7 月 7 日,Liquid AI 在 X 平台发布了一条 6 连帖的线程,宣布开源 Antidoom——一个基于 Final Token Preference Optimization(FTPO)的训练方法。推文在半天内斩获 1,700 个赞、201 次转发和 163K 次浏览,1,048 人收藏,随后 r/LocalLLaMA 社区火速顶上首页。
Antidoom 在 Liquid 自家早期 LFM2.5-2.6B checkpoint 上将 doom-loop 率从 10.2% 降至 1.4%,在 Qwen3.5-4B 上从 22.9% 降至 1%。更关键的是,所有 benchmark 分数全面提升——不是模型变聪明了,而是那个阻止它给出正确答案的"卡死"被移除了。
本地 AI 社区集体松了一口气
Liquid AI 推文下的评论区迅速成为开发者宣泄与期待的集合地。
Liquid AI 联合创始人 Dave Blundin 引用转发:"这是一个重大突破!如果你在本地跑过小型推理模型,你一定见过 doom-loop 模式。我们张开双臂欢迎 Antidoom!"这条获 44 赞、5 次转发。
技术博主 Drew Breunig 一针见血:"这对 Qwen 来说是巨大的——Qwen 小模型最大的失败模式就是在多轮对话后陷入循环。"AlphaSignal 创始人 Lior Alexander(116K 关注者)的判断上升到了行业趋势层面:"今年 AI 领域最大的趋势不是更大的模型,而是系统性地消除失败模式。"此条获 32 赞、6 次转发。
意大利技术顾问 Ivan Fioravanti(39K 关注者)将 Antidoom 称为"本地 AI 的 game changer"。Liquid AI 团队成员也亲自下场——负责 post-training 的 Tim Seyde 用一句简练的 "p(doom)↓" 概括了全部,获 16 赞。
中文社区同样反响热烈。独立开发者 @0xkeenz 表示"之前跑 Qwen 系列模型时经常遇到无限循环输出,Qwen3.5 的小尺寸模型尤其明显,Liquid AI 刚开源了 Antidoom 训练方法,专治这个问题"。
为什么小模型一直在"鬼打墙"?
Doom loop 不是新问题。自推理模型普及以来,开发者一直在忍受模型在难题上"卡死"的体验。
常见的应对方式是加 repetition_penalty——在推理时动态降低已出现 token 的采样权重。但 Liquid AI 在博客中直言这是"创可贴方案",会损害输出质量。强化学习路线理论上可以针对重复行为优化,但需要精调奖励函数和昂贵的在线 rollout,小团队难以负担。
社区对此早有怨言。Reddit r/LocalLLM 上,两个月前就有用户发帖抱怨 Gemma 4 和 Qwen 3.6 MoE 模型"在推理中螺旋自毁,直到上下文耗尽"。即便闭源旗舰也未能幸免——有用户在 Antidoom 推文下留言称 Claude Opus 4.8 也出现过同样的问题。
Liquid AI 此前已在 Antislop(ICLR 2026)中建立了一整套识别和消除语言模型重复模式的框架。Antidoom 是这条技术路线的直接延伸:它将通用的 token 级纠正方法聚焦到推理模型最痛苦的循环失效上,并在两个不同架构的模型上验证了跨模型迁移性。
因此,Antidoom 的时机意义在于:当小型推理模型正从实验室走向端侧部署和 agent 流水线的关键节点,一个训练成本仅数小时、全栈开源的对症方案出现了。
不需要教模型新知识,只需要让它别再卡住
FTPO 与传统的 DPO(Direct Preference Optimization)有四个关键区别,每一个都服务于"精准打击、最小副作用"的设计哲学。
第一,只训练序列的最后一个 token。 Antidoom 首先在专门设计用于触发循环的提示集上生成补全,检测到重复段落后,锁定第一个重复的第一个 token——对 LFM2.5-2.6B 而言,最常见的循环起点是 "the"(占 11.39%)、"So"(4.51%)、"Alternatively"(3.22%)和 "Wait"(2.56%)。FTPO 只在这个位置做偏好优化,其余分布保持不动。
第二,每个训练样本配对多个 chosen token(最多 20 个),将概率分散到一组合理替代选项上,避免用一个过训练 token 替换另一个。训练集生成约 2 小时(8×H100),训练 1-2 小时(单卡 H100),整个流程半天内跑完。
第三,KL 散度在 logit 空间计算,省略 softmax,避免对无关 token 产生梯度压力。第四,双区域正则化——被训练的 chosen/rejected token logit 可以更自由地偏离参照模型,其余词汇则被紧约束。
训练使用 LoRA(rank=128-256),一个 epoch,以 chosen_win=0.35 触发早停。停止太晚会反过来导致模型退化,甚至产生新的循环——此时可进行第二轮 Antidoom 来消除新暴露的失效点。
实际效果贯穿所有 benchmark:LFM2.5-2.6B 在 temp=0 时,GPQA 从 12.8 跳到 34.0,LiveCodeBench v6 从 15.4 跳到 24.1,6 项评估均值从 38.7 升至 46.9。这些提升完全来自循环消除——"训练没有教模型任何关于数学或代码的新知识;它只是清除了阻止模型得出已有答案的障碍。"
修 bug,比造新模型更迫切
此前,社区对 doom loop 的认知停留在"小模型就是这样的"——它被视为小型推理模型的固有缺陷,是"不够聪明"的代价。repetition_penalty 之类的推理时参数调整成了默认配置,但没有人真正去修理根本原因。
本次 Antidoom 的不同之处在于,它证明了一个反直觉的事实:模型不是不够聪明——它只是在一个 token 上卡住了。 修复那个 token,模型就能给出它本来就能给出的答案。
这一发现附带了一个更重要的推论:长期以来,社区普遍认为推理模型需要较高温度(如 temp=0.6-0.8)来"探索解空间"。但 Antidoom 实验揭示,这个直觉可能被 doom loop 的干扰效应所混淆——一旦循环消除,接近贪婪的采样(低温度)反而给出最强的 benchmark 分数。这可能会改变推理模型部署中的超参数实践。
未来走向上,Antidoom 目前仅在小模型(2-4B)上验证,但其方法本身与模型规模无关。多位社区成员在评论中呼吁将 Antidoom 应用于更大的 Qwen 模型乃至 Gemini。如果跨规模迁移性成立,Antidoom 可能成为推理模型训练流水线中的标准后处理步骤——成本仅数小时,开源栈完整。
Doom loop 不是宿命,是可修复的 bug
22.9% 到 1%。这不是一个渐进优化,这是从"三分之一情况下不可用"到"几乎从不卡死"的跨越。Antidoom 用一场精准的外科手术证明:许多被默认为"能力天花板"的问题,其实只是一个可以被定位和修复的 bug。对于正在走向端侧和 agent 生产环境的开源推理模型而言,这个信号比任何一个 benchmark 分数的提升都更加重要。
本文基于公开信息撰写,仅供参考。
Sources:
- (2026-07-07)
- (1,700 赞 / 201 转发 / 163K 浏览)
- (2026-07-07)