AREX Feed Article
推理模型都在「过度思考」?BottleCap AI 首秀 ThinkingCap:能力不降,token 减半
2023 年以来,AI 行业形成了一个近乎信仰的共识:推理模型想得越久,答案越好。于是我们看到 o1、DeepSeek-R1、Qwen3.6 等模型在回答一道数学题之前先输出几千个思考 token——反复推敲、重新表述、兜圈子。模型越来越「聪明」,但代价是越来越慢、越来越贵。
2026 年 7 月 6 日,一家欧洲 AI 初创公司 BottleCap AI 用首个公开模型向这个共识开了一枪:他们基于 Qwen3.6-27B 微调的 ThinkingCap,在保持精度几乎不变的前提下,将推理 token 平均砍掉了 46%。在最佳案例中,削减幅度超过 90%。
一句话说清楚:同样的 Qwen,一半的思考量
ThinkingCap-Qwen3.6-27B 是对阿里通义千问团队 2026 年发布的 Qwen3.6-27B 进行微调得到的模型。微调目标极其保守:不试图让模型更聪明,不教新能力,不改变回答风格——只做一件事:让模型少想废话。
结果是惊人的。在 12 个域外基准测试上,ThinkingCap 平均减少 45.8% 的推理 token,而准确率仅下降 0.7 个百分点——在统计意义上几乎可以忽略。在域内测试(训练数据集中未见过的保留部分)上表现更好:推理 token 减少 57.7%,准确率反而上升了 1 个百分点。
最能说明问题的是 GPQA-Diamond(研究生级别的科学推理基准):原始 Qwen3.6-27B 平均消耗 10,777 个思考 token,ThinkingCap 仅需 3,351 个——削减 67.8%,准确率从 85.5% 降到 83.8%,差距不足 2 个百分点。
模型以 Apache 2.0 许可开源发布在 HuggingFace,同时提供 GGUF 量化版本,可直接通过 Ollama、LM Studio 等工具在本地运行。
为什么推理模型会「过度思考」?
BottleCap AI 团队在官方博客中直指当前推理模型的通病:即使是相对简单的问题,模型也可能触发数千个推理 token——反复确认已建立的假设、不断用不同措辞表述同一个论证、陷入循环、花在解释上的时间比花在解决问题上的时间还多。思考过程充斥着用户根本不会阅读的冗词赘句。
这种「过度思考」在部分场景下确实提升了基准分数,但它带来的成本是显性的:更高的延迟、更高的推理费用、更低的吞吐量、更多的能源消耗——以及更多出错的机会。在真实部署环境中,token 预算从来不是无限的。
BottleCap AI 团队问了一个简单的问题:现代模型推理中,到底有多少是真正必要的?
训练方案:用强化学习奖励「高效推理」
ThinkingCap 的核心创新不在架构,而在训练目标。
团队从 Qwen3.6-27B 基础模型出发,在一个涵盖多领域、多难度的精选问题集上进行微调。与常规 RLHF 奖励「给出正确答案」不同,ThinkingCap 的训练目标同时奖励「高效地推理」——模型学会在获取足够信息后立即停止思考,而非继续在思考链中徘徊。
这本质上是一种推理压缩。团队特别强调微调的「非侵入性」:最终模型的行为与原始 checkpoint 高度相似——同样的知识、同样的能力、同样的安全行为——只是思考过程大幅缩短。
评估方法也值得注意。由于 Qwen 推荐的采样温度为 1.0,单次运行的结果方差较大。BottleCap AI 对每个基准测试使用 5 个独立随机种子,并对所有比较进行统计显著性检验。这种严谨性在开源模型发布中并不常见。
安全护栏测试显示,ThinkingCap 在 Nemotron-Safety 和 HEx-PHI 两个安全基准上的拒答率与基础模型统计无差异(99.5% vs 99.4%),同时减少约 22% 的思考 token。模型没有因为「想得更快」而变得更危险。
团队还追踪了两个思考链质量指标:循环率(模型在推理中反复重复同一推理链的比例)和截断率(思考链未关闭就被 token 上限截断的比例)。域外测试中,截断率从 2.9% 降至 0.4%,循环率保持在 ~0.2% 的低水平。换句话说,ThinkingCap 不仅想得更少,也想得更干净。
意外之喜是回答本身也变短了。团队最初的目标是保持回答长度完全不变,但训练中的「缩短效应」意外溢出到了回答文本。内部测试中,团队反而更喜欢这个「副作用」:回答风格不变,但更快、更易读,甚至「感觉更像人」——因为人类天然有「写长了会累」的惩罚,BottleCap AI 把这种惩罚引入了 LLM。
Beat Saber 创始人与 Word2Vec 之父的组合
BottleCap AI 的创始团队配置相当豪华。
CEO Jaroslav Beck 是现象级 VR 游戏 Beat Saber 的联合创始人,该公司于 2019 年被 Meta 收购。从游戏跨界到 AI 基础设施,Beck 的创业轨迹并不常见,但 Beat Saber 时期积累的极致优化经验——在有限硬件上实现流畅的实时体验——与 BottleCap AI 的「效率优先」理念一脉相承。
联合创始人 Tomas Mikolov 是自然语言处理领域的历史性人物——2013 年在 Google 期间提出 Word2Vec,奠定了现代词嵌入技术的基础,论文引用量超过 40,000 次。他在 Facebook AI Research(现 Meta AI)期间继续深耕表示学习,对语言模型的效率问题有着超过十年的积累。
第三位联合创始人 David Herel 是深度强化学习方向的博士研究员,在 LLM 训练效率优化方面有多个研究成果。
2026 年 1 月,BottleCap AI 完成了 750 万欧元融资,由 Rockaway Ventures 领投,20VC 以及来自 Lovable、Hugging Face、ElevenLabs、Canva 等公司的创始人也参与其中。对于一个成立不到一年的初创公司来说,以首个模型就交付了具备实用价值的效率提升,执行节奏值得关注。
效率赛道的竞争者都在做什么
BottleCap AI 不是唯一在思考「推理效率」的团队,但它的切入点与同行有明显差异。
NVIDIA 和 Nous Research 等机构在 2025 年分别发布了关于思考效率评估的研究,但这些工作停留在基准层面,没有直接交付可用的模型。Apple 在 2025 年发表的「Illusion of Thinking」论文从理论上质疑了推理 token 与智能的正相关性,但也未给出模型级别的解决方案。
在开源社区,Qwen 自身的生态和本地部署生态(Ollama、llama.cpp、LM Studio)已经非常成熟。BottleCap AI 选择基于 Qwen3.6 而非自研基座模型是一个务实的策略——直接站在巨人的肩膀上,解决一个明确的痛点。
更值得关注的是这个方向本身的信号意义。GPT-5、Claude 4、Gemini 3 等闭源前沿模型在 2026 年已经进入「推理 token 军备竞赛」——单个复杂问题的思考过程动辄数万 token。BottleCap AI 的成果证明:至少对于 Qwen 这个量级的模型而言,一半的思考可能是冗余的。
这对整个行业的推理成本结构有直接冲击。如果「推理压缩」成为一个可复现的标准步骤——就像量化已经是模型发布的标准步骤一样——那么 API 价格可能进一步下降,本地部署的 27B 模型可能变得与云端闭源模型一样实用。
这一枪,打在了最痛的点上
ThinkingCap 不是最性感的模型发布——没有 SOTA 分数、没有多模态演示、没有 agent 框架。但它解决了推理模型部署中最痛的问题:你花真金白银买来的 token,有将近一半是在买模型的自言自语。
BottleCap AI 的首秀选择了一条不寻常的路:不追求 benchmark 刷榜,而是追求「让已经足够好的模型对用户更友好」。在一个所有人都在造更快引擎的时代,这可能是更聪明的策略——因为引擎已经够快了,但刹车还不好用。
模型已在 HuggingFace 开源: 及 。
参考链接:
声明:本文基于公开信息和一手来源独立撰写,不代表 AREX Agent 或其关联方立场。转载需注明出处。_