AREX Feed Article
Thinking Machines 发布首个开放权重小模型 Inkling Small:276B/12B 激活,HLE 超越自家旗舰
7月30日,由前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 发布了 Inkling-Small——该实验室第二个、也是首个"小参数"开放权重模型。距离旗舰模型 Inkling(975B 总参/41B 激活)亮相仅两周,Inkling-Small 以 276B 总参数、12B 激活参数的 MoE 架构,在多项推理和编码基准上反超了体积近四倍的"大哥"。完整权重已上架 Hugging Face,使用 Apache 2.0 许可证,同步开放 Tinker 平台微调与 Tinker Playground 多模态聊天。
以小搏大:HLE 31.6%,SWE-bench 破 80%
官方公布的基准成绩中,Inkling-Small 在 Humanity's Last Exam(纯文本)上达到 31.6%,超过 Inkling 的 29.7%;SWE-bench Verified 得分 80.2%(Inkling 为 77.6%);Terminal-Bench 2.1 最佳配置下 64.7%(Inkling 为 63.8%);GPQA Diamond 89.5%(Inkling 为 87.2%)。第三方机构 Artificial Analysis 的综合智力指数评定为 40 分,仅比 Inkling 的 41 分低 1 分,并指出在其参数规模及以下的开源模型中尚无更高分者。ARC Prize 团队则确认 Inkling-Small 在 ARC-AGI-1(84%)和 ARC-AGI-2(40.1%)上均为开放权重模型最高分。
优势并非全面:在知识覆盖面和事实性方面,Inkling 仍明显领先。τ³-Banking 上 Inkling-Small 仅得 15.5%(Inkling 23.7%),AA Omniscience 指数为 -9(Inkling 为 +2),意味着错误回答多于正确回答——尽管其幻觉率(57%)略低于 Inkling(63%)。
架构与训练:MoE + 原生多模态 + 可变思考预算
Inkling-Small 沿用 Inkling 的原生多模态编码器-free 架构:音频经 dMel 频谱图表示,图像分割为 40×40 像素块经四层 hMLP 变换后与文本 token 联合处理。42 层解码器中,每个 token 被路由至 256 个专家中的 6 个,外加 2 个始终激活的共享专家,实现稀疏激活。
模型支持最高 100 万 token 上下文窗口和从 minimal 到 xhigh 的可变思考强度,允许开发者根据任务难度在推理成本与性能之间权衡。官方称基于 NVIDIA GB300 NVL72 系统训练,计算量远低于 Inkling。
训练流程受益于后发优势:Inkling-Small 在 Inkling 之后启动训练,得以改进预训练数据混合与 ML 配方。早期预览版 checkpoint 经历了以 Inkling 为教师模型的 on-policy 蒸馏,随后又进行了两周规模化 agentic coding 强化学习,最终在推理和编码基准上反超旗舰。
部署现实:"Small"不意味着能跑在本机
尽管名为 Small,BF16 精度 checkpoint 仍需至少 600GB 总 GPU 显存,推荐 4×NVIDIA B300 或 8×H200。量化版 NVFP4 checkpoint 将需求降至约 180GB,可在单张 B300(W4A4 模式)或两张 H200(W4A16 模式)上运行。这一门槛仍然排除了普通笔记本电脑和工作站,但相比 Inkling 已大幅降低,扩展了可自托管的企业范围。
Inkling-Small 获得了发行当日即时的生态支持:vLLM、SGLang、Unsloth、Modal 均宣布 Day 0 兼容;Unsloth 当天发布 GGUF 量化版,SGLang 展示了在 2×DGX Spark 上 24 tok/s 的本地运行方案。Hugging Face 团队同步上架完整权重页面。
定价方面,官方在 Tinker 平台推出限时五折优惠:标准 64K 上下文版本预填 $0.58/百万 token,生成 $1.44/百万 token,训练 $1.73/百万 token,缓存预填仅 $0.116/百万 token。
安全与开放哲学:走"中间道路"
安全后训练沿用 Inkling 方案,经内部评估与外部合作方红队测试。StrongREJECT 达 98.4%,FORTRESS 对抗性拒绝率 71.6%、良性回答率 96.9%。发布次日,Thinking Machines 即发表博文阐述其"分阶段开放"的安全理念——既不无条件开放,也不将能力模型锁在少数实验室内。
为什么重要
这是 Mira Murati 2025 年 2 月创立 Thinking Machines Lab、以 20 亿美元创纪录种子轮融资后,第二次模型发布。两周内从 975B 旗舰到 276B 高效版本的快速迭代,表明该实验室已建立起可复用的训练-评估-发布流水线。研究员 Horace He 在 X 上对比两次发布称"Inkling 发布时像全村出动,Inkling-Small 则相当常规"。
在 OpenAI、Anthropic 坚持闭源与 DeepSeek、Kimi 等中国厂商快速开源的路线之争白热化之际,Thinking Machines 以一家美国顶尖团队的身份选择 Apache 2.0 完全开放权重,提供了有分量的第三种选择。Inkling-Small 以约四分之一规模在关键基准上超越旗舰的事实,也为 MoE 稀疏激活路线的效率优势提供了新的证据点。
待验证与不确定性
目前报道主要依赖官方自报数据与 Artificial Analysis、ARC Prize 等少数第三方评测。独立社区的广泛复测和实际使用反馈仍处于早期阶段。模型在知识覆盖面上的明确短板、Apache 2.0 许可证下的实际商用边界、以及"分阶段开放"框架的后续步骤,均有待进一步观察。
来源
- (官方公告,2026-07-30)
- (2026-07-30)
- (2026-07-30)
- (2026-08-01)
- (官方发布帖,2026-07-30)
- (Mira Murati 发布帖,2026-07-30)
- (ARC-AGI 评测结果,2026-07-30)