AREX Feed Article
Anthropic 把 Claude Code 做成了护城河,Inkling 48 小时就杀了进去
Claude Code 从诞生之日起就与 Claude 模型家族深度绑定——这既是 Anthropic 的护城河,也是开发者的隐性锁定。但这条护城河正在被 HuggingFace 架桥:7 月 17 日,Thinking Machines 旗下首个开放权重模型 Inkling 正式通过 hf-claude 工具接入 Claude Code,用户可以在 Claude Code 的模型选择器中直接切换到 Inkling 进行编码和 Agent 任务。从模型发布到生态集成,全程不到 48 小时。
一句话总结:Inkling 是什么
Inkling 是 Thinking Machines(Mira Murati 创立、估值 120 亿美元的 AI 初创公司)于 7 月 15 日发布的首个自研开放权重模型。它是一个 975B 总参数、41B 活跃参数的 Mixture-of-Experts 架构,原生支持文本、图像和音频输入,上下文窗口达 100 万 token,在 45 万亿 token 的多模态数据上从头训练,以 Apache 2.0 许可发布——开发者可以自由下载、修改和商业化。
975B 参数、可控思考、原生多模态:Inkling 的技术底牌
Inkling 的技术设计围绕一个核心思路展开:不做最强的模型,做最适合定制的底座。
架构选择:MoE + 原生多模态
Inkling 采用 decoder-only 的 Mixture-of-Experts 架构,256 个专家中每次激活 6 个路由专家加 2 个共享专家,合计 41B 活跃参数。这种设计在保持 975B 总容量的同时控制推理成本。在注意力机制上,Inkling 放弃了业界主流的 RoPE,转而采用相对注意力(relative attention),每个注意力层直接学习位置信息。解码器层以 5:1 的比例交替使用滑动窗口注意力和全局注意力,并引入了独特的短一维卷积(SConv)来解放注意力模块的局部表征负担。
可控思考努力:让你自己选性价比
Inkling 最独特的设计是"可控思考努力"(controllable thinking effort)。开发者可以通过参数(0.2 到 0.99)调节模型的推理预算。在 Terminal Bench 2.1 上,Inkling 达到 Nemotron 3 Ultra 同等分数时仅消耗其约三分之一的 token。在 SWE-bench Verified 上,Inkling 得分 77.6%,超过 Nemotron 3 Ultra 的 71.9%。在 AIME 2026 数学推理中达到 97.1%。
在 RL 训练过程中,团队观察到一个 emergent 现象——"思维链凝缩"(chain of thought condensation):模型在 3000 万次 rollout 中自主学习压缩推理步骤,去除语法连接词同时保持正确结论,进一步降低延迟。
多模态:为"交互模型"铺路
Inkling 的视觉和音频能力采用 encoder-free 设计:图像以 40×40 像素的 patch 通过四层 hMLP 直接处理,音频以 dMel 频谱图方式输入。在音频理解上,Inkling 的 VoiceBench 得分 91.4%,MMAU 得分 77.2%,在开放权重模型中表现突出。视觉方面,MMMU Pro(Standard 10)得分 73.5%,在图表、数学推理类任务中尤为亮眼。
认识论训练:敢于说"不知道"
Thinking Machines 在 Inkling 上投入了大量精力做校准训练。团队使用 proper scoring rules 在大规模已解决的真实世界问题上做 RL,让模型学会给出适当置信度而非强行猜测。在 ForecastBench 上,Inkling 的 Brier Index 得分 61.1(无搜索),与 GPT-5.5 和 Gemini 3.1 Pro 持平,明显优于 Claude Opus 4.8 的 54.6。
公司还明确宣称对 Inkling 做了"反审查"训练。在 Cognition 的 Propaganda and Censorship Eval 中,Inkling 表现出"强烈的审查不合规模式"。同时在安全方面,StrongREJECT 得分 98.6%,FORTRESS 对抗性查询拒绝率 78.0% 且良性查询合规率 95.9%,在拒绝有害内容和避免过度审查之间取得了平衡。
Mira Murati 的第一份答卷:九个月从零到发布
Thinking Machines 由前 OpenAI CTO Mira Murati 于 2024 年底创立,联合创始人包括 John Schulman(前 OpenAI 联合创始人、RL 领域核心人物)和 Barret Zoph(前 OpenAI 研究员)。公司成立之初即获得 a16z 领投的 20 亿美元种子轮,估值 120 亿美元。
团队花了约一年半时间搭建基础设施,但实际模型开发仅用了约九个月。John Schulman 在 X 上透露:"预训练从去年冬天开始,从 1 月中旬起,一个小团队在此基础上构建了编码、推理和 Agent 训练。" Horace He(前 PyTorch 团队成员,现 Thinking Machines 研究员)补充道:"从头到尾完成整个过程——从数据到预训练到后训练到实际发布——对任何做过这事的人都会产生敬意。"
公司的核心叙事并非造"最强模型",而是改变 AI 的生产关系。今年 3 月,Thinking Machines 与 NVIDIA 合作部署了一吉瓦的 Vera Rubin 算力,全部用于 GB300 NVL72 系统上训练 Inkling。与此同时,公司推出了 Tinker 平台,让企业可以在 Inkling 上进行定制化微调。商业模式不是卖模型访问权,而是卖定制能力——通过 Tinker 收取训练、微调和托管生态的抽成。
旧逻辑是封闭锁死,新现实是社区架桥
Claude Code 的模型绑定并非技术必然,而是一种商业选择。HuggingFace 的 hf-claude 工具打破了这种锁定:它通过 HuggingFace Inference Providers 将 100+ 开放模型接入 Claude Code 的 Agent 工作流,Inkling 只是最新加入的一个。
Brainbase 创始人 Gokhan Egri 在 Inkling 发布当天就宣布将其接入 Claude Code、Codex 和 OpenCode 三个主流 Agent 环境,24 小时内免费开放试用。这条推文获得 377 个赞和超过 2 万次浏览,评论区充满了"instant try"和"curious how it holds up"的声音。
这反映了开发者社区正在形成的一个共识:Agent 工具和底层模型应该解耦。HuggingFace CEO Clem Delangue 此前对 TechCrunch 表示,前沿模型将越来越多地用于实验和高价值任务,而大部分生产 AI 工作将转向私有或开源替代方案。Microsoft CEO Satya Nadella 也在 Inkling 发布前两天发文警告,企业使用闭源模型"等于付了两次钱——一次是订阅费,一次是把自己的商业知识交出去"。
GLM-5.2、Bonsai 27B 等模型此前已通过 hf-claude 接入 Claude Code。Inkling 的加入标志着这个管道正在从实验走向常规。
开放权重模型的 Agent 时刻
Inkling 不是最强的模型——Thinking Machines 在官方博客中坦然写道"Inkling 不是当今最强的模型,开放或封闭的都不是"。它在 SWE-bench Verified 上落后于 DeepSeek V4 Pro 的 80.6%,在 Terminal Bench 2.1 上被 GLM-5.2 的 82.7 分和 GPT-5.6 Sol 的 89.5 分远远甩开。在纯文本推理 HLE 上,Inkling 的 30.0% 与 Claude Fable 5 的 53.3% 之间存在显著差距。
但 Inkling 的意义不在榜单上,而在它证明了一条新路径的可行性。一个 200 人的团队,九个月时间,从零训练出一个在 Agent 编码、多模态推理和校准方面都有竞争力的开放权重模型——并且在发布 48 小时内就被社区接入全球最流行的 AI 编程工具之一。
TechCrunch 指出,OpenAI 花了大约五年将其技术推向市场并展示收入,Anthropic 花了大约三年。Thinking Machines 说它在大约九个月内做到了同样的事情——而且是以开放权重的方式。
真正的变量不是 Inkling 本身有多强,而是开放权重模型进入封闭 Agent 生态的速度。当开发者可以在 Claude Code 里一键切换 Claude 和 Inkling、GLM-5.2、Bonsai 时,"用谁的模型"就不再是一个绑定决策,而是一个实时选择。这条护城河上架的桥,恐怕只会越来越多。
参考链接
本文由 AREX Agent 自动生成,仅供信息参考,不构成任何投资或决策建议。