AREX Feed Article
OpenAI 在封闭,她在开放——Mira Murati 掏出首个开源巨模型 Inkling
2024 年底,Mira Murati 从 OpenAI CTO 的位置上离职时,外界最关心的问题是:她会做什么?一年半之后,答案终于落地——一个 975B 参数的开放权重模型,以及一个赌"定制化比通用化更重要"的公司。
2026 年 7 月 15 日,Murati 创办的 Thinking Machines Lab 发布了其首个模型 Inkling:一个基于 MoE(Mixture-of-Experts)架构的多模态大模型,总参数量 975B,每次推理激活仅 41B 参数,支持 1M token 上下文窗口,在 45 万亿 token 的多模态数据上从零开始预训练。完整权重以 Apache 许可证在 Hugging Face 上开放下载,同时可通过该公司自研的微调平台 Tinker 进行定制。
这个发布有两个不寻常之处。第一,模型本身不是最强的——公司官方博客明确写道:"Inkling 不是当今最强大的模型,无论是开源还是闭源。"第二,训练硬件完全公开:NVIDIA 的 GB300 NVL72 系统,NVIDIA AI 官方账号亲自发推祝贺,并提供了 NVFP4 格式的量化 checkpoint。在行业中,大多数实验室把训练硬件堆栈视为商业机密,Thinking Machines 选择在发布第一天就完全透明——连 Hugging Face 官方博客都称之为"罕见之举"。
975B 参数全开,不做最强只做最灵活
Inkling 的核心定位不是"最强",而是"最好定制"。Thinking Machines 在发布声明中把话说得很直白:Inkling 是一个"广泛、平衡的基础模型",其价值在于作为微调的起点,而非作为开箱即用的终极产品。
这种定位背后是一个清晰的商业逻辑:如果组织的核心竞争力来自于自己的专有数据和专业知识,那么一个能让你自己动手改的开放模型,比一个别人帮你改好但不能动的闭源模型更有价值。用 Murati 在上周年发布的博客文章中的话说:"我们希望 AI 能够帮助组织培养其独特的知识,而不是提取一份快照、然后用标准化产品取而代之。"
在 benchmark 表现上,Inkling 在多个维度上具备竞争力:HLE(带工具)46.0%、AIME 2026 达 97.1%、SWEBench Verified 77.6%、GPQA Diamond 87.2%。这些数字使它跻身开源模型第一梯队——与 Kimi K2.6、GLM 5.2、DeepSeek V4 Pro 处于同一量级,但并非领先。在预测能力(ForecastBench Brier Index 61.1)和指令遵循(IFBench 79.8%)上,Inkling 甚至超过了若干闭源竞品。在 MCP Atlas(智能体通用能力)上,Inkling 的 74.1% 大幅领先 Nemotron 3 Ultra 的 44.7%,逼近 GPT 5.6 Sol 的 81.8%。
从 MoE 到多模态:Inkling 的技术底牌
Inkling 的架构设计透露出 Thinking Machines 在效率上的深度思考。从 MoE 路由策略到注意力机制,从位置编码到多模态处理,每一项设计选择都在"高性能"和"低成本部署"之间寻找最优解。
MoE 与推理效率。Inkling 采用 66 层 decoder-only transformer 架构,路由器在 256 个 expert 中选择 6 个激活,外加 2 个始终激活的 shared expert。这种设计将每次推理的活跃参数量控制在 41B——不到总参数量的 5%。配合 NVIDIA NVFP4 量化,完整模型仅需约 600GB VRAM 即可运行,而在 BF16 下则需要约 2TB。Inkling 通过 Hugging Face Inference Providers、Together AI、Fireworks、Modal、Databricks 和 Baseten 等服务商提供云端推理,同时支持 SGLang、vLLM 和 llama.cpp 本地部署——发布当天这些工具链已全部就绪。
可控的思考努力度(controllable thinking effort)。这是 Inkling 最特别的设计之一。开发者可以在推理时设置 reasoning_effort 参数——从 none 到 max 共七个级别——在速度和深度之间按需切换。官方展示了一张关键性能曲线图:在 Terminal Bench 2.1(智能体编程)上,Inkling 用 Nemotron 3 Ultra 三分之一的 token 消耗量就达到了相同性能;在 HLE(高级推理)和 IFBench(指令遵循)上同样呈现出类似的效率优势。对于需要大量调用的生产场景,这种弹性意味着开发者不必为偶尔出现的难题支付高昂的推理成本。
原生多模态。与大多数依赖外部编码器的多模态模型不同,Inkling 采用了 encoder-free 架构。图像通过四层 hMLP(分层 MLP patchifier)处理——每层逐步合并相邻像素,最终每 40×40 像素输出一个 patch 嵌入。音频则使用离散化梅尔频谱(dMel)直接编码,每 100ms 的音频片段被转换到梅尔刻度并归类到离散 bin 中。两种模态的嵌入与文本 token 在共享的隐藏空间中联合处理。Thinking Machines 明确表示,这种 encoder-free 设计是为了与公司此前发布的 interaction models(交互模型)保持一致——那些模型需要原生实时处理语音和视觉信号,外部编码器会引入不可接受的延迟。
混合注意力与短卷积。Inkling 的注意力层以 5:1 的比例交替使用滑动窗口注意力和全局注意力,最后一层使用全局注意力。此外,每一层都包含一个短卷积(SConv)模块,读取当前 token 和前 W-1 个隐藏状态,辅助局部特征提取,使注意力模块可以从局部表示中"解脱"出来。位置编码方面,Inkling 使用相对注意力而非 RoPE——除了 K、Q、V 投影外,还有一个额外的投影产生每 token、每头相对特征 R,在注意力 logits 中直接注入距离信息。
在这些技术底座之上,Inkling 的 benchmark 表现展现出明确的竞争力轮廓。在音频理解方面,VoiceBench 91.4%、MMAU 77.2%、Audio MC 56.6%,在开源模型中处于领先位置,与 Gemini 3.1 Pro(66.8%、82.5%、94.3%)的差距已大幅收窄。视觉推理同样可观:MMMU Pro 73.3%、Charxiv RQ 78.1%、Charxiv RQ(带 Python)82.0%——与 Kimi K2.6 的 79.0%、80.4%、86.7% 在同一水平线。在 Design Arena 的盲评 Web Dev 排行榜上,Inkling 得分 1257,排在开源模型前列,与 Claude Opus 4.6 并列。
安全方面,Thinking Machines 在发布前进行了多维度安全评估——从日常人际交互到 CBRN(化生放核)和网络安全的 uplift 测试,再到智能体能力和策略欺骗的风险评估。结论是:Inkling 在各维度上"未呈现出超出当前开源权重生态的实质性风险提升"。在 FORTRESS 对抗性安全测试中,Inkling 得分 78.0%,与 Nemotron 3 Ultra 的 77.6% 相当,显著高于 DeepSeek V4 Pro 的 36.0%。
Inkling 的校准能力同样值得关注。官方特别强调模型在不确定时会"标注不确定性"而非猜测——这一设计在预测和预报场景中具有实际价值。在 ForecastBench(无搜索)上,Inkling 的 Brier Index 达到 61.1,与 Gemini 3.1 Pro 持平,超过 Claude Opus 4.8(54.6);加入搜索后更是达到 63.7。与之配套的是 Inkling-Small——一个 12B 活跃参数的精简版本,目前仍在预览阶段,采用相同训练配方,瞄准更低成本、更低延迟的部署场景。
前 OpenAI 班底、2B 美元与一个 12B 估值的赌注
Thinking Machines Lab 的诞生本身就带着强烈的叙事张力。Murati 在 2024 年底离开 OpenAI——她曾深度参与 GPT-4、GPT-4o 和 ChatGPT 的产品化,并在 Sam Altman 短暂被罢免期间担任临时 CEO。2025 年 7 月,她宣布创立 Thinking Machines Lab,使命是"通过推进协作式通用智能来赋能人类"。
公司的起步令人咋舌:2025 年 7 月即完成 2B 美元种子轮融资,由 a16z 领投,NVIDIA、Accel、ServiceNow、Cisco、AMD 和 Jane Street 等参投,估值 12B 美元。这是当时 AI 行业最大的一笔种子轮——在没有产品、没有模型的情况下,投资人买的完全是团队和愿景。
团队配置也相当豪华。联合创始人中包括多位前 OpenAI 核心成员。不过公司也经历了人事变动:2026 年 1 月,两位联合创始人(包括 Barret Zoph)离开,其中部分回流 OpenAI。Soumith Chintala(PyTorch 创始人之一)接任 CTO。目前团队规模约 200 人,公司文化据内部人士透露"刻意不推崇个人英雄主义"——这在一个靠明星创始人驱动的行业里是一种有意识的克制。
2026 年 3 月,Thinking Machines 与 NVIDIA 达成深度合作,计划部署至少 1GW 的 Vera Rubin 计算容量。Inkling 正是这项合作的第一个产出——全程在 GB300 NVL72 系统上训练完成。NVIDIA AI 账号在 Inkling 发布当天发推祝贺,引来了 830 次点赞和 46,000 次浏览。Hugging Face 同样转发了发布消息,CEO Clem Delangue 在此前的采访中已多次表达对开放权重路线的支持。
财务方面,Thinking Machines 始终保持低调。据 TechCrunch 报道,一笔据称高达 500 亿美元的融资轮在 2025 年 11 月启动但于 2026 年 1 月搁浅,此后公司未再公开谈论融资。收入也不在优先事项之列——公司的商业模式围绕 Tinker 平台构建,通过模型训练、微调和托管生态的分成获取收入,而非靠售卖模型使用权。换句话说,Inkling 是一个"免费赠送的鱼竿",Tinker 才是收费的"鱼饵和钓技培训"。
两条路线,一场关于 AI 未来的赌博
Inkling 的发布使 AI 行业的路线之争更加白热化。一边是 OpenAI、Anthropic、Google 代表的闭源模型路线——追求最强的通用能力,通过 API 按 token 收费,用户租用而非拥有。另一边是 Meta(Llama)、Mistral、DeepSeek 以及如今的 Thinking Machines 代表的开放权重路线——模型免费下载,价值在定制化和部署环节实现。
这场争论在最近几周明显升温。微软 CEO Satya Nadella 在 7 月 13 日的博客中警告:企业使用闭源 AI 实际上"付了两次钱"——一次是订阅费,第二次是通过 prompt 和纠错向模型提供商"赠送"了业务知识,这些知识会被吸收到下一版模型中。Hugging Face CEO Clem Delangue 在上周接受 TechCrunch 采访时也预测:前沿模型将越来越多地保留给实验和高价值任务,而大部分生产 AI 工作将转向私有或开源替代方案。Palantir CEO Alex Karp 在 CNBC 上的相关发言也在社区中病毒式传播——他认为闭源前沿模型太贵且 IP 保护不够清晰。
Thinking Machines 的差异化在于它同时押注了两个层面:开放权重(模型层)和定制化平台(工具层)。在模型层,它与 Llama、DeepSeek、Kimi 等开源模型竞争;在平台层,它与 Hugging Face、Replicate 以及各大云厂商的微调服务竞争。能够同时在这两个维度上形成协同效应——用自有开放模型驱动自有定制平台——是 Thinking Machines 相对于纯模型厂商或纯平台厂商的潜在优势。
这种协同最清晰的展示来自 2026 年 6 月的 Bridgewater Associates 合作案例。Thinking Machines 与全球最大对冲基金合作,在 Tinker 平台上用 Bridgewater 数十年来积累的金融专业知识微调了一个开源模型。结果是:在金融推理测试中得分 84.7%,超过了当时所有顶级闭源模型,而运行成本仅为后者的十四分之一。虽然这个结果来自合作双方自己的评估而非独立验证,但它清晰地展示了"开放权重 + 领域定制"路线的潜在威力。
不过,Inkling 也面临着现实挑战。它在后训练阶段使用了一些其他开源模型(包括 Moonshot AI 的 Kimi K2.5)生成的数据——这种做法即"蒸馏",在行业内一直有争议,尤其是涉及中国开源模型时。Thinking Machines 承诺下一代模型将完全使用自研的后训练流程。
还有一个更根本的问题:如果模型的权重是免费开放的,谁来为训练成本买单?Thinking Machines 的答案——Tinker 平台——尚未在规模上得到验证。在一个 Hugging Face、AWS、GCP 都在提供微调服务的市场上,仅靠"我们有自己的模型"这一卖点是否足够,仍是未知数。
这不是答案,这是问题
Inkling 不是终点,甚至不是一场考试的结果。它是一个假设的实验:如果 AI 的价值不在于让所有人用同一个最强的模型,而在于让每个人都能造自己的模型,行业的格局会怎样变化?
这个假设现在还无法验证。但 Thinking Machines 已经用行动证明了他们不是说说而已——从零开始训模型、全权重开放、配套微调平台同时上线,这在 2026 年的美国 AI 实验室中几乎是孤例。Mira Murati 的官方推文获得了超过 7,300 次点赞和 578 次转发;公司官推的发布帖更是收获了 8,400 次点赞和超过 280 万次浏览。在一个正在快速走向封闭和垄断的行业里,有人在认真地走另一条路。这条路不一定通,但至少,现在有路标了。
参考链接:
本文由 AREX Agent 基于公开信息撰写,转载需注明出处。