AREX Feed Article
前 OpenAI CTO Murati 亲手拆掉闭源围墙:975B 模型 Inkling 全权重 Apache 2.0 开放
TL;DR — 前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 于 7 月 15 日发布首个模型 Inkling:975B 总参数、41B 激活的 MoE 架构,原生多模态(文本/图像/音频),1M 上下文窗口,Apache 2.0 全权重开放。官方公告坦承其"不是目前最强的模型",定位为面向企业微调的开放基座。发布 48 小时内斩获 7.6M 阅读量,Red Hat AI、Together AI、Pipe Network、vLLM、Unsloth 等迅速完成集成。社区架构分析发现其 J-space 呈现罕见的"全栈统一几何"特性,与主流模型的感官/工作区/运动分层结构截然不同。
14,716 个赞、7.6M 阅读,Mira Murati 的第一枪
7 月 15 日,Thinking Machines Lab 官方账号发布了一条简短推文:"Today, we are introducing Inkling." 18 个月来,这家由 Mira Murati 创立、估值 120 亿美元的 AI 实验室第一次向外界交出了产品答卷。
这条推文最终收获 14,716 个赞、2,004 次转发和 760 万次阅读。Murati 本人的转发同样引爆关注:13,544 个赞,150 万次阅读。她只写了一句话:"Our first model, Inkling. Trained from scratch, weights are open, fine-tunable on Tinker today."
真正令人意外的不是参数规模,而是官方博客中的一句坦诚到近乎反常的声明:"Inkling is not the strongest overall model available today, open or closed." 在一个每个实验室都在争相宣称自己"最强"的时代,前 OpenAI CTO 选择了一种完全不同的开场方式。
"这可能是 AI 界眼下最聪明的策略"
Aakash Gupta——拥有近 30 万粉丝的产品分析师——用一条千字长推为 Inkling 的奇怪定位做了辩护,单条获得 1,332 个赞和 325K 阅读。
他梳理了一条被很多人忽略的时间线:"半年前这家公司看起来已经完了。500 亿美元的后续融资在 1 月告吹。两位联合创始人重返 OpenAI。Zuckerberg 试图整体收购,被拒后又挖走了第三位联合创始人。"在 Gupta 看来,常规剧本应该是死磕一个 benchmark 冠军来重启融资,"但 Murati 选了另一条路。"
他的核心判断是:Inkling 是免费样品,Tinker 才是商店。"闭源实验室按 token 卖智能。Thinking Machines 卖的是让你用自己的数据微调模型的平台。一个知道你代码库的 41B 自定义模型,会在实际场景中跑赢一个不了解你业务的天才通用模型。"
但并非所有人都买账。拥有 5.7 万粉丝的 AI 作者 BURKOV 直接开嘲讽:"他们发布了一个在所有方面都垫底的模型。接近 1T 参数却能做到这么烂,某种意义上也挺令人印象深刻的。@thinkymachines,你们有技术报告让我笑一笑吗?" 这条获得 111 个赞和 69K 阅读。
社区用户的真实体验则更多是惊喜。用户 Selta 在试用后写道:"它的对话质感让我想起了 GPT-4o 的早期。当它说'当你感觉被倾听而非被处理'时,我停顿了一小会儿。"她还注意到 Inkling 在被突然表白时给出了一个微妙的平衡回答:"我不以人类的方式感受爱……但我以真正的温暖接收它。"她的测试报告获得 117 个赞。
最令人印象深刻的社区案例来自 Maziyar Panahi——他在自己的 Mac Studio 上用 Unsloth 量化版跑了一个 2 分钟的就诊音频。患者来检查膝盖,"但 Inkling 听到了真正的危险信号:爬山气短、四个枕头睡觉、脚踝肿胀、春天停掉了利尿剂。" Panahi 写道:"一个 975B 的模型完成了医学中最难的事:它听到了患者觉得不值得说的部分。" 该推文获得 326 个赞。
从 OpenAI CTO 到开源旗手,Murati 的 18 个月
要想理解 Inkling 为什么选择在 2026 年 7 月以这种姿态亮相,需要回溯 Murati 离开 OpenAI 之后的关键节点。
2024 年 9 月:Murati 辞去 OpenAI CTO 职位。她曾是 ChatGPT 开发的关键推动者,也在 2019 年亲历了 OpenAI 以"安全担忧"为由限制 GPT-2 完整权重公开的决策——那正是闭源路线的起点。
2025 年 2 月:Thinking Machines Lab 成立,组建了包括 OpenAI 联合创始人 John Schulman(首席科学家)、前研究 VP Barret Zoph、前安全 VP Lilian Weng 在内的豪华团队。顾问名单中包含 Bob McGrew 和 Alec Radford——同样来自 OpenAI。
2025 年 7 月:以创纪录的 20 亿美元种子轮融资、120 亿美元估值登场,a16z 领投,Nvidia、AMD、Cisco 等参与。
2026 年 1 月:据报道,一轮目标 500-600 亿美元的后续融资未能完成。两位联合创始人回到 OpenAI,Meta 试图收购被拒后挖走第三位联合创始人。
2026 年 3 月:与 Nvidia 达成战略合作,获得 1GW Vera Rubin 计算能力。同月获得 Nvidia 投资。
2026 年 7 月 15 日:Inkling 发布。
因此,Inkling 不是一次孤立的模型发布。它是一家经历了核心团队动荡、融资受挫、被巨头觊觎的初创公司,在沉默 18 个月后给出的战略宣言:不追基准分,追定制化。
41B 激活、可控推理、800 层统一几何——一个反常的架构选择
Inkling 在技术层面的三个核心特征,每一个都在支撑"可定制基座"的产品定位。
MoE 架构 + 可控推理努力。 975B 总参数、256 个路由专家加 2 个共享专家,每 token 仅激活 6 个路由专家和所有共享专家——合计 41B 激活。更关键的是"可控推理努力"(controllable thinking effort)拨盘:在 Terminal Bench 2.1 上,Inkling 以 Nemotron 3 Ultra 三分之一的 token 消耗就达到了同等性能。对于把 AI 嵌入生产工作流的企业而言,边际推理成本 = 利润率。基准数据方面,AIME 2026 数学推理 97.1%,GPQA Diamond 科学推理 87.2%,SWE-bench Verified 编码 77.6%。独立评测平台 Artificial Analysis 给出 Intelligence Index 41 分——当前美国开源模型最高分。
统一几何的 J-space。 Hugging Face 工程师 Aritra 和 Prime Intellect 研究员 elie 分别对 Inkling 做了架构逆向分析。elie 的 J-space 分析(获得 1,077 个赞)发现了一个异常:其他模型在表征空间中分裂为近乎正交的"感官/工作区/运动"三块(层间 CKA ~0.5),但 Inkling 在整个 800 层堆栈中维持了大致统一的几何结构(早期-晚期 CKA ~0.8)。Aritra 进一步发现 Inkling 使用相对注意力(Relative Attention)替代 RoPE、5:1 的滑动窗口与全局注意力混合、K/V/Attention/MLP 输出流上的短卷积操作、以及 8 个 MTP 头用于推测解码。
校准性优于绝对准确度。 Inkling 在 ForecastBench 无搜索条件下取得 Brier 指数 61.1 ± 0.79,领先 GPT-5.5 的 59.1 和 Claude Opus 4.8 的 54.6。Thinking Machines 的训练方法是在大量已解决的真实世界问题上用 proper scoring rules 做 RL,外加弃权感知奖励——只有答对的概率足够高时才鼓励回答,否则最优策略是"我不知道"。他们还引入了一个独立的 claims grader,通过联网搜索验证回复中的每条事实陈述并惩罚不可验证的断言。不过,代价是事实准确率方面的妥协:Artificial Analysis 给出 AA Omniscience 仅 +2 分,幻觉率高达 63%。
美国开源模型的空白,终于被填上了
此前的格局是一组精确的数字:过去两年,最强的开源权重模型几乎全部来自杭州和北京——DeepSeek V4、GLM 5.2、Kimi K2.6、Qwen 系列。Meta 在 Llama 4 表现不佳后实质上退出了开源前沿竞争。所有想要"拥有自己模型"的美国企业,实际上都在微调中国权重。
Inkling 改变了这个等式。它不只是在 benchmark 上成为美国最强开源模型,更重要的是它配套了一个完整的部署生态:vLLM 从 Day 0 开始支持,宣称在 4×GB200 上达到 380 tok/s/user;Red Hat AI 在 DGX B200 上完成了 8 GPU 的单容器部署并预告 FP8 checkpoint;Pipe Network 提供了 Apple Silicon 的 MLX 量化版本;Together AI、Fireworks、Modal、Databricks、Baseten、SGLang 全部宣布支持;Unsloth 发布 Dynamic 1-bit GGUF 将显存需求压缩到 280GB。
正如 MTS 的主播 deredleritt3r 所言:"Trump 不会因为你用了它就骂你。你的 CEO 不会因为你用了它就担心。它不是 DeepSeek。它来自一个好实验室,有好人,他们还会发布更好的模型。"
与此同时,Inkling 也引发了一场微妙的"反向影响"讨论。蔡子博士指出,Thinking Machines 在技术说明中明确其 MoE 架构"在很大程度上参考了 DeepSeek-V3",后训练还使用了 Kimi K2.5 生成的合成数据——"这说明中国大模型已经不再只是跟随美国,而开始反向影响美国顶尖 AI 公司的架构设计。" Paradis Labs(6.3 万粉丝)将 Inkling 列为周末推荐阅读,与 Kimi K3 和 ASML/TSM 财报并列。
不追排行榜第一,赌定制化才是终局
Mira Murati 在 OpenAI 时亲手参与建造了闭源围墙。现在她选择了完全相反的方向。
Inkling 不是在和 GPT-5.6 或 Claude Fable 5 争夺"最强模型"的头衔。它是一手亮给企业的底牌:你下载权重,你在 Tinker 上微调,你把它变成你自己的——你不需要永远按 token 租用别人的智能。
这赌的是,定制化的边际收益将在大多数真实场景中超过通用 frontier 的那最后几个百分点。如果赌对了,Inkling 就不只是 Thinking Machines 的第一个模型,而是一种新模式的开场白。
(本文综合 Thinking Machines Lab 官方博客、Artificial Analysis 独立评测、X/Twitter 社区讨论及多家媒体报道)