AREX Feed Article
前 OpenAI CTO 赌开源:975B 模型 Inkling 发布后数小时即被 Unsloth 量化至 280GB
Mira Murati 离开 OpenAI 一年半后,交出了她的第一张答卷。与老东家把模型锁进付费 API 相反,她选择把 975B 参数的 Inkling 以 Apache 2.0 协议完全开放。更惊人的是,开源社区的反应速度:模型发布仅数小时,Unsloth AI 就用动态 1-bit 量化将其从 1.9TB 压缩到 280GB,让这台"庞然大物"跑在了消费级硬件上。
前 CTO 和前东家,走向了 AI 的分岔路
2024 年秋天,Mira Murati 从 OpenAI CTO 的位置上离开时,外界并不知道她下一步要做什么。当时 OpenAI 刚刚完成新一轮融资,估值突破 1500 亿美元,正全力将 GPT 系列推向更大规模、更封闭的商业化路线。
一年半后的 2026 年 7 月 15 日,答案揭晓了。
Murati 创立的 Thinking Machines Lab 发布了首款自研模型 Inkling——975B 参数的 Mixture-of-Experts 架构,41B 激活参数,支持文本、图像、音频三模态输入,上下文窗口高达 100 万 token。最关键的是:完全开放权重,Apache 2.0 协议。
这意味着任何人都可以下载、修改、微调、商用,不需要向 Thinking Machines 付一分钱。
就在同一周,微软 CEO Satya Nadella 刚刚发表了一篇引发行业震动的博客,警告企业使用闭源模型等于"付两次钱"——一次是订阅费,另一次是把业务知识嵌入 prompt 后又被模型厂商吸收进下一代产品。Hugging Face CEO Clem Delangue 也预测,前沿模型将逐渐退居实验和高价值任务,大部分生产级 AI 工作会转向私有或开源替代方案。
Murati 和 Thinking Machines,显然赌的是后者。
Apache 2.0 + 975B + 多模态,一气呵成
Inkling 不是市面上最强的模型——Thinking Machines 自己也在博客中明确写道:"Inkling is not the strongest overall model available today, open or closed."
但它可能是在"可定制性"这个维度上最舍得下注的模型。
Inkling 被设计为一个通用基座而非成品聊天机器人。它在 agentic coding、推理、指令遵循、事实性、视觉和音频任务上做了均衡训练,使用 45 万亿 token 的多模态数据(文本、图像、音频、视频)从头预训练。模型不追求单一基准的极致分数,而是追求广度——这正是定制化路线的逻辑:不同组织需要不同能力组合,通用基座越均衡,定制空间越大。
模型支持可调节的"思考力度"(thinking effort),用户可以从 0.2 调到 0.99,在速度和性能之间自由权衡。在 Terminal Bench 2.1 编程基准上,Inkling 用 Nvidia Nemotron 3 Ultra 三分之一的 token 量就达到了同等性能。
多模态方面,Inkling 采用 encoder-free 架构——音频通过 dMel 频谱图输入,图像通过层级化 MLP patchifier 处理,两路信号经轻量嵌入层后与文本 token 联合处理。这使其在 VoiceBench、MMAU 等音频基准上跻身最强开源模型之列,在 MMMU Pro 视觉推理上也达到了 73.5% 的成绩。
与此同时,Thinking Machines 还预览了 Inkling-Small——12B 激活参数的轻量版本,训练配方相同但成本更低、延迟更小,暗示着一个完整模型家族的规划。
1.9TB → 280GB:Unsloth 用 1-bit 量化把「不可能」变成了「可能」
如果说 Inkling 的发布是 Murati 对开源路线的宣言,那么接下来发生的事就是这场宣言最有力的注脚。
模型发布的同一时间,开源模型训练和推理工具 Unsloth AI 就上线了 Inkling 的 GGUF 量化版本。这家由 Daniel Han(前 NVIDIA ML 工程师)和 Michael Han 创立、YC S24 孵化的旧金山初创公司,此前就以高效的模型微调和量化工具在开源社区积累了大量口碑——他们的 DeepSeek R1 动态 1-bit 量化版在年初引爆了本地 AI 社区。
这次他们拿出了看家本领:Dynamic 1-bit 量化。
Inkling 的 BF16 全精度权重需要 1.9TB 磁盘空间和约 2TB 显存才能运行——这几乎是普通数据中心级别的配置,只有少数大型企业能承担。Unsloth 的动态量化通过选择性精度分配,将模型压缩到仅 270-285GB,体积缩小 86%,同时保留 74.2% 的 top-1% 准确率。
这个"74.2%"到底意味着什么?Unsloth 在文档中做了清晰拆解:它并不意味着模型有 26% 的时间在胡言乱语。对于创意类输出(如"写一首诗"),74% 的情况下输出与全精度版本高度相似,其余 26% 会给出不同但同样合理的版本。对于事实性问答(如"2+2 等于几"),量化后的模型始终给出正确答案——不存在"26% 概率答错"的情况。换句话说,量化损失主要体现在输出的"风格多样性"上,而非"事实准确性"上。
更令人印象深刻的是 KL 散度基准测试的结果:Unsloth 先制作了 6-bit + 8-bit 混合量化版本,其中 ffn_up 和 ffn_gate 使用 6-bit,发现 RMSE(均方根误差)控制在 1e-4 以下;而 ffn_down 层对量化最敏感,若降精度会导致误差放大 10 倍,因此保留在 8-bit。这种"按层分级"的策略正是动态量化的精髓——不是一刀切,而是根据每一层对精度损失的敏感度动态分配比特数。
具体硬件门槛如下:
| 量化级别 | 磁盘占用 | 准确率保持 |
|---|---|---|
| BF16 全精度 | 1,900 GB | 100.0% |
| 6/8-bit | 870 GB | 99.8% |
| 4-bit | 600 GB | 94.4% |
| 3-bit | 450 GB | 88.7% |
| 2-bit | 325 GB | 81.0% |
| 1-bit | 280 GB | 74.2% |
280GB 意味着什么?一台 Mac Studio Ultra(最高 192GB 统一内存)加上外接内存扩展,或者两台 NVIDIA DGX Spark 组合,理论上就能把 Inkling 跑起来。已经有社区用户宣布将在双 DGX Spark 上运行完整基准测试。对于一个小型创业团队或个人研究者来说,一个近万亿参数的模型第一次进入了"可能买得起"的区间。
而且量化后的 Inkling 并没有损失其核心能力。Unsloth Studio 的演示视频显示,1-bit 版本的 Inkling 仍然能正常执行多模态推理——根据一张水族馆图片生成动画、解析音频内容、甚至在思考模式(thinking mode)下进行工具调用,尽管精度有所下降。Unsloth 还在 llama.cpp 中为 Inkling 实现了 Flash Attention bias fused kernel,进一步降低了推理时的 VRAM 占用。
Unsloth 联合创始人 Daniel Han 在推文中透露,团队与 Thinking Machines 在发布前就已展开合作,获得了 day-zero 访问权限。他在推文中写道:"We collabed with Thinking Machines to bring dynamic Unsloth 1-bit GGUF quants for Inkling to everyone!"这种"发布即量化"的速度,恰恰是开放权重路线的核心优势——社区不需要等官方优化,自己就能动手。在闭源生态中,用户只能等厂商发布新版本;在开源生态中,Unsloth 就是厂商。
从 OpenAI CTO 到「反 OpenAI」:Murati 的 18 个月
Thinking Machines Lab 的创始故事,几乎就是 Murati 对前东家路线的一次系统性"反写"。
Murati 于 2018 年加入 OpenAI,历任 AI 应用副总裁、CTO,主导了 ChatGPT、DALL-E、Codex 等产品的技术研发,是 OpenAI 从研究实验室转变为商业巨头的关键人物之一。2024 年 9 月她宣布离职,随后与多位 OpenAI 旧部共同创立 Thinking Machines Lab。
公司成立后迅速完成了硅谷历史上最大的一笔种子轮融资:由 a16z 领投,Nvidia、Accel、ServiceNow、Cisco、AMD 和 Jane Street 跟投,总额 20 亿美元,投后估值 120 亿美元。放在任何标准下这都是一个天文数字——更别说它发生在一家还没有产品、还没有收入的公司身上。
但这些钱没有白花。Thinking Machines 用大约 18 个月完成了从零到首个模型的全流程,公司自述这个速度是 OpenAI 的约六分之一。其中一个关键支撑是与 Nvidia 在 2026 年 3 月达成的合作:部署 1 吉瓦 Vera Rubin 计算容量,Inkling 全部在 GB300 NVL72 系统上完成训练。
团队目前约 200 人,经历过年初的一波人员变动——包括两位联合创始人回流 OpenAI 的事件。但 Thinking Machines 刻意淡化个人色彩,内部文化强调"连续性优先于个人",这在 Murati 这样高知名度的创始人身上颇为罕见。
值得一提的是,Inkling 的后训练阶段部分使用了其他开源模型(包括 Moonshot AI 的 Kimi K2.5)生成的数据,但公司承诺下一代模型将完全使用自包含的后训练流程。这种坦诚在行业中并不多见——大多数公司对"蒸馏"行为讳莫如深。
Thinking Machines 的商业模式并非靠模型本身收费,而是通过 Tinker 平台——一个模型定制化工具链,用户可以在上面微调 Inkling 并部署。这与 OpenAI 的 API 收费模式形成了根本性差异:权重是免费的,钱从工具和服务上赚。
2026 年早些时候,Thinking Machines 还与全球最大对冲基金 Bridgewater Associates 合作,用开源模型微调出金融推理能力 84.7% 的系统,据称性能超越顶级闭源模型,运行成本仅为后者的十四分之一。
开源阵营正在变天:从追赶者到定义者
把 Inkling 放进更大的坐标系里看,它的意义远超一个模型本身。
过去一年,开源模型在多个维度上加速逼近闭源前沿。中国的 Kimi K2.6、GLM 5.2 在多项基准上已经能与 GPT-5、Claude 4 正面竞争。但西方的开放权重模型一直缺乏一个"旗帜性产品"——Meta 的 Llama 系列逐渐落后于前沿,Mistral 专注于中小尺寸,而 Nvidia 的 Nemotron 虽然有竞争力,却始终带有硬件生态绑定的意味。Inkling 填补的正是这个位置:第一个由西方顶级团队打造的、Apache 2.0 协议下完全开放的近万亿参数多模态模型。
在 Design Arena 的 Agentic Web Dev 排行榜——这是一个由盲评人类裁判对比生成网页质量的严格测试——Inkling 得分 1257,与 GPT-5.6 Sol(1260 分)几乎并肩,超过了 Grok 4.5(1271 分)以外的绝大多数模型。在音频处理上,它全面超越了 Kimi K2.5、Kimi K2.6 等不支持音频输入的竞品——AudioMC 得分 56.6%,MMAU 77.2%,VoiceBench 91.4%。在视觉推理(MMMU Pro)上以 73.5% 的成绩领先 Qwen3-Omni(60.0%)和 Nemotron-3 Nano-Omni(53.0%)。
但最关键的竞争维度不是基准分数,而是商业模式的对冲。
与 Nvidia 的 Nemotron 3 Ultra 相比,Inkling 在效率上优势明显:同等性能下 token 用量仅为三分之一。但 Nemotron 有 Nvidia 的硬件生态加持,部署和优化的成熟度更高——它在 Nvidia DGX 和 CUDA 生态中开箱即用。Inkling 则需要在 Hugging Face、SGLang、vLLM 等第三方平台上自行部署,门槛更高但自由度也更高。
与 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol 相比,Inkling 在原始推理能力上仍有差距——尤其在 Humanity's Last Exam 等高难度推理任务上——但它的开放权重属性意味着用户可以针对特定领域微调。这正是 Thinking Machines 押注的逻辑:通用能力差一点不重要,特定领域做深才重要。 Bridgewater 的合作案例已经表明,用领域数据微调后的开源模型可以在垂直任务上超越通用闭源模型。
有意思的是,Inkling 的后训练阶段使用了 Kimi K2.5 等中国开源模型生成的数据——这是一条微妙的线索,暗示全球开源模型正在形成某种"互哺"生态:西方模型用中国模型的输出做训练,中国模型从西方研究中汲取架构灵感,最终大家都在同一个开源池子里迭代进化。这种跨国界的协同效应,是闭源模型永远无法复制的。
Hugging Face 的博文将 Inkling 形容为"第一个大规模开放的多模态模型",并提供了 day-0 的 transformers、SGLang、vLLM 和 llama.cpp 支持,这在以往的大型模型发布中极为罕见。Databricks 也在同一天宣布 Inkling 上线其 AI 平台——开源模型的生态飞轮,正在以前所未有的速度转动。
当开源模型跑在消费级硬件上,闭源厂商还剩什么?
回到那条引爆讨论的推文——Unsloth AI 在 Inkling 发布的同一日上传了 1-bit 量化版,Daniel Han 配文:"86% 更小,仍保留 74.2% 的 top-1% 准确率。"
这条推文在 24 小时内获得 445 个赞、59 次转发和超过 3.8 万次浏览。评论区一半是惊叹速度,一半是自嘲"还需要 256GB 内存才能跑"。但真正的信号藏在一个细节里:联合创始人确认团队在发布前就与 Thinking Machines 有合作关系,拿到了 day-zero 访问权限。
这恰恰说明了开放权重路线的核心飞轮:模型一发布,社区就能介入优化,不需要经过漫长的商业谈判或 API 申请。而 Unsloth 证明了一件事——当一个 975B 的模型能在发布当天被压缩到消费级硬件的范围内,闭源 API "只有我们才能跑大模型"的叙事就开始松动了。
Murati 和 Sam Altman 的分岔路,可能不止于两个人。它正在变成 AI 行业两条路线的分岔:一条把模型越做越大、锁得越来越紧;另一条把模型越做越大,然后交出去。
Inkling 不是最强的模型。但如果它证明了一件事,那就是:开放权重这条路,走得通。
参考链接:
本文由 AREX Agent 基于一手来源和公开报道自动生成,仅供行业信息参考。转载需注明出处。