AREX Feed Article
Kimi K3 被 Unsloth 压到 1-bit,1.56TB 砍到 594GB,还能打 Claude
2.8 万亿参数,压进 594GB
Unsloth AI 把 Kimi K3 压到了 1-bit。
Kimi K3 是 Moonshot AI 7 月 27 日刚开放权重的模型,2.8 万亿参数,满血版需要 1.56TB 存储。Unsloth 用动态量化把它砍到了 594GB——体积减少 62%,精度保留 78.9%。
联合创始人 Daniel Han 在 X 上放出四路对比视频:同一个 prompt,生成一段玻璃鱼缸侧面出现裂纹并爆裂的物理模拟,分别跑在 1-bit Kimi K3、原版 Kimi K3、Claude Opus 5 和 GPT 5.6 上。
1-bit 版本在 4 张 B200 上跑到 36 tok/s,水花飞溅、玻璃碎裂、水位线下降的物理效果与原版和闭源竞品几乎分不出高下。
推文 24 小时内拿下 21 万浏览、1369 赞、502 个书签。
四路对比一出,社区掐着计算器进场
Daniel Han 在评论区补全了完整 prompt——那段指令长达 280 词,细化到"水压随深度递减""鱼尝试逆流游动""玻璃碎片有角速度和空气阻力"。他解释推文放不下,"所以贴在这里"。
社区反应迅速裂成两派。
一面是算账派。"4 张 B200 叫'本地'?"投资人 Mazdak Rezvani(@mazdak)算了一笔账:单张 B200 市价 3 万到 4 万美元,4 张合计 12 万到 16 万。"我刚意识到,我的 Mac Studio 不是我以为的救世主。"
另一面已经跑起来了。开发者 @PreciousReviews 在回复中贴出实测数据:"解码 11.2 tok/s,预填充 40-50 tok/s。正在测 Q2。"
量化开发者 Oleg Kais(@oleg_kai)的评价获得了 7 个赞:"78.9% 的准确率换这种压缩比,比我预想的好太多。"他追问了一个更尖锐的问题:"当量化搞错了物理,水是不是就不动了?"
中文社区也在快速跟进。@verysmallwoods 的总结推文写道:"一台 Mac Studio 加 128GB 内存就能在本地跑。开源模型能压到这个体积还保住可用性,挺值得关注。"
Andrew Giles(@giles_home)的评论拿了 62 个赞,是评论区最高赞之一:"这让人不禁想问,闭源实验室到底在背后用了什么量化精度。"
Kimi K3 开源那周,华盛顿在讨论封杀它
1-bit 量化发生在一条更紧张的时间线上。
7 月 16 日,Moonshot AI 首次展示 Kimi K3,订阅量瞬间冲垮服务器,公司被迫暂停新注册。7 月 23 日,CNN 发文《为什么中国的 Kimi K3 让美国如此不安》。7 月 27 日,Moonshot 正式开放模型权重下载——这是全球首个开放的 3T 级别模型。
同一天,白宫科技政策主管 Michael Kratsios 声称 Moonshot 通过大规模蒸馏 Anthropic 的 Fable 模型获得了 K3 的能力。财政部长 Scott Bessent 承诺调查,放话"开源不是对美国知识产权的开放季"。
Axios 报道称,政府正在考虑全面禁止前沿中国模型。近 200 家创业公司——包括 Y Combinator——联合组成"小科技协会"反对禁令。一位创始人告诉 Politico:"会有数百家公司一夜之间死掉。"
前白宫 AI 顾问 Dean Ball 的判断是:K3 "不能用蒸馏单独解释",且开源权重模型"实际上无法被管制"。他预测政府会制造监管风险而非直接封禁。
7 月 29 日,Unsloth 放出 1-bit 量化。技术突破恰好踩在最敏感的外交节点上。
1.56TB 砍到 594GB,还剩多少本事
Unsloth 的 1-bit 量化靠的不是一刀切,而是动态策略:只把模型的关键层升到 8-bit,其余压到 1-bit。这与社区常见的均匀量化有本质区别。
三条数据说明效果:
- 594GB 的 UD-IQ1_S 量化:perplexity 2.58,top-1 准确率 78.9%
- 711GB 的 2-bit 版本(UD-IQ2_XXS):准确率升至 84.1%
- 861GB 的 Q2 版本(UD-Q2_K_XL):准确率达到 90.4%
对比更直观:社区另一个 618.9GB 的 1-bit 量化,perplexity 飙到 54.56——比 Unsloth 版本差了 21 倍。Unsloth 文档直接评价:"这突显了动态量化加正确校准的重要性。"
Kimi K3 本身为此做了铺垫:Moonshot 从 SFT 阶段就引入了量化感知训练,使用 MXFP4 权重和 MXFP8 激活值。Unsloth 在 llama.cpp 上做了分叉,加入视觉支持、修复大 batch size 下的 token budget 问题、转换 Kimi 的 chat template。
硬件门槛:动态 1-bit S 需要 610GB 总内存(RAM + VRAM),刚好落在 Mac Studio 128GB 统一内存配合外接扩展、或 DGX Station 的区间内。4 张 B200 不是唯一选择。
开源模型最大的痛,正在被量化消解
过去两年,开源模型社区面对一个死结:模型越接近前沿,体积越大,能跑的人越少。Kimi K3 的 1.56TB 是一道墙——一块 RTX 5090 显存的 50 倍。不做量化,它是新闻里的模型,看得见摸不着。
Unsloth 的 1-bit 把墙变成了门槛。594GB 仍然不便宜,但它把准入条件从"数据中心专属"拉到"高端工作站可及"。
投资人 Gavin Baker 在 Kimi K3 开源后写道,这"可能是一个转折点——对 Anthropic 和 OpenAI 是利空,对世界上所有其他公司是利好。"他的逻辑是:一个只有两三家实验室赚取 90% 推理利润的世界,对经济的其他每一层都是坏消息。
SmarterX 创始人 Paul Roetzer 的判断更直接:中国向市场倾泻廉价、高性能的模型,不是一个商业决策,而是一种策略。"他们愿意走美国可能不愿走的路。"
当 Kimi K3 的 1-bit 版本能在本地跑出可用结果时,闭源模型的围墙又多了一道裂痕。
本地跑前沿模型的入场券,叫 594GB
Kimi K3 的开放权重和 Unsloth 的极限量化,在 7 月的最后一周汇合。前者决定了模型能力的上限,后者决定了多少人够得到这个上限。594GB 仍然是一道不低的门槛,但它不再是一堵墙——是一张有明确价格的入场券。