AREX Feed Article
Kun Chen 实测 Grok 4.6:一天耗尽一周额度,Musk 回"Looking into it"
8 月 13 日,FirstMate 负责人 Kun Chen(@kunchenguid)在 X 贴出。模型的判断力获得他的高评价,但他同时算了一笔量化账:他所持最高档的 SuperGrok Heavy 订阅,一周的用量配额在一天、且多为单线程的使用中就被耗尽。
同等工作量放到 Anthropic 或 OpenAI 的 200 美元订阅上,按他的估算只占约 20–30%。他的结论是:模型可以背书,订阅没法向消费者推荐。原话为 "i can totally stand behind the model but i can't really recommend the subscription purchase for consumers"。
这是对 SpaceXAI 刚上线的 Grok Bot 的一次直接跟进。中称,SpaceXAI 本周推出 Grok Bot:每个 Bot 拥有自己的云端电脑,可访问用户指定的应用、网站和邮箱;测试版面向 SuperGrok Heavy、Cursor Ultra 和 Cursor Teams Premium 订阅者开放。Grok Bot 与聊天机器人 Grok 是两回事。Kun Chen 正是以 SuperGrok Heavy 用户的身份完成这次实测。
图片来源:Dominika Zarzycka/SOPA Images/LightRocket via Getty Images(CNET 配图)。
一周额度,一天见底
他把 Grok 4.6 用在两个位置:一是他直接对话、管理其他全部 agent 的 FirstMate 编排器(orchestrator),二是在部分实现任务里直接干活的 worker agent。原话是 "a full day of mostly single-threaded usage exhausted a whole week of quota"。
"mostly single-threaded" 意味着这还不是多线程并行的高负载用法,一周额度照样见底。对比账同样具体:"the same work will translate to about 20-30% of the $200 subscription from anthropic or openai using opus or sol",同样的活在 Anthropic 或 OpenAI 的 200 美元订阅上用 Opus 或 Sol 跑,只消耗约 20–30% 的额度。
额度问题在帖子下立刻有了后续。 在评论区开玩笑,说 Musk 要是开始发"免费重置额度"的推文,他认为光这一条就能让 Grok 市占率涨 20%。
Kun Chen "i need a reset pretty much right now!"。
评论区也有相反口径。同档订阅的 自称重度用户,一整天只用了约 5%,还说自己在 Codex 和 Claude 上两天就烧完额度; 则说体验完全相反,他取消了 Anthropic 订阅,因为那边的额度比 SuperGrok 更难用。
配额消耗随用法波动明显。需要说明,这是一篇一手体验报告,不是基准测试。
一天里几乎每个决定都做对了
他的核心观察是判断力(judgment)。编排器日常要做的判断包括:低风险改动是快速做掉还是加保护、这个决定要不要上报给用户、任务继续做还是退一步。
他写道 "this really tests whether a model was trained with the right rewards",这考验模型是否被用正确的奖励训练出来。
他说很多模型在判断力上崩掉:"sol will remodel my kitchen before making me breakfast"(Sol 会先把厨房重装一遍,才给你做早餐);"opus 5 will go down rabbit holes and come back with an essay but no rabbit"(Opus 5 会钻兔子洞,最后带回一篇论文,却没有兔子)。
Grok 4.6 的表现是 "throughout the whole day, grok 4.6 almost made every decision right for me"。他刻意给了它大量自主权:该合并的时候它会合并,在他真正在意的事情上向他申请批准,阻止 worker agent 过度设计,在安全的前提下经常建议先上线、后修复(ship first fix later)。
速度他没展开:"yes it's fast and it's great. everyone knows this so i'm not going to repeat it."
评论区也有人报告相反体验: 说 Sol 虽慢但犯错更少,Grok 没用他的 pgTAP 跑数据库测试,按他的规则跑也过不了 GitHub 的 CI。
Musk 回了句 "Looking into it"
帖子发出两个多小时后(UTC 16:40 发帖、18:52 回复),Elon Musk 在评论区回了一句 (正在查)。
这条回复在被核对时已有约 3400 个赞;原帖则有约 2963 个赞、176 条回复、超过 18.5 万次浏览。Kun Chen 回了一个火箭表情。
Kun Chen 的收尾是:"overall, grok is on a great trajectory of delivering the most useful model in the world that's fast, pleasant, and capable"。
但他希望团队意识到 "how much this pricing problem is holding back their model + grok build harness' adoption",即定价问题正在拖住模型本身和 Grok Build harness 的采用。
他在里说,借 Grok Bot 的 promo,他用 SuperGrok Heavy 换到了一个 Cursor Ultra,接下来要看 Cursor Ultra 的额度是否更好用。在本文核对的公开讨论中,Musk 只有这一句 "Looking into it";配额会不会调整、怎么调,仍是开放问题。