AREX Feed Article
Grok 4.6 上线 Devin:Cognition 自评超越 GPT-5.6 Sol、仅次于两款 Claude
北京时间 8 月 13 日 00:38,Cognition 在 X 上:Grok 4.6 现已可用于 Devin。按官方口径,相比 Grok 4.5 是「显著改进」(significant improvement),在自家基准 FrontierCode 1.1 上超越 GPT-5.6 Sol,只排在 Claude Opus 5 与 Claude Fable 5 之后。
是 Devin 的开发商,其账号简介自称「第一个 AI 软件工程师」的制造者。xAI 于北京时间 8 月 12 日晚发布 Grok 4.6,定价 $2/M 输入、$6/M 输出 token,先接入 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等渠道()。Devin 是这串渠道之外的最新一站。
61.3 分,FrontierCode 榜单上压过 GPT-5.6 Sol
「超越 Sol、只落后 Opus 5 和 Fable 5」这一排序,是 Cognition 在 FrontierCode 1.1 上得出的。将这套基准定义为「按真实世界工程任务的质量与可合并性(mergeability)给模型打分的专有基准」。官宣推文附带的完整榜单(满分 100)是:
- Claude Fable 5:64.9
- Claude Opus 5:63.6
- Grok 4.6:61.3
- GPT-5.6 Sol:60.6
- Claude Opus 4.8:59.6
- Kimi K3:58.2
- GPT-5.5:56.7
- Grok 4.5:56.5
- Claude Sonnet 5:56.2
- GPT-5.6 Terra:55.8
- SWE-1.7:54.3
Grok 4.6 比 Grok 4.5 高出 4.8 个百分点。xAI 的发布页也列出同一基准的 Extended 版本分数:Grok 4.6 为 61.3%、GPT-5.6 Sol 为 60.6%、Fable 5 为 63.6%,与 Cognition 的榜单一致。两份数字都出自当事方自己的评测。
Cognition 在里把 4.6 在 Devin 内的强项讲得更具体:「在触碰任何代码之前,特别擅长彻底的代码探索与根因分析」(thorough code exploration and root cause analysis before touching any code)。博客补充了两条:擅长匹配仓库既有约定,测试环节保持严格。
ZedgaGhost(账号简介自称支付行业 lead engineer)说:「『root cause analysis before touching any code』这句才是真正的头条。我清理 agent 产出的工作,有一半是在撤销过早的修改。」
NVIDIA 称训练与推理都在 GB300 NVL72 上
NVIDIA 官方账号于北京时间 8 月 13 日 00:27 ,补上了硬件细节:Grok 4.6「在 NVIDIA GB300 NVL72 上训练与运行,通过 NVLink 提供卓越的性能、可靠性以及最低的 token 成本」(running and trained on NVIDIA GB300 NVL72 with NVLink)。
按 NVIDIA 的说法,4.6 的训练和推理都在 GB300 NVL72 这套平台上完成;「最低 token 成本」与 xAI 公布的 $2/$6 定价相互呼应,但这是 NVIDIA 的单方声明。这条祝贺帖的发布时间比 Cognition 的 Devin 官宣早 11 分钟,祝贺针对的是模型发布本身。
Musk:Grok 4.7 会超过现有所有模型
Elon Musk(@elonmusk)在 Cognition 官宣帖下(北京时间 02:24),一次写下三个判断:Grok 4.7 将超过现有所有模型(will exceed all current models);Anthropic 是家出色的公司,很可能很快发布改进后的模型;SpaceX 的训练语料「太棒且独一无二」,若哪个模型在真实世界工程上比 4.7 更强,他会「震惊」。
这些目前都是预测:回复里没有 4.7 的时间表,也没有评测数据;SpaceX 语料的独特性出自他本人的说法。第二个判断给「超过所有模型」的说法留了后门:Anthropic 可能很快更新。
立即可用的是 4.6,待验证的是 4.7
Devin 博客写的是 now live:Grok 4.6 已在 Devin Desktop 与 Devin CLI 生效,用户现在就能切过去用。榜单顺序也有人质疑:创始人兼投资人、早年在 Uber 任职的 Martin Hedevåg Cognition:「仍然想不通 Opus 5 怎么会排在 Sol 前面,按个人体验,差得远。」
待验证的部分同样明确:FrontierCode 1.1 是 Cognition 制定和维护的自有基准,61.3 分是自报数据;Musk 的 Grok 4.7 没有日期。现在能立刻核实的,是 Devin 里的 Grok 4.6 是否真如官宣所说:先查根因,再动代码。