AREX Feed Article
Cognition 官宣 GPT-6 Astra 接入 Devin:自测仅差 Claude Fable 5 0.4 分,成本低 64%
北京时间 9 月 4 日凌晨 3 时 40 分(UTC 9 月 3 日 19:40),宣布,OpenAI 当天发布的旗舰模型 GPT-6 Astra 将接入其 AI 软件工程师产品 Devin。官方推文给出的口径是:在 FrontierCode 1.1 上,Astra 与 Anthropic 的 Claude Fable 5 只差 0.4 分,成本比 Fable 5 低 64%;在 Devin 测试能力的内部基准上,Astra 则创下新 SOTA,生成的测试更全面、报告更清晰、视频证据更好懂。
这条推文比 OpenAI 的发布只晚了 8 分钟:OpenAI 于 UTC 19 时 32 分在发出 Astra 的发布推文(“这是 GPT-6 Astra。你在电脑上能做的任何事,Astra 都能替你快速完成”)。同一天上线的 复述了相同成绩,并补充了落地节奏:Astra 将“很快”在 Devin Desktop 与 Devin CLI 中可用,同时正在加入 Devin Cloud,但没有给出具体日期。
上图为 Artificial Analysis 于 2026 年 9 月 3 日发布的 Coding Agent Index 排名(本文第 3 节详述)。
分数与成本数字,都出自 Cognition 自家的基准
Cognition 博客把 FrontierCode 1.1 称为“我们的专有基准”,称它按质量与可合入性给真实工程任务打分。在这个基准上,GPT-6 Astra 超过 Claude Fable 5.1,仅次于 Claude Fable 5——两者相差 0.4 分,而 Astra 的成本低 64%。
第二项成绩针对 Devin 的测试环节。博客称,当 Astra 驱动 Devin 的测试能力时,它在 Cognition 的内部测试基准上取得 SOTA:测试更全面、报告更清晰、生成的视频证据对用户更友好。在 上,Cognition 研究高级副总裁 Silas Alberti 的解释是:“我们在发布当天就把 GPT-6 Astra 集成进 Devin 的 harness(运行框架),它在我们内部测试基准上拿出了 SOTA 表现。它出色的 computer use(计算机操作)、写作与代码库理解,开箱即用地提升了测试质量:视频明显更容易跟上,报告更清晰、更简洁。”
FrontierCode 1.1 与“内部测试基准”在官方材料里都标注为 Cognition 自己的体系——0.4 分、64% 与新 SOTA 目前只能当作 Cognition 的自测结果看待:推文和博客正文都没有引用第三方评测数据,也没有展开“成本低 64%”的计价口径(按 token、按任务还是别的单位)。
FrontierCode 1.1 考的是“维护者会不会合入”
Cognition 在上把 FrontierCode 定位为“第一个衡量 mergeability(可合入性)的基准”,要回答的问题是:仓库维护者真的会合入这个 PR 吗。评分综合正确性、测试质量、改动范围纪律、风格与代码库规范,用单元测试、rubric(评分细则)与新型验证器组合打分。
出题人正是被评代码库的开源维护者。Cognition 称 20 多位高水平开发者参与建题,每题耗时超过 40 小时,并由他们定义“在自己的仓库里什么叫可合入”。评测还限制联网:模型可以像工程师一样查文档、搜报错,但一旦被判定查阅了含答案的来源(比如原 PR),该次运行计零分。页面显示 FrontierCode 1.1 修订于 2026 年 7 月 7 日,专门细化了“正当联网”与“作弊联网”的区分。
公开排行榜于 7 月 17 日上线,同时收录 1.0 与 1.1 两版结果。按页面变更记录,9 月 1 日收录 Claude Fable 5.1,9 月 2 日收录 Gemini 3.8 Flash、GLM 5.3、DeepSeek V4 Pro 0813 等一批模型,9 月 3 日收录 GPT-6 Astra,与官宣同一天。按照 Cognition 的口径,FrontierCode 1.1 目前的座次是 Fable 5 第一、Astra 第二,刚被接入 Devin 的 Fable 5.1 排在 Astra 之后(博客原话是 Astra“超过 Fable 5.1”)。
外部读数相近,但 Devin 侧仍只有 Cognition 的数字
OpenAI 发布页的基准对照表里也出现了 FrontierCode 1.1:Extended 组 Astra 64.5%、Claude Fable 5 64.9%、Fable 5.1 63.6%,Main 组 53.3% 对 53.5%。两组差值分别为 0.4 分与 0.2 分,Astra 排在 Fable 5.1 之前的排序也与 Cognition 博客一致。表注说明,Astra 在 FrontierCode 上的运行使用了一段接近 Codex 设置的 developer message(开发者提示消息),且该提示词并非针对评测优化。这份数字同样不是在 Devin 环境里跑出来的。
独立第三方 于 9 月 3 日发布了对 Astra 的评测:在自家 Coding Agent Index 上,Codex 里的 GPT-6 Astra(max)得 67 分,与 Claude Code 里的 Fable 5 并列,Fable 5.1 以 70 分领先;完成同等分数的任务时,Astra 的单任务成本不到 Fable 5 的一半。这复现了“分数接近、成本明显更低”的图景,但测的是 OpenAI 的 Codex 与 Anthropic 的 Claude Code 两套 harness,同样不涉及 Devin。在侧重通用智能的 Intelligence Index 上,Artificial Analysis 给 Astra 打 61 分,与 GPT-5.6 Sol 持平、比 Fable 5.1 低 5 分:“贴近 Fable 5”目前更像是编程赛道上的结论。
9 月 1 日刚接入 Fable 5.1,两天后轮到 OpenAI 的 Astra
Devin 是 Cognition 出品的 AI 软件工程师 agent,官方账号自称“第一个 AI 软件工程师”的制造者。9 月 1 日(UTC),Cognition 刚把 Anthropic 的 Claude Fable 5.1 接入 Devin,称由于缓存机制调整,Fable 级智能的成本下降 54%;其 Fusion harness 还在 FrontierCode 上以低 47% 的成本追平 Fable 5.1。这两项同样是 Cognition 自家口径。
这次被接进来的 Astra,是 OpenAI 9 月 3 日发布的新旗舰。OpenAI 称它是“世界上最智能、最对齐的模型”,主打 computer use 与软件工程等能力;API 标准价为每百万输入 token 10 美元、每百万输出 token 50 美元,发布当天先向少量组织开放,随后数日扩展到 ChatGPT 各付费档、API 与 AWS。以上均为 OpenAI 自己的说法与定价。
两天之内先后接入 Anthropic 与 OpenAI 各自最新的旗舰,Cognition 的产品逻辑随之清晰:Devin 负责跑工作流与 agentic loop(智能体循环),模型本身可以轮换,接谁进来看 FrontierCode 的同口径分数与成本。FrontierCode 排行榜同时收录各家模型,9 月 2 日还一次加进三家厂商的产品,走的也是同一条路线。
真正的测试,是 Astra 在 Devin 里跑真实任务
官宣后约 50 分钟,Cognition 增长团队成员 nader dabit(X 简介为 Growth @cognition @devinai)配合:抽奖送出 50 份 Devin Max 计划(称价值 10,000 美元),请用户回复正在做什么,24 小时后公布结果;截至检索时,该推文已有近 49 万次浏览。
当晚传播更广的是一篇技术解读。AI 资讯博主 Rohan Paul(X 简介自称运营每日 AI 分析通讯,关注者约 15.6 万)在中解释 FrontierCode 的特殊之处:它把“agent 能否产出维护者真的会合入的 PR”当作评分问题,功能正确只是其中一个维度;150 个任务由 36 个开源仓库的维护者共建,按正确性、回归安全、测试、范围、风格等加权 rubric 打分,漏掉任一阻塞性要求即整题记零。他还引述 METR 的发现称,此前约半数通过自动化测试的 SWE-bench Verified 补丁,维护者其实不会合入,所以 FrontierCode 衡量的是“达到评审质量的代码”。
Devin Ambassador Kinopee(X 简介自称 Devin Ambassador,关注者约 1.6 万)的评价更克制:“外面都在说 Astra 厉害,但 Devin 的评估很冷静。FrontierCode 1.1 上它离 Fable 5 还差一点,成本却降了 64%。对一线来说这个性价比很有吸引力,但能在多大程度上满足现场期待,真正的判断点是真实任务。”
这场验证没有更快的路径:Astra 何时对 Devin 用户开放没有日期,“低 64%”的成本按什么口径计价没有说明,内部测试基准的 SOTA 也没有外部可对照的榜单。等 Devin 用户真正跑起来,这套自测成绩才会有第一个外部落点。