AREX Feed Article
Abacus AI CEO 测评 GPT-6 Astra:大代码库空转吞 token,硬核编程 Fable 5.1 仍胜出
Abacus AI CEO Bindu Reddy 在 X 上发布了,结论与 OpenAI 官方发布口径正面相左:在大型代码库上,Astra “大量空转、吞噬大量 token、做得过度”;Astra 对知识工作者是明显的赢家,但硬核编程仍由 Anthropic 的 Claude Fable 5.1 胜出。帖文发布于 UTC 时间 9 月 6 日 22:16(北京时间 9 月 7 日 6:16),距 OpenAI 宣布 Astra 向 Pro 以上用户全量开放约两天。
这不是全面差评:她把“知识工作者场景”单独列为 Astra 的明确胜场,批评集中在编码一侧。而三天前,OpenAI 刚宣称 Astra 在软件工程等能力上创下新的 SOTA(state of the art,最先进水平)。官方发布词与一位行业人物的实测结论之间的落差,是这条帖文引发的核心争论。
她把差评写成了三条清单
原帖正文只有四行,用三条清单给出大代码库上的判断:
Astra 在大型代码库上:
- 大量空转(spins a lot)
- 吞噬大量 token(guzzles a lot of tokens)
- 做得过度(over does things)
Astra 对知识工作者是明显的赢家(a clear winner),但硬核编程(hard coding)仍由 Fable 5.1 胜出。
发布者身份来自:Abacus AI CEO(她把公司描述为“强大的 AI Agent 与超级计算机”平台),曾在 AWS 与 Google 任职,关注者约 38.3 万。她口中的 Fable 5.1,是 Anthropic 于 9 月 1 日发布的 Claude Fable 5.1,称其为“世界上最先进的编码与知识工作模型”。
截至本稿核验时(北京时间 9 月 7 日上午),这条帖文浏览约 5,500 次、获 89 次点赞和 25 条回复。帖文没有给出测试方法:多大的代码库、什么任务、空转多久、烧了多少 token(模型处理与计费的最小文本单位),都没有公开。可以当作她逐日上手实测的个人结论,但无法当作可复现的数据。
从 “AWESOME” 到差评:发布周的实测轨迹
除特别注明外,本段日期均为 X 帖子自带的 UTC 日期。Reddy 的实测几乎与 Astra 官宣同步,立场一致,指控逐步加码。
9 月 3 日当天,她先与 Fable 5.1 相同:输入 10 美元/百万 token、输出 50 美元/百万 token,当时还“没有全量开放”。随后她为“Astra 彻底摧毁 Fable 5.1”,并给出自己的读法:推理、数学、数据分析、研究上 Astra 胜出,“Fable 5.1 仍是编码之王”。她还:“Astra 目前还只是 PR release(公关发布)……OpenAI 需要尽快让它全量开放。”
9 月 4 日 20:13(UTC), Astra 向所有 Pro、Enterprise、Business Premium 用户在 ChatGPT Work 与 Codex 中开放,并上线 API。约 20 分钟后,Reddy 发出她的“首日”总结:比 Fable 5.1 便宜也更快,但在长时间运行的 agent(智能体)循环(long-running agentic loops)上更差,浏览器使用与 3D 渲染明显更好,“OpenAI 回来了”。
9 月 5 日她把结论写成:浏览器使用选 GPT-6 Astra,硬核编程选 Fable 5.1,简单编码选 GLM 5.3。9 月 6 日的仍偏正面:容易对话、数据分析好、空间感强、知识工作者友好、交付物呈现更清楚,“不像 Fable 5 那样喷术语”。
而那条差评帖(北京时间 9 月 7 日清晨)把问题落到了具体场景:大型代码库。相比她 9 月 4 日“整体略逊”、在长时 agent 循环上更差的措辞,这里的说法明显更重,指向的不只是结果质量,还有成本与效率。
OpenAI 的 SOTA 口径,与她的实测差在哪
对照组的官方叙事同样有据可查。9 月 3 日发布当天,OpenAI 用里的一句话定义 Astra:“你在电脑上能做的任何事,Astra 都能替你快速完成”。随官宣一并发布的则写道,Astra 是“世界上最智能、最对齐的模型”,在电脑操作、浏览、软件工程、网络安全、科学与专业工作上创下新的 SOTA。
补充了数字:FrontierMath Tier 4 拿到 98%,ARC-AGI-3 达到 99.9%。其中有一句话与 Reddy 的指控几乎正面相撞:Astra 经过专门训练,“只提取对当前任务真正需要的上下文,而不是重复手头工作不需要的信息”。她的实测结论恰恰是“做得过度”。两个说法指向同一件事:Astra 面对一个任务时,到底会做多少不必要的动作。
两边也不是同一类声明:OpenAI 的数字来自自家评测体系,Reddy 的结论来自真实代码库使用。铺开的节奏放大了这种不对称:Astra 在 9 月 3 日只向少量组织开放,9 月 4 日才覆盖 Pro、Enterprise 与 Business Premium 用户。
独立指数:Fable 5.1 以 70 分领先,Astra 67 分
第三方基准目前部分支持她的判断。给出 Coding Agent Index(编码智能体指数,综合 DeepSWE、Terminal-Bench v2.1 与 SWE-Atlas-QnA 三个基准):Codex 环境里的 GPT-6 Astra(max)得 67 分,与 Claude Opus 5、Fable 5 基本持平;Claude Code 环境里的 Fable 5.1(max)以 70 分领先全场。
但在 token 效率上,AA 的测量与 Reddy 的体验相反:在其任务集里,Astra 每个任务消耗的 token 约为 GPT-5.6 Sol(max)的三分之一、Claude Opus 5(xhigh)的五分之一;同一得分下,每任务成本不到 Fable 5 的一半。AA 同时确认 Astra 定价是 GPT-5.6 Sol 的 2.5 倍(输入/输出每百万 token 从 4/20 美元涨到 10/50 美元),并测出 Astra 在“Intelligence Index”上与 Sol 同为 61 分,比 Fable 5.1 低 5 分。
两种测量覆盖的任务不同:AA 测的是自家基准任务集,Reddy 说的是真实大型代码库会话,结论无法直接对比。这说明“烧不烧 token”高度依赖任务形态,任何一方的单一测量都覆盖不了另一方的场景。
“为修一个分号,Astra 开了一场电话会”
回复区里出现了一批与她同向的体验分享。自称构建“能扛住真实生产的 AI 系统”的 Franklin Solum :“Astra 在跨一堆任务时感觉很好,但一旦你深入一个大代码库,额外的空转和 token 消耗真的会开始让你难受。Fable 5.1 在这种工作上感觉更对路。”账号 Big Bull 的更形象:“Token 燃烧正在成为新的技术债。Astra 会为修一个分号开一场电话会,Fable 只是把分号修了。”自称 AI 工程师的 Naveen Saradhi :“Astra 是那个天才实习生,改一行代码前先通读整个代码库;Fable 5.1 是直接交付修复的高级开发。”
也有与她直接冲突的样本。自称 Sovantra 创始人兼总裁的 Devin Pehrson 说,他把 Astra 用在法律文书、deck 等知识工作测试上,“额度一天就烧光了(usage smoked in 1 day),还得 Fable 来收尾”,并因此认为知识工作也要选 Fable 5.1,这动摇了 Reddy 帖文中“知识工作者明显胜出”那一半。
反对把结论泛化的人同样在场。自称 Asymmetric Stability Architecture(ASA)架构提出者的 Mieczysław Kusowski ,大代码库工作负载下她的判断“完全可以成立”,但不该上升成“模型 A 比模型 B 好”:“没有免费的智能,只有不同的付费位置。不同工作负载,赢家不同。”他建议把问题从“谁用的 token 少”换成“得到能用的结果花了多少钱”。
她的平台把复杂编程默认路由给 Fable 5.1
Reddy 不是中立的旁观者,这一点她自己发布的内容可以说明:9 月 5 日她宣布的把 Fable 5.1 与 GPT-6 Astra 放进同一套自动路由,规则是“电脑操作用 Astra、复杂编码用 Fable 5.1、3D 游戏用 Astra”。她的测评结论与她自己产品的默认路由完全一致。
账单机制让“吞 token”的指控有直接的商业含义:两个模型按同一价格计费,Astra 在一个任务上多烧一倍 token,成本就是 Fable 5.1 的两倍。9 月 3 日她曾预警:“复杂工作负载正快速流向 Fable 5.1,以后切换会更难。”两天后公布的 MAX MODE,执行的是同一套判断。
这场争论卡在一个点上:双方谈的“软件工程”是否覆盖同一类代码库,帖文没有答案。OpenAI 在 9 月 4 日表示,Plus 与 Business 用户可能还要几天才能陆续获得 Astra;他们的真实代码库记录,将是这条差评的下一个验证点。