AREX Feed Article
1797 分登顶 Code Arena: WebDev,Arena.ai 称 GPT-6 Astra(Max)重塑 $40/Mtoken Pareto 前沿
9 月 5 日 17:32(UTC,北京时间 9 月 6 日凌晨 1:32),AI 测评平台 Arena.ai 在其 X 官方账号 @arena 上公布 Code Arena: WebDev 榜单更新:OpenAI 的 GPT-6 Astra(Max)以 1797 分成为总榜新第一,比第 2 名 Anthropic 的 Claude Fable 5.1(Max)(1762 分)领先 35 分,第 3 名 Claude Opus 5(Max)为 1688 分。同时称,Astra 还“重塑了 Pareto 前沿”,成为 $40/Mtoken 价位上表现最佳的模型,并称该价位与最新 Claude 模型的定价一致。以上排名、分数与结论均为榜单运营方口径,未经第三方独立复现验证。
这是 OpenAI 旗舰在该榜上的一次位置跃升:上一代 GPT-5.6 Sol(xHigh)此前排在第 13 名,Astra 比它高出 180 分。时间上也相当紧凑:,;显示,gpt-6-astra-max 于 9 月 5 日被加入 Code Arena: WebDev,当天即官宣登顶,从发布到登顶不到两天。
图:GPT-6 Astra 官方主视觉,取自 OpenAI 发布页。
类别分榜里已有三个第一、一个第二
榜单前三的分差不均匀:第 1 名与第 2 名差 35 分,第 2 名与第 3 名差 74 分,后者是前者的两倍还多。
Arena.ai 在推文中列出的类别分榜成绩是:Data & Analytics、Consumer Product、Content Creation Tools 三个类别第 1,Gaming and Simulations 第 2。
Code Arena: WebDev 的排名不是静态题库成绩。的介绍写明,它衡量各模型在前端网页开发任务上的表现,任务包含 agentic coding(智能体式编程)工作流,需要多步推理与工具调用;分数来自社区用户的对决投票,并随新票实时滚动。
价格–性能曲线上,Astra 站在最贵也最强的一端
“重塑 Pareto 前沿”中的 Pareto 前沿(帕累托前沿),指价格与性能权衡下每个价位上最强模型连成的曲线。
9 月 5 日的快照显示,这条曲线上的模型依次是:gpt-6-astra-max(1797 分,$40/M)、claude-opus-5-max(1688 分,$20/M)、qwen3.8-max-0902(1686 分,$5/M)、qwen3.8-flash-next(1626 分,$0.39/M)、mimo-v2.5(1438 分,$0.25/M)、solar-pro4(1371 分,$0.10/M),直到价格最低的 granite-4.1-8b(1191 分,$0.09/M)。Astra 站在曲线顶端:分数最高,定价也最高。
价格口径还有一层分歧。独立测评站 称,它逐项核对 OpenAI 计价文档后认为,gpt-6-astra 的标准短上下文 API 价是每百万 token(词元)输入 $10、输出 $50;同一个模型,百万输出 token 的价格会随运行模式与上下文长度在 $25~$150 之间浮动。核账标题直接写成:“价格和分数,都取决于一个没人印出来的设置。”
Arena.ai 榜单给 Astra(Max)标注的是 $40/M。“$40/Mtoken 最佳”是 Arena 榜单价格口径下的结论。
一周之内,榜首已经换了四个模型
榜首的换手在这一周尤其快。Arena.ai 联合创始人兼 CEO Anastasios Nikolas Angelopoulos(身份按其 X 账号简介)在 中说:“各家实验室在 coding 上爬坡的速度令人咋舌。过去一周里,已经有 4 个模型坐过第一把交椅:GPT-6 Astra(Max)、Claude Fable 5.1(Max)、Claude Opus 5(Max)、Qwen 3.8(Max)。而且跳幅相当大,Astra 明显强于 Opus 5。”
榜单变更日志里的入场节奏与之呼应:qwen3.8-max-0902 于 9 月 1 日加入 Code Arena,claude-fable-5.1-max 与 Gemini 3.8 Flash(High)于 9 月 2 日加入 Code Arena: WebDev。
「GPT 模型不擅长设计」的叙事正在被改写
“OpenAI 终于做出一个擅长设计的模型了。”用户 Marcos Hernanz 在(9 月 5 日)中写道。在 X 简介中自称 OpenAI Codex APAC Lead 的 称:“是时候改改‘GPT 模型不擅长设计’的叙事。”
简介自称专注 AI 与自动化、粉丝约 3.7 万的 中只算了一笔账:“OpenAI 用一代模型,从第 13 名跳到了第 1 名。”
截至 9 月 8 日核验时,这条官宣推文已获得 4,184 次点赞、399 次转发、178 条回复与 147 条引用转推,浏览量约 78 万。讨论中也有对配图的质疑:中质问这张“误导性图表”是谁画的,称 1750 看起来比 1500 大了五倍;则写道:“拜托,x 轴能从 0 开始吗?”
领先优势还没走出置信区间的重叠
榜单页为 Astra 标注的置信区间是 ±24 分,为 Fable 5.1(Max)标注的约为 ±16 分。两段区间在 1773~1778 分之间重叠:35 分的领先,还没有走出这重不确定度。
Arena.ai 的官宣也写明这场榜首争夺尚未收尾:类别分榜的票仍在收集中,Brand & Marketing、Reference-Based Design、Full Stack 三个分榜的排名都还没有公布。