AREX Feed Article
Celeris 发布 Magnus,自称 τ³-bench banking 41.2% 超越 GPT-5.6-sol
北京时间 9 月 1 日 11:21,旧金山 AI 实验室 Celeris 发布第二款模型 Celeris-1 Magnus。称,这是一款「源自 qwen3.8-27b 的混合扩散模型」,面向 agent 场景:在 τ³-bench banking 上拿到 41.2% 的任务解决率、每任务中位耗时 55 秒,对比对象 GPT-5.6-sol 为 38.1%、79 秒。这些基准数字全部是公司自报;截至本报道核查时,Artificial Analysis 的 τ³-Banking 独立榜单与第三方汇总榜单均未收录 Magnus 的成绩。
传播规模与账号体量不成比例。Celeris 的 X 账号,粉丝不足 1,600;截至核查时,这条推文已累计约 116 万次浏览、2,600 余赞、44 条回复。此时距公司 7 月 27 日官宣第一款模型 Celeris-1,只有五周。
41.2% 对 38.1%,差距是 97 题里的 3 题
给出的评测口径是:τ³-bench banking 全部 97 道题,用官方 grader(official grader),与 gpt-5.6-sol、gpt-5.6-luna、gemini-3.7-flash 逐一对比,各家按「reasoning effort as published」跑。页面上写着「field's best solve rate」(全场最高解决率)。
τ³-bench 是 Sierra 今年 3 月发布的第三代 agent 基准。banking 域模拟金融客服:agent 要在 698 份政策文档、21 个产品类别(约 195K token)里检索并执行多步工具调用,。Sierra 发布时测得,最强前沿模型(GPT-5.2,高推理档)也只能解出约 25% 的任务。
换算成题目数:97 道题上,3.1 个百分点约等于 3 道题。自称量化交易者的 @AIQuanting 第一个挑明这点:
速度差确实更醒目:每完成一道任务,中位快 24 秒。Web3 基础设施公司 OnFinality 在里算了笔账:agent 循环里每步省 24 秒会快速复利,「好奇它在更长任务上是否还能撑住」。
产品页还给了两个自报对照。一是消融实验:未做 agent 训练的 Celeris-1 在同样的 97 题上只有 5.3%,agent 训练把同一底座拉到 41.2%;评论者 @vish_uk 称。二是推理旋钮:请求级开关 enable_thinking 在「快」与「周全」之间切换,开启思考多拿 13.4 分,代价约 6 秒。
「混合扩散」:整段生成,再并行细化
「扩散」是 Celeris 技术叙事的地基。这样解释:自回归模型逐 token 生成,扩散模型先生成整段回答的粗糙版本,再经少数几轮快速细化,「像一张模糊的图片逐渐对焦」。Celeris-1 由此成为继 Inception 的 Mercury 之后第二款商用扩散 LLM API,公司称其生成速度 1,664 tokens/s、MMLU-Pro 75.9%、中位延迟 158 毫秒。
Magnus 与 Celeris-1 是同一家族的两种配置。产品页写明:Celeris-1 负责「回答」——聊天、搜索、实时界面,默认最大输出 2,048 token;Magnus 负责「任务」:工具循环、长任务、结构化动作,最大输出 16,384 token。两者上下文窗口都是 131,072 token,API 完全相同,「切换只改一个词」。
推文点名的底座是 qwen3.8-27b(270 亿参数)。
页面上挂了一段实时演示:一次银行客服任务里,查账户、核对付款日期、改期、确认余额、起草给客户的确认话术,单次工具调用 48~74 毫秒,整单 3.1 秒完成。这组数字是产品页演示动画的标注耗时,不属于 τ³-bench 评测结果。
速度是这家实验室在第三方数据中唯一排名领先的指标。独立评测机构 Artificial Analysis 给 Celeris-1(基础版)的输出速度,在 82 个同类模型中排名第 1;同一页面上,它的智能指数为 12 分,与同类中位数持平。
价格是 GPT-5.6 Sol 的二十分之一,速度约二十倍
显示按量付费为 $0.20/M 输入 token、$0.70/M 输出 token,输入输出分别计量;企业版走定制报价,支持 VPC 部署与 SOC 2。按 Artificial Analysis 的,OpenAI 的 GPT-5.6 Sol(max)输入 $4.00/M、输出 $20.00/M,实测输出速度 77.1 tokens/s。
对照下来:输入价格差 20 倍,输出价格差约 28 倍,实测输出速度差约 20 倍。速度对比用的是 Celeris-1 基础版的数据,Magnus 还没有第三方测速。
接入方式是 OpenAI 兼容 API:base_url 指向 inference.celeris.ai/celeris-1-magnus/v1,model id 填 celeris-1-magnus,原有 agent 代码不动;推理旋钮通过 chat_template_kwargs 里的 enable_thinking 打开。注册在 console.celeris.ai,页面称「无 waitlist、无销售电话」。
六周大的账号,百万浏览的官宣
这条推文的传播曲线本身就是新闻点。账号 7 月 20 日创建、蓝 V,简介只有一句「Creating the world's fastest language models.」(创造世界上最快的语言模型),粉丝 1,557——一条模型发布推文拿到百万级浏览,对这个体量的账号而言反常。
公司节奏同样快。7 月 27 日,Celeris 通过新闻稿官宣第一款模型 Celeris-1,披露联合创始人兼 CEO Tom Hamer、联合创始人兼 CTO Jesse Clark,以及 Lightspeed Venture Partners 的投资。
两人都带着 Marqo 背景:写着「Working on making language models faster. @celeris_ai @marqo_ai」;Clark 的自述是「Founder @celeris_ai and @marqo_ai. Robots at Amazon. Physics @ Stanford & UCL, PhD in inverse problems」。
发布当天,Clark 在官宣推文下:「在实时场景里玩这个玩得很开心。」距 Celeris-1 官宣五周,第二款模型把对比对象直接选为 GPT-5.6 系与 Gemini 3.7 Flash。
独立榜单早已跑过同一套 97 题
Celeris 的对比对象选得窄,同一套题的独立数据却是现成的。Artificial Analysis 声明,跑的就是 τ³-bench banking 全部 97 题,pass@1 多轮平均:Qwen3.8 Max 51.3%、Grok 4.6 (high) 50.7%、GLM-5.3 (max) 50.3% 居前三。第三方榜单 (8 月 27 日更新)收录的 τ³-Banking 分数里,GPT-5.6 Sol (max) 44.33%,Qwen3.8 27B 在 xhigh 推理档下 48.04%,而 Celeris-1 基础版只有 3.92%。
两套数字不能直接对表:Celeris 自报的 GPT-5.6-sol 是 38.1%,第三方榜单里 GPT-5.6 Sol (max) 是 44.33%。同一模型差出 6 个百分点,原因在评测设置——推理档位、agent 脚手架、提示词都不同。
专门警告过:跨来源比较前,要核对任务版本、模态、脚手架、提示词、试验次数与 pass^k 策略。
但参照系仍有意义:如果 Magnus 自报的 41.2% 放进这份榜单,大约排在 Grok 4.5 (high)(42.06%)之后、第 11 位。「field's best」只在它自选的三个对比对象里成立。
社区质疑集中在透明度和对比选择上。@eplurubusnullus 在里列出 τ²-bench 上 GPT-5.6 Sol 46.9%、Grok 4.5 47.9%、Claude Opus 5 48.7%、Qwen 3.8 Max 55.2% 的成绩,质问「为什么不和得分更高的模型比」,并称「真的受够了 benchmaxxing dishonesty」(刷分式不诚实)。@TCCardoza 说,让人很难信任「一个可能其实很扎实的分数」。
@VibeCoderOfek 要:「41% 对 55 秒是个真实数字,但一个看起来很快、却把同一接口重试两遍的模型不算快。」@MoonGotArt 要求,「让大家看看你的 fine-tune 到底行不行」。@SSHCodes 的问题最直接:(权重开放吗,不开放就不关心)。
支持的声音集中在「公布了配置变化」和速度上。Marqo 合作岗的 @sarthakC0 说。OpenAI 早期员工、Cresta 联创 Tim Shi 只回了一个词:。另一名用户 @Farshid Zavareh 说。
发布数小时后,回复区对这次官宣的讨论收敛到两个数字上:97 道题上 3.1 个百分点的领先约等于 3 道题,属于「噪声」;55 秒对 79 秒的 24 秒则更扎实。第三方在相同设置下重跑 Magnus、公开工具调用轨迹、回答「open weight or no care」,是检验这次发布的三件事。