AREX Feed Article
SemiAnalysis 指控 Gemini 3.8 Flash 与 Muse Spark 1.3“刷榜”:TB 2.1 追平 GPT-6,TB 4.0 明显落后
SemiAnalysis 的官方 X 账号(@SemiAnalysis_,企业认证,16.1 万关注者)于北京时间 9 月 8 日上午 8 时(UTC 00:00)连发 5 条分析帖,指控 Google 的 Gemini 3.8 Flash 与 Meta 的 Muse Spark 1.3 是“我们迄今见过刷榜(benchmaxxed)特征最明显的两个模型”:它们在 Terminal-Bench 2.1 上与 GPT-6、Fable 5.1 表现相当,但在新版 Terminal-Bench 4.0 上明显落后。
随帖配图把这一落差量化:四款模型在 Terminal-Bench 2.1 上的得分都在 88%~92% 之间,到 4.0 上分成两档——GPT-6(Astra)与 Fable 5.1 仍有 55%~58%,Gemini 3.8 Flash 与 Muse Spark 1.3 只剩 19.1% 与 33.3%。这是一项分析指控而非已证实的事实:Meta 首席 AI 官 Alexandr Wang 已在帖下公开反驳(见后文)。
两档降幅:旗舰 30~36 个百分点,被点名两款 55~70 个百分点
主帖配图的大标题是“Google and Meta are Benchmaxxers”(Google 与 Meta 是刷榜者),副题为“Terminal bench 2.1 vs 4.0 performance”,四列依次为模型、Terminal-Bench 2.1 得分、Terminal-Bench 4.0 得分与降幅:
图内数据:
| 模型 | Terminal-Bench 2.1 | Terminal-Bench 4.0 | 2.1 → 4.0 降幅 |
|---|---|---|---|
| GPT-6 Astra(OpenAI) | 88.4% | 57.7% | 30.7 个百分点 |
| Fable 5.1(Anthropic) | 91.4% | 55.8% | 35.6 个百分点 |
| Gemini 3.8 Flash(Google) | 89.4% | 19.1% | 70.3 个百分点 |
| Muse Spark 1.3(Meta) | 88.8% | 33.3% | 55.5 个百分点 |
图中把 Gemini 与 Muse 两行的降幅以橙色加粗标出。两款旗舰同样在跌,只是被点名两行的降幅达到旗舰的 1.5~2.3 倍。截至北京时间 9 月 8 日下午核验时,主帖累计约 19.6 万次浏览、1,673 次点赞、92 次转发、42 次引用、347 次收藏与 69 条回复。
不直接训练任务,而是买下仿题数据
第 2 条帖文解释这种落差“怎么可能发生”。SemiAnalysis 写道:“Terminal Bench 2.1 里的任务全部公开。Meta 和 Google 不会直接在这些任务上训练,但他们绝对会向 RL(强化学习)环境创业公司购买数据——这些数据被设计成尽可能贴近 TB 2.1 的任务,净效果一样。”它同时给出一个可检验的预期:“如果 TB 2.1 的提升来自真实能力,通常会泛化到其他 agentic(智能体类)任务上”,而 Gemini 和 Muse“甚至没有泛化到 TB 4.0”。
这段论证的前提由 SemiAnalysis 自己写明:两家实验室“不会直接在任务上训练”,指控的落点在训练数据供应链——向 RL 环境数据供应商购买仿题数据,而不是自己下载基准题目。
DeepSWE 与 Datacurve:第二个例证
第 4 条帖文补上了第二个例子:“Gemini 3.8 Flash 在 DeepSWE 上的表现是另一个好例子。显然,Datacurve 靠向 Google 出售 DeepSWE 形状的任务赚了很多钱。”
配图是 Datacurve 官网 deepswe.datacurve.ai 的 DeepSWE v1.1 成绩图(页脚标有该域名与 Datacurve 标志):横轴为单任务平均成本,纵轴为成功率,右上角标注“most efficient”。Gemini 3.8 Flash 是图上最接近“most efficient”角的模型,同图里 GPT-5.6 Sol、Muse Spark 1.2 等模型的成功率都明显更低——在 SemiAnalysis 看来,这说明 Gemini 3.8 Flash 的 DeepSWE 高分来自 Datacurve 提供的高度仿题数据,而非真实能力外溢。
所有公开基准的宿命,TB 4.0 也不例外
线程对公开基准的整体判断是:“说到底,这是所有优秀公开基准的宿命,TB 4.0 也不例外。它现在还能提供有效信号,仅仅因为两周前才发布。既然任务同样全部公开,用不了多久,它也会被所有想当‘前沿’的实验室 hillclimb(爬榜优化)。”
按这套框架,TB 4.0 上的“明显落后”本身就是 TB 2.1 高分含金量的证据:如果 2.1 的分数来自对公开任务的模仿,换成实验室还没来得及“买题”的新基准,分数就会掉下来。SemiAnalysis 把对策写在最后一帖:“解决方案是更多高质量的私有基准。如果你有好的私有基准,请联系 @maxkan,我们很乐意聊聊。”
Meta 首席 AI 官 Wang:这是“很傻的论证”
主帖发布约 27 分钟后,Alexandr Wang 在帖下回复。他的 X 账号简介为 Meta 首席 AI 官、Meta Superintelligence Labs 创始人、Scale AI 创始人,关注者 65.7 万。回复开门见山:“这是个很傻的论证。”
他搬出 GPT-5.6 Sol 作反例:“GPT-5.6 Sol 在 TerminalBench 2.1 上是 88.8%,在 TerminalBench 4.0 上是 37.3%。即使它的分差更大,也不能说明它比 GPT-6 Astra 更刷榜。TerminalBench 4.0 只是一套难得多、尚未饱和的评测,而 TerminalBench 2.1 已经饱和了。”随后他把话题拉回产品定位:“我们从不声称 Muse Spark 1.3 与 Astra 或 Fable 5.1 一样强,但它明显更具性价比。我们未来的模型会与这些模型更直接地竞争。”
Wang 的“饱和”解释与图中两款旗舰同样下跌的数据并不矛盾——分歧在解释,不在数字。同期,这条回复已有约 6.3 万次浏览与 1,100 多次点赞。
饱和还是模仿:同一组分差的两套解释
回复区的其他声音按同样的分歧分边。Colin Richard(@SemiColin97)支持“饱和论”:“不是这样的。这说明 TB 2.1 已经饱和、显示不出差异;TB 4.0 没饱和,才显出差异。”
反向的数据点来自 ChessBench——一个自称追踪语言模型国际象棋能力的基准项目:“在 chessbench.ai 上,至少对 Gemini 3.8 Flash 而言,它明显比其他模型好。” 即离开 Terminal-Bench,Gemini 3.8 Flash 在另一套独立评估中并不差。而布拉格独立游戏开发者 Jakub Arnold(@darthdeus)站在 SemiAnalysis 一边:“Gemini 3.8 Flash 在我看来完全是个笑话。它有时能用,但经常表现得比一年前刚发布时的 Claude Sonnet 还差。”
这些回复的分歧集中在解释层面:SemiAnalysis 把 55~70 个百分点的落差读作任务模仿的痕迹,Wang 与 Colin 把它读作“新基准尚未饱和”的正常难度差,ChessBench 的独立榜单给出相反方向的观察。至于 TB 2.1 的高分是能力还是模仿,目前双方仍各执一词。