AREX Feed Article
开发者 Alok 实测称 Gemini 3.8 Flash 一次生成太阳系 3D 演示,价格约为 Claude Opus 5 的七分之一
「我真心没想到一个单价不到 1 美元的 flash 模型能做成这件事。」北京时间 9 月 3 日 19 时 50 分,X(原 Twitter)用户 Alok(@analogalok,4,729 名关注者,账号简介自称机电工程师)发出这条测试帖:他说谷歌 9 月 2 日发布的 Gemini 3.8 Flash 仅凭一段提示词,一次生成了整个太阳系的 three.js(JavaScript 3D 图形库)演示,单个 HTML 文件、零工具调用、零修改,并附上一段演示视频;整段生成的费用,「正好 6 美分」。
同一条帖子里他还给出两组对比:DeepSWE v1.1(长程软件工程基准)得分 73.7,称 Claude Opus 5 为 74%;每百万词元(token)的输入/输出价格分别为 $0.75/$3.75,对比 Opus 5 的 $5/$25,结论是「几乎以七分之一的成本拿到接近前沿的编码能力」。这是一条单一开发者的测试声明,所列分数与成本对比未经第三方复核;其中可以独立核对的两组数字,即模型定价与 DeepSWE 官方榜单,下文与官方来源逐一做了比对。
一条提示词和一段视频,就是帖子的全部材料
Alok 在帖子里公开了完整提示词,原文为英文,大意是:制作一段高质量、写实视频风格的太阳系动画,通过 CDN(内容分发网络)引入 three.js,让镜头环绕运动,输出单个 HTML 文件,不要调用任何工具,不需要任何控件。帖尾他补了一句「就这些」(That's it!)。
他随后,附带的视频是 3 倍速播放。帖子的附件只有这段视频:没有代码文件,也没有运行日志,关于「一次生成、零修改」的说法,目前可对照的只有这些。
DeepSWE 榜上:74% 并列,成本差五倍
DeepSWE 是 Datacurve 维护的长程软件工程基准,用 113 个从零编写、无污染的任务考察编码智能体,覆盖 91 个代码仓库和 5 种语言,全部模型在同一个 mini-swe-agent 智能体框架下评测。
9 月 2 日更新的上,gemini-3.8-flash(high 推理档)与 claude-opus-5(max 推理档)都显示 74%,并肩排在最前:前者置信区间 ±1%,后者 ±4%,区间重叠,统计上无法区分。Alok 引用的 73.7 落在 Flash 的 ±1% 区间内,与榜单口径不冲突;其后是 GPT-5.6 Sol,73%±3%。
榜单的成本列把差距拉得更开:Flash 平均每任务花费 $2.36,输出 143k token、166 步;Opus 5 平均每任务 $11.84,输出 118k token、仅 99 步。Flash 花的 token 和步骤更多,便宜来自单价,每任务成本约为 Opus 5 的五分之一。
Alok 还提到,该模型在 Artificial Analysis 的 Intelligence Index(智能指数)上与 Kimi K3、GLM 5.3「互有胜负」,这是他的个人表述;而在这份 DeepSWE 榜单上,GLM-5.3 与 Kimi K3 均为 69%(±3% 与 ±5%),比 Flash 和 Opus 5 低 5 个百分点。不同基准给出的排序并不一致。
促销价到 12 月 31 日,之后单价翻倍
$0.75/$3.75 是促销价。,这是三周前 3.7 Flash 之后、六周内第三款 Flash 模型;3.8 Flash 沿用 3.7 Flash 的促销定价,到 2026 年 12 月 31 日截止,从 2027 年 1 月 1 日起,输入/输出单价恢复为 $1.50/$7.50,正好翻倍。
对比基准是 Anthropic 7 月 24 日发布的 ,定价 $5/$25。按促销价算,$0.75 是 $5 的 15%,$3.75 是 $25 的 15%,即 1/6.7 左右;Alok 的「几乎七分之一」(1/7 约为 14.3%)是约数。标准价生效后,这一比例会变成 30%,约三分之一。他给出的「6 美分」和「约七分之一」,依据的都是这张 12 月 31 日到期的价目表。
Artificial Analysis 9 月 2 日的给出了另一组参照:Gemini 3.8 Flash 在 Intelligence Index(高推理档)得 59 分,比 3.7 Flash 高 3 分,与 GPT-5.6 Sol(xhigh 档)和 Grok 4.6(medium 档)持平,每个指数任务平均成本 $0.58;报道标题称,这是不到四个月内谷歌发布的第四款 Flash 模型。
同一道太阳系考题,他先在本地显卡上跑过
主打本地 AI,原文是「AI belongs on your device」(AI 应该属于你的设备),离线推理、无订阅。
这条太阳系提示词不是他临时起意:8 月 27 日他发过,在单张 RTX 3090/4090 上本地跑 Qwen 3.8 Flash Next(125B A6B MoE,混合专家架构)与 Qwen 3.8 27B(dense,稠密参数)两个模型,观察到的差异是:27B 更专注天体物理与几何(轨道倾角、坐标计算、月球轨道),125B 更专注镜头语言(光照对比、大气辉光、构图、HUD 界面叠层),并且正确执行了「镜头环绕」指令、画面更惊艳。
这次他把同一道题交给云端模型,得到的是「一次完成、零修改」。9 月 2 日晚间(UTC 17:49),他刚,称其在智能指数上与 GLM 5.3、Kimi K3、Grok 4.6 同级,并问「Gemini 4 Flash 和 Gemini 4 Pro 谁会先到」;约 18 小时后,就有了这条实测帖。
679 次浏览与一条同行回复
截至本文写作时抓取的数据(帖子发布约一小时后),这条测试帖有 679 次浏览、10 个赞、1 次转推、2 个收藏、3 条回复,其中两条来自 Alok 自己:一条是(gemini 3.8 flash 对 claude opus 5、sonnet 5、gpt-5.6 Sol、gpt-5.6 Terra),另一条就是前文提到的 3 倍速说明。
其他用户的回复只有一条,来自 (身份按账号简介):他说自己一直在用 2.5 Flash 跑冷邮件管道,每封草稿成本 $0.0003,「它已经远超同价位表现了;但一次生成完整 3D 模拟、零修改,是另一个级别」。截至抓取时,Alok 没有回复他。
两组可以独立核对的数字都与官方口径一致:$0.75/$3.75 的促销价,以及 DeepSWE 榜上并排的两个 74%。提示词全文就公开在帖子里,按促销价复现一次的成本量级是几美分;截至本文写作时,这条浏览量不到 700 次的帖子还没有第二份测试结果。