AREX Feed Article
OpenAI 公布 GPT-5.6 智能体成本案例:Hypha 以 1/18 成本保留 98% 准确率
OpenAI 开发者账号 @OpenAIDevs 在 8 月 17 日发布系列推文,公布了一批用 GPT-5.6 构建低成本智能体的案例数字:房产初创 Hypha AI 用 GPT-5.6 Luna 做文档抽取,保留了 GPT-5.5 的 98% 准确率,成本降到 1/18;金融研究初创 RogoAI 改用程序化工具调用抓取申报文件并分析数据,评估质量持平,输入 token 减少 21%。称这些结论来自与各行业团队的合作测试,考察模型选择、推理和工具调用如何帮 agent 以更低成本处理更复杂的工作。
这组推文指向 OpenAI 8 月 13 日发布的博客,文章由 Samarth Madduru、Prashant Mital、Dave Leo 和 Julien Reiman 基于与初创公司从早期测试到生产的合作写成。第三个数据点在 ARC-AGI-3 基准上:GPT-5.6 Sol 启用保留推理与压缩后,得分从 13.3% 升至 38.3%,输出 token 约少用 6 倍。上述指标均出自 OpenAI 单方公布口径。
成本降到 1/18,准确率保住 98%
OpenAI Devs 在里给出了 Hypha 案例的完整表述:在文档抽取任务中,房产初创 Hypha(@hypha_ai)用 GPT-5.6 Luna 保留了 GPT-5.5 的 98% 准确率,成本仅为后者的 1/18。
博客引用了 Hypha 工程负责人(Agents 方向)Serhii Shchoholiev 的话解释这组数字的商业含义:
“Luna keeps 98% of GPT‑5.5’s extraction accuracy at one-eighteenth the cost. That gives our agents high-quality document understanding at a price that makes it practical across many more workflows.”
大意是:Luna 以 1/18 的成本保留 GPT-5.5 98% 的抽取准确率,这让他们的 agent 能以负担得起的价格获得高质量文档理解,把抽取推广到更多工作流。
博客称 5.6 家族改变了“长任务就得旗舰模型配最高推理档”的旧经验:在更多 test-time compute 的支撑下,Luna、Terra 常常能做到接近 GPT-5.4/5.5 的表现,同时便宜得多。
博客给了一组基准对照:三个月前,GPT-5.5(Extra High)在搜索类基准 BrowseComp 上得分 84.36%,总成本 33.27 美元;发布时的 GPT-5.6 Luna(Extra High)得分 84.04%,成本 1.33 美元。得分差距不到 0.4 个百分点,成本相差约 25 倍,OpenAI 还称此后进一步降过价。
博客把这类小模型定位为高吞吐、延迟敏感、agent 工作流中重复步骤的场景:比如法律科技公司先解析手写备忘录再做 agent 分析,可以全程用 Terra 或 Luna 做抽取,省下可观的成本。
程序化工具调用帮 RogoAI 省下 21% 输入 token
金融研究初创 RogoAI 的案例围绕程序化工具调用(Programmatic Tool Calling)。博客引 Rogo 的 Alex Wang(Applied AI)的话:
“For financial research, the hard part is reliably pulling filings, coordinating tools, and working through the numbers. In our evaluations, GPT‑5.6 using Programmatic Tool Calling matched our rubric quality while using 21% fewer input tokens.”
大意是:金融研究的难点是可靠地抓取申报文件、协调工具、把数字算完;在他们的评估里,用程序化工具调用的 GPT-5.6 达到 rubric 同等质量,输入 token 少用 21%。
机制是给“搬运数据”和“做出判断”分工。博客解释,agent 工作流里有两类工作:需要判断的任务,和移动、过滤、合并数据的活。程序化工具调用让 GPT-5.6 自己写 JavaScript 去编排工具、并行执行独立调用、在上下文窗口之外处理工具输出,模型 token 只留给判断。
博客给的例子:agent 检索 100 份申报文件、按日期过滤、找出相关交易时,模型不需要在上下文里推理每一个中间结果。Alex Wang 的原话点明了这条分界线的价值:“That’s the difference between an agent that can discuss financial research and one that can actually carry it out.”(这就是“能聊金融研究”的 agent 和“能真正完成金融研究”的 agent 之间的差别。)
同一个 Sol:ARC-AGI-3 从 13.3% 提到 38.3%
和博客给出了一组对照数字:在 ARC-AGI-3 上,GPT-5.6 Sol 用标准 harness 得 13.3%;启用保留推理(retained reasoning)与压缩(compaction)后,得分跳到 38.3%,输出 token 约少用 6 倍。博客特意强调:模型没有任何改动,性能几乎翻了三倍。
提升全部来自 harness 侧。博客称 GPT-5.6 在 Responses API 里获得三个互补的架构干预:原生压缩(native compaction)配合跨轮次持久化的推理(reasoning persisted across turns),压缩长对话、让模型在长任务中保持连贯而不必重建上下文;原生多智能体编排(native multi-agent orchestration)并行协调多个 agent;程序化工具调用把确定性的工作移到代码里。
博客还给了推理档位的例子:在 Agents' Last Exam 上,harness 不变的情况下,GPT-5.6 Sol 用“低”推理档的表现超过了 GPT-5.5 用“高”推理档。Hex 的 AI 研究负责人 Izzy Miller 报告了同样经验:把 GPT-5.6 放进自家 harness 后,低推理档给出了最好结果,模型“知道数据什么时候不在那里,不追坏线索,用更少 token 得到正确答案”。
换模型只是省钱的第一步
除了换小模型,博客还展示了三条并行路径。多智能体方面,Quadrillion 创始人 E Chi 说其产品 Qualia 在开放式研究问题上跑 agent 团队,GPT-5.6 Sol“明显优于 GPT-5.5,几乎比我们测过的所有模型都快,很快成了我们的首选 OpenAI 模型”;Obvious 联合创始人兼 CPO Jon Bell 的评价是“GPT-5.6 是我们在 OpenAI 见过的最好的编排器”,他一次丢给它六个规格(写作、构建、讨论),它都跟得住、质量没有垮。
提示缓存是另一条省钱路径:整个模型家族的缓存 TTL 延长到至少 30 分钟,缓存断点可以在上下文窗口内确定性设置。Ploy 的 AI 工程师 Lorenzo Gentile 说,他们给共享的 29,000-token prompt 加了缓存断点和 workspace 专属 key,未缓存输入减少 28%,“30 分钟缓存窗口是大解锁:agent 可以跨运行复用同一上下文,而不是从头开始”。
博客的结论是一句话:过去每一步都需要旗舰模型的任务,现在用更小的模型、调低推理档位、做高效的架构选择,就能以零头成本拿到相当或更好的结果。
省下的是 token,还是总成本?
开发者对这套数字的回应并不一致。 在推文下追问:初创公司报告的成本下降里,有多少来自模型路由、更少的推理步骤和更少的工具重试?“按完成每个任务的成本计,比按 token 计更有用。”
自称面向“需要深度判断任务的推理型 AI”的 提醒,成本对比需要生产环境的错误率和延迟数据,“保留推理可能把省下的钱转移到更慢的任务完成上”。
做 AI 新闻与研究的 把矛头对准图表本身:Claude Opus 4.8 在这张图上约 3,200 美元,指数分只比 GPT-5.6 Terra 低约 7 分,却被画成一个没有成本曲线的单点,“模型厂商自己的成本图永远会美化自己家的模型”。
也有开发者用自己的账本印证省钱逻辑。 在回复中说,Luna 对他在建的客服栈很省用量,并称 GPT-5.6 支持提示缓存,缓存后的 Luna 输入比普通输入便宜 90%。主推文截至 8 月 17 日晚已有约 7.6 万次浏览、1100 个赞、65 条回复。OpenAI 的指南里只有 token 和推理档位,没有生产错误率、没有延迟、没有重试次数。