AREX Feed Article
OpenAI 开发者账号称 GPT-6 Astra 在 Codex 中帮助 Perplexity 做端到端代码测试
北京时间 9 月 15 日凌晨 1 时,OpenAI 的开发者账号 发帖称,GPT-6 Astra 正在 Codex 中帮助 Perplexity 对代码做端到端测试。帖文给出了具体做法:@randomjohnnyh 用它构建测试 harness(自动化测试框架),并模拟第三方 API 的响应。
OpenAI 官网的记录了这一用法。案例页里,Perplexity 联合创始人兼首席战略官 Johnny Ho 说,团队「实际上可以放心把完整的端到端系统交给它」,检查频率比之前几代模型低得多。
帖文里的两个动作:搭起测试 harness、模拟第三方 API 响应
Codex 中的 GPT-6 Astra 正在帮助 @perplexity_ai 对代码做端到端测试。@randomjohnnyh 用它来构建测试 harness、模拟第三方 API 的响应,以便检查各部分如何协同工作。
帖文正文只有这两句话,另附一段视频附件,帖子里的 t.co 短链指向的正是它。模拟(mock)第三方 API 响应,就是生成外部服务会发回的那种响应,以此替代这些服务;帖文所说的「检查各部分如何协同工作」,指的正是这样一轮端到端验证。
帖文点名的 @randomjohnnyh 就是 。
机制:让模型生成真实服务那样的响应,把流程从头测到尾
按 OpenAI 案例页的说法,Perplexity 是一家以搜索与准确性为核心的 AI 答案引擎。对 Ho 来说,AI 最有用的应用之一就是测试代码;由于手动测试的时间有限,他把围绕应用搭建小型测试程序这件事交给 Astra 完成。模型生成的是另一个服务会发回的逼真响应,例如某个语言模型 API 或连接器;由它代替这些服务之后,应用如何响应就能被检查,工作流也就可以从起点测到终点。
案例页引用了 Ho 的一句话:「我们可以让模型撰写沟通内容、改动真实系统,并监控生产软件,这是此前几代模型做不到的。」
从 9 月 3 日的发布到 Perplexity 的接入
GPT-6 Astra 于 9 月 3 日开始分阶段推出:OpenAI 当天在发帖宣布了这一消息。在里,OpenAI 称它是「迄今最好的软件工程模型」,并说明它给 Codex 带来的一项新机制:模型可以跨上下文窗口做笔记,更早的上下文仍可检索,便于在长会话里找回失败原因、组件行为这类细节;OpenAI 表示,这个实验特性未来几周会成为 Astra 在 Codex 里的默认配置。
科技媒体 在报道里把这次发布称为 ChatGPT 与 Codex 的一次重大升级,并记录了 Astra 随后陆续向 Business、Pro 和 Plus 订阅用户开放的经过。Perplexity 也在 9 月 4 日宣布,Astra 已在 中向 Pro 与 Max 订阅用户开放。
回复区:对 mock 工作流的认可,与对测试可靠性的追问
截至发稿,这条帖文获得 372 次点赞、18 次转发、51 条回复和 26,946 次查看。回复中, 写道:「端到端测试加上被模拟的第三方响应,是比单纯代码生成好得多的 Codex 演示;用户真正会碰到的集成失败,恰恰是在 harness 里暴露出来的。」
另一类回复则把问题指向 mock 的保真度:模拟响应由生成模型自己产出时,端到端测试如何避免把「一致」当成「正确」?
来源边界:单方叙述与独立验证者规则
这条消息的叙述出自两处渠道,都属于 OpenAI:开发者账号的帖文,以及官网的客户案例;Johnny Ho 的引语出自后者。
帖文的回复里有一条关于验证的规则。 写道:「不要让同一个 agent 既写功能、又写 mock 和验收标准;用一个独立的验证者,否则你会得到一套漂亮、一致、却验证了错误行为的测试。」