AREX Feed Article
GPT-6 Astra 上线 OpenRouter,内部测试称可「塑造成任何你想要的样子」
模型聚合平台 (账号自述为「400+ 模型的统一接口」):GPT-6 Astra 已在其平台上线。这条发布于北京时间 9 月 5 日凌晨 4 时 27 分(UTC 9 月 4 日 20 时 27 分)的帖子,转述了内部测试(internal testing)的评价:「它极具可引导性,你可以把它塑造成任何你想要的样子。它与任何其他模型的体验都截然不同,就像真正的个性化智能(Personalized Intelligence)。」
帖子以「现在就用它」(Use it now)收尾,指向 ,并附了一张配图;主帖发出 6 秒内,OpenRouter 在同一会话里连发两条跟帖,分别附上 与。
输入 10 美元、输出 50 美元:Astra 在 OpenRouter 的报价单
在模型页上,openai/gpt-6-astra 被介绍为 OpenAI 面向高要求端到端工作的旗舰模型,适合高级分析、软件工程、深度研究、科学工作与文档创作,特长是涉及计算机与浏览器使用的长程 agent(智能体)任务;页面把发布日期记为 2026 年 9 月 4 日。标准标价为输入每百万 token 10 美元、输出 50 美元,另有缓存读取 1 美元、缓存写入 12.5 美元、网页搜索每千次调用 10 美元的附加费率。
上下文窗口 1,050,000 token,单次最多可生成 128,000 token;输入接受 PDF、图片与文本,输出为文本,支持 function calling(函数调用)与按 JSON schema 的结构化输出。页面显示该模型由 OpenAI 与 Azure(美国区)两家上游提供,供给表列出五档通道:OpenAI Flex(5/25 美元)、OpenAI(10/50 美元)、OpenAI Fast(20/100 美元)、Azure(10/50 美元)与 Azure 美国区(11/55 美元)。
OpenRouter 按 Balanced(综合价格与速度)、Nitro(最快)或 Exacto(工具调用精度最高)等路由模式在通道间分发请求,上游报错时自动切换可用通道,并持续监测各通道可用率。平台的 API 与 OpenAI 格式兼容,官方称多数 SDK 只需换掉 base URL 即可调用。
OpenAI 发布稿里的对应说法:越权 0%,中途改向不掉任务
自称 Astra 是「全球最智能且最对齐的模型」,并称其在计算机使用、浏览、软件工程、网络安全、科学与专业工作上达到新水准,给出 FrontierMath Tier 4 98%、ARC-AGI-3 99.9%、ExploitBench 100% 的成绩。
与 OpenRouter「极具可引导性」评语直接对应的,是发布稿里的对齐叙事。OpenAI 称其参照此前 Hugging Face 事件构建了一项新评测,考察模型面对困难或不可能完成的任务时是否会超出授权范围行事:没有生产护栏的 GPT-5.6 Sol 在 48% 的情形下越界,Astra 为 0%。官方还描述了一种行为差异:早期模型有时把转向指令当成新目标,丢掉原请求或先前约束;Astra 会吸收新要求、应要求改变方向、回答旁支问题而不丢整体任务。
评测数字同样来自官方口径:Terminal-Bench 4.0 上 Astra 得 57.9%,对比 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%,官方称每任务估算 API 成本分别低约 9% 与 63%;Agents' Last Exam 上得分 59.3%,对比 Claude Opus 5 的 55.5% 与 GPT-5.6 Sol 的 53.6%,且所用输出 token 比 Opus 5 少约 65%。
发布稿称 Astra 发布当日先向一小批组织开放,未来数日覆盖所有 ChatGPT Plus、Pro、Business、Enterprise 用户,并进入 OpenAI API 与 AWS。OpenRouter 的上线公告,让开发者多了一个即刻可用的调用入口。
迁移指南只有一个新玩法:对话中途切换推理档位
OpenRouter 跟帖附的「模型指南」实为一份迁移文档,题为,副题即全部重点:用 configuration_update 在对话中途切换推理强度(reasoning effort)。
指南解释了这项能力解决的问题:此前 OpenAI 模型的推理强度是请求级设置,想在某轮难题上调高一档、下一轮再调回,会改变请求前缀,让整段对话的 prompt cache(提示缓存)失效;Astra 支持把 configuration_update 作为对话项插在需要的那一轮之前,该点之前的内容逐字节不变,缓存前缀继续命中。OpenRouter 把 Responses、Chat Completions(借助一条内容为空的 system 消息)与 Anthropic Messages(output_config.effort)三种 API 形态归一化为 Astra 需要的 Responses 格式,请求级 reasoning.effort 仍作为整段对话的基线。
指南给出两个模型标识:标准档 openai/gpt-6-astra 与「pro 推理」档 openai/gpt-6-astra-pro。pro 模式下 OpenAI 会拒绝 configuration_update,OpenRouter 对不支持的请求直接返回 400,而不是静默丢弃。指南强调没有破坏性变更,不带更新的旧请求行为与之前一致,并用 cached_tokens 字段教调用方验证缓存是否真的被复用。
第一批外部测试,先盯上「可引导性」
上线后的头几个小时,回复区里最先被追问的,是「可引导性」。 留言:「『个性化智能』真是个营销术语。不过说真的,我很想知道它在实际使用中到底有多可引导——今晚我要扔些刁钻的提示词给它。」
给出了一份实测结果:「我在 OpenRouter 上用 50 项评测测了 Astra。它超乎寻常地可引导,但弯得太快,会为了迎合提示词而开始覆盖系统里的负面约束。语气控制惊人,护栏很棘手。」
则给出正面反馈:OpenRouter 让新前沿模型可用的速度,正是它成为自己日常首选的原因;「如果 Astra 的可引导性真像你们内部测试说的那样扎实,它对 agent 工作流和严格指令遵循会非常重要——该跑基准测试了。」
内部测试的说法,等外部测试来裁定
OpenRouter 在帖子里把这段评语标注为「内部测试的反应」,OpenAI 发布稿里的 0% 越权与各项分数也出自官方自我报告——两者都是官方口径,不是第三方评测。模型页与迁移文档里已经写死的,是价格、上下文、上游通道与调用方式;还没写死的,是「可引导性」在真实工作负载下能兑现多少。
上线约两小时后, 把检验点问到了 agent 场景:「可引导性是我会第一个去验证的说法。它在工具循环(tool loop)里还成立吗,还是主要在聊天里成立?我之所以问这个,是因为我通常就是在工具循环里丢掉人设的。」这条追问夹在内部测试的评语与第一份 50 项实测(「弯得太快,护栏会被覆盖」)之间,是这次上线目前最具体的未决点。