AREX Feed Article
OpenAI 称 GPT-6 Astra 现可在 ChatGPT Work、Codex 与 API 使用,每百万输入 token 10 美元、输出 50 美元起
OpenAI 在一份面向企业的中称,GPT-6 Astra 现在可以在 ChatGPT Work、Codex 与 API 中使用,API 定价从每百万输入 token 10 美元、每百万输出 token 50 美元起步。页面把 Astra 称为公司的「最强模型」,并称它在 computer use(直接操作电脑界面)、浏览、专业工作、软件工程、网络安全与科学任务上达到 state-of-the-art(同类最佳)的水平。
同一页面给出的新数字包括:Astra 在 Terminal-Bench 4.0 上取得 57.9% 的新高,在 DeepSWE v1.1 上以 74% 刷新纪录;OpenAI 还称,Astra 是首个达到其 Preparedness Framework(前沿能力分级框架)网络安全 Critical 能力阈值的模型。可用性、价格、基准成绩与安全定级,均出自 OpenAI 自己发布的公告与安全更新。
可用范围与定价:ChatGPT Work、Codex 与 API
该页面本身没有显示发布时间,OpenAI 官方 给出的日期是 9 月 9 日。页面开头写的是「上周我们推出了 GPT-6 Astra」,对应 9 月 3 日的:当时 OpenAI 称 Astra 先向少量组织开放,随后数日逐步提供给所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户,以及 OpenAI API、Microsoft Azure 与 AWS Bedrock,开发者在 API 中调用的模型名是 gpt-6-astra。
业务页把 Astra 面向工作的用途写得很具体:在 ChatGPT Work 和 Codex 里,它既能写代码,也能操作人们日常使用的应用,「即使这些应用没有 API」。发布帖里的价格细节更全:缓存读写另行计价;API 的 Fast 模式速度最高为标准处理的 2 倍,价格也为标准价的 2 倍。
Terminal-Bench 4.0 与 DeepSWE v1.1 上的新成绩
Terminal-Bench 4.0 考察 agent(智能体)在终端环境里完成任务的能力,覆盖软件工程、系统配置与数据分析。OpenAI 为 Astra 的 57.9% 给出的对照成绩是 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%;页面还称,Astra 完成单个任务的「估计 API 成本」比这两者分别低约 9% 与 63%。
DeepSWE v1.1 的 74% 被页面称为新纪录。页面援引 Datacurve 联合创始人兼 CEO Serena Ge 的评价,称 Astra 是用「比以往任何前沿模型都更少的步数和更高的 token 效率」做到这一点的,尤其在复杂的长程任务上。页面另外称,Astra 经过训练能用更少 token、更少重试完成任务,从而减少返工、降低单任务成本。
作为 computer use 的一个例子,公告还称 Astra 完成 Financial Modeling World Cup(金融建模世界杯)挑战的速度约为 2023 年 Microsoft Excel 世界锦标赛获胜的人类选手的 4 倍。
网络安全 Critical:定级依据与使用限制
业务页给出安全侧的核心结论:Astra 是「首个达到我们 Preparedness Framework 网络安全 Critical 能力阈值的模型」。页面称,相应地,OpenAI 加强了对滥用和模型未授权行动的防护,包括训练 Astra 尊重安全与安全边界、提高它抵抗绕过防护尝试的能力,以及部署用于拦截有害回应的自动检查。
这个阈值在 9 月 1 日的里已有定义:模型要么能在无需人工干预的情况下,识别并开发针对大量加固真实关键系统、覆盖各种严重等级的 zero-day(零日)漏洞利用;要么能在只给出高层目标时,设计并执行针对加固目标的端到端新型攻击策略。OpenAI 称,专家评估中 Astra 在加固的浏览器和操作系统里发现了此前未知的漏洞,并把它们串成可用的利用链;为此,OpenAI 表示此前数周推迟了 Astra 的部分开发与发布。
围绕这个定级,OpenAI 在发布帖和安全更新里列出了具体限制:更高级的网络安全任务会被拒绝执行,例如为漏洞编写概念验证利用;先进网络安全工作流先向一小组测试者开放,之后通过 Daybreak Blue 扩大防御用途;额外的安全检查可能拖慢、暂停乃至停止正常工作,在 ChatGPT 与 Codex 中任务可能要求用户先复核再继续,在 API 中任务会直接停止。业务页还称,在内部 computer use 安全基准上,Astra 产生非预期结果的次数比 GPT-5.6 Sol 少 89%、比 Claude Fable 5.1 少 74.7%。
页面上的署名评价:Cognition、Databricks、Box 与 CodeRabbit
公告称,在推出后的头几天里已经有客户把 Astra 用起来,覆盖优化 GPU、发现财务报表中的差异、制作更符合品牌的演示文稿这类任务。页面附上了多家公司的署名评价,全部出自 OpenAI 公告页,且都基于各自公司的内部测试:
- Cognition 研究高级副总裁 Silas Alberti 说,他们在发布当天把 Astra 集成进 Devin 的运行框架,它在内部测试基准上达到最佳表现,computer use、写作与代码库理解能力让测试「开箱即有改善」。
- Databricks 的研究工程师兼技术负责人 Ivan Zhou 说,Astra 在其 OfficeQA Pro 与 Pro V2 基准上创下新的最佳成绩,单任务成本明显优于 GPT-5.6 Sol,在数据推理与文档理解上也显示出面向企业的明显进步。
- Box 的 AI 产品副总裁 Yashodha Bhavnani 说,Astra 是他们测试过的最强模型之一,在整个评测中做出自信但错误断言的可能性低了 10% 以上。
- CodeRabbit 的 AI 副总裁 David Loker 说,与基线相比 Astra 多发现约 20% 的 bug;在需要跨文件推理的 pull request(代码合并请求)上,发现率提高了一倍多。
页面还附有 Hebbia、Figma、Thomson Reuters Labs、Basis 与 XTX Markets 等公司的署名评价。
管理员的控制项、企业插件与费率
页面称,Astra 在正式发布前数周已在 OpenAI 内部部署:其工程团队用它定位了一个让测试环境中 Codex 会话变慢的内存分配瓶颈;切换内存分配器后,单轮延迟降至原先的 1/25,峰值内存占用增加约 30%。
这次公告还给出面向企业客户的控制项:管理员可以限制 Astra 只访问获批的网站与桌面应用、管理上传与下载、控制浏览历史;ChatGPT Work 与 Codex 带有确认策略,可以在后果较大的操作前要求批准,并对可能不安全或未经授权的工具调用做自动审查。随 Astra 推出的还有 ChatGPT Desktop 的企业插件,由最新的 browser use(浏览器操作)能力驱动,分别来自 Oracle Analytics、Power BI(一项 Microsoft Fabric 服务)、Navan 与 Avalara。
企业访问在发布时默认关闭,管理员需要按各自适用的费率卡与协议启用;符合条件且经批准的 API 客户可以在支持的端点上使用 Zero Data Retention(零数据保留)。企业客户的实际价格,公告里没有给出。