AREX Feed Article
AWS 宣布 Grok 4.6 上线 Amazon Bedrock:新增 bedrock-runtime 端点与 xhigh 推理档
9 月 21 日,AWS 在 Machine Learning Blog 发文宣布,xAI 的 ,这是 xAI 继 Grok 4.3 之后登陆该平台的第二款模型。按公告的说法,Bedrock 模型目录由此新增一款为长程代理(long-running agents)、编程和知识工作构建的前沿模型:50 万 token 上下文窗口,推理力度(reasoning effort)分 low、medium、high、xhigh 四档。
这次的增量集中在接入面。Grok 4.6 同时可用 bedrock-mantle 和 bedrock-runtime 两个端点,并新增对 Converse API(含 converse_stream 流式)的支持,而 7 月上线的 Grok 4.3 没有这项能力;xhigh 档、Amazon Bedrock Guardrails、跨区域推理配置文件(cross-region inference profiles)、调用日志(invocation logging)和提示缓存(prompt caching)也随这款模型新出现。公告注明,模型本身由 xAI 于 8 月 12 日发布、8 月 18 日上线 Bedrock,这篇文章对它在 Bedrock 上的打包形态和首个请求写法做了完整交代。
接入面从单一 Mantle 端点扩到双端点
,xAI 以模型供应商身份加入该平台。当时模型只跑在 Mantle 上,也就是 Bedrock 里的 OpenAI 兼容推理引擎,客户端用 OpenAI SDK 指向区域端点,走 Chat Completions 或 Responses API;除区域内推理外,Geo 和 Global 跨区域推理在发布时均不提供。
Grok 4.6 把接入面扩大了一圈:模型同时出现在两个端点上。能力清单也要分开看——工具调用、结构化输出、图像输入、响应流式和加密推理内容是 Grok 4.3 首发时就有的;这次公告列出的其余新能力,才是随 Grok 4.6 进入 Bedrock 的。
模型底子:更长的补充训练与 xAI 自报的基准
按 xAI ,模型在 Grok 4.5 之上强化长程代理和更复杂的交互、视觉任务:能在多步任务里持续跟进,长轨迹中会更多地自我测试与验证后再前进;视觉与交互类项目的第一版更完整,能在一轮之内立起应用的结构和视觉语言。训练侧,xAI 称这次补充训练比 Grok 4.5 更长,用 Grok 4.5 重生了覆盖不同推理力度、agent harness(代理运行框架)和 STEM、软件工程、知识工作等领域的监督微调(SFT)轨迹,再以模型化检查过滤问题轨迹,最后在知识工作、通用编程以及内核优化、Web 开发、计算机辅助设计等领域的大范围代理式强化学习(agentic RL)任务上训练。
安全方面,xAI 称防护已随能力同步校准,为此做了其“迄今最广”的部署前测试套件,外加部署后与第三方测试。
基准数字是 xAI 发布时公布的 Grok 4.6 High 自报成绩:
| 评测 | Grok 4.6 High |
|---|---|
| AA Intelligence Index | 61 |
| GDPVal-AA v2 | 1,753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 (Extended) | 61.3% |
| APEX-Agents | 57.5% |
| Terminal-Bench v3.0 | 26% |
| APEX-SWE | 56.4% |
| AA-Briefcase | 1,577 |
| Harvey LAB (Vals) | 15.8% |
xAI 称模型在 AA Intelligence Index 上与 GPT-5.6 Sol 持平(同为 61),Fable 5 Max 为 62,上一代 Grok 4.5 High 为 56;竞品分数取自各开发方公开的系统卡(system card)或榜单。AWS 博客另按 Artificial Analysis 的口径补充:这个指数由九项评估合成,覆盖代理式工具使用、推理与知识、知识可靠性、长上下文推理和对表格文档的定量分析,AA-Briefcase 则是其代理式知识工作基准。
在 Bedrock 上,这款模型的上下文窗口是 7 月的 Grok 4.3(100 万 token)的一半;接受文本和图像输入、返回文本;音频、语音、视频、向量嵌入(embedding)模态不支持,也不生成图像。模型发布当天可在 Cursor 和 Grok Build 使用,首周提供 2 倍额度,API 及 OpenRouter、Vercel、Cloudflare 等合作方同步可用。
bedrock-runtime 怎么用:模型 ID、Converse 流式与端点选型
bedrock-runtime 的实际意义是不必再只用 OpenAI 兼容客户端:AWS SDK 和 Bedrock 标准控制面就能调模型。API 面上有 Responses、Chat Completions 和 Converse 三种,Invoke API 不支持。Converse API 提供 converse 与 converse_stream 两个调用,一套消息格式可跨模型复用,流式走 messageStart、contentBlockDelta、contentBlockStop、messageStop、metadata 这些标准事件,不用自己解析服务器推送事件(SSE)。
模型 ID 因端点而异:bedrock-mantle 上是 xai.grok-4.6,base URL 为 https://bedrock-mantle.{region}.api.aws/openai/v1;bedrock-runtime 上是 us.xai.grok-4.6 或 global.xai.grok-4.6,base URL 为 https://bedrock-runtime.{region}.amazonaws.com/openai/v1。模型经推理配置文件而非按需吞吐(on-demand throughput)的裸模型 ID 提供,所以在 runtime 上的请求必须点名带 us. 或 global. 前缀的配置文件。
两端点的功能清单并不相同,博客认为这是对选型影响最大的细节:bedrock-mantle 支持客户端工具调用、推理、结构化输出、提示缓存、响应流式、projects 和滥用检测;bedrock-runtime 支持推理、提示缓存、响应流式、调用日志和 projects(仅默认项目),不支持结构化输出、服务端工具调用、智能提示路由、count tokens 和应用推理配置。工具调用两端都可用,runtime 上可经 Converse 的 toolConfig 或 OpenAI 兼容的 tools 参数驱动调用循环。博客的选型结论是:依赖 JSON Schema 结构化输出的应用指向 bedrock-mantle,需要 Converse API 或调用日志的指向 bedrock-runtime。
IAM(身份与访问管理)侧有几个具体约束。bedrock:InvokeModel 会对三个资源求值:账户默认项目、请求点名的推理配置文件和底层基础模型;基础模型的 ARN(Amazon 资源名称)要按区域通配,因为跨区域配置文件会把流量路由出调用区域。两个推理配置文件各自独立授权,只授权 us.xai.grok-4.6 并不覆盖 global.xai.grok-4.6;OpenAI 兼容端点用 bearer token(不记名令牌)认证时还需要 bedrock:CallWithBearerToken 权限。凭据方面,博客沿用 Grok 4.3 发布时的指引:长期 API key 只用于探索,生产环境改用 aws-bedrock-token-generator 从 IAM 凭据生成的短期 bearer token。
xhigh 档:上限抬高,代价自己算
推理默认开启,力度分 low(默认)、medium、high、xhigh 四档。xhigh 是相对 Grok 4.3 发布时记载的 none、low、medium、high 新增的最高档,博客把它留给更深一轮推理值得多花 token 的问题。OpenAI 兼容接口里通过 reasoning 参数设置;Converse API 上则要通过 additionalModelRequestFields 传 {"reasoning_effort": "xhigh"}。
推理内容是加密的。Responses API 请求带 include: ["reasoning.encrypted_content"] 可以取回加密推理内容,下一轮再传回去,让模型把先前的推理当作多轮对话的上下文;Chat Completions API 不返回推理 token。
博客把推理力度当作实打实的成本与时延控制来写:抽取、分类这类短调用跑 low,把 high 和 xhigh 留给规划步骤和长代理轨迹,因为这类场景里早期一步走错会一路放大;它还建议在自己的负载上实测各档位,找出更高推理不再值回 token 成本的位置。
Guardrails 管边界,日志管审计,缓存管账单
Guardrails 在 bedrock-runtime 的全部 API 上可用,提供内容过滤、拒绝主题、个人身份信息(PII)脱敏和词语策略;按 guardrail ID 和版本挂到请求上,策略同时作用于提示词和模型响应。博客点出它对代理负载的意义:给一个可能多步无人值守运行的模型围上一致的政策边界。
调用日志打开后,Grok 4.6 的调用会以完整 CloudWatch 记录留存:请求体、响应体、含推理 token 在内的 token 计数和所用推理配置文件,用于审计代理运行中模型实际被问了什么。
提示缓存按标准输入价的约四分之一计费,缓存作用于重复前缀,受益的是每轮都重发大系统提示或长文档的代理。博客给出的用法是把稳定内容放在请求前部,并在 usage 块里核对缓存 token 计数,确认折扣真的生效后再写进成本模型。
区域与价格:全球配置更便宜,档位是更大的杠杆
区域可用性因端点而异。bedrock-mantle 只在位于美国西部(俄勒冈)的 us-west-2 区域提供区域内推理;bedrock-runtime 不提供区域内推理,只能走跨区域推理配置文件:Geo 配置从 us-east-1、us-east-2、us-west-1、us-west-2 四个美国区域可用,Global 配置的起点区域超过 30 个,横跨美国、加拿大、欧洲、亚太、中东、非洲和南美。Geo 在地理域内路由并遵守数据驻留,Global 全球路由、容量池最大;完整区域清单以 为准。
价格上,global.xai.grok-4.6 每百万输入 token $2.00,us.xai.grok-4.6 为 $2.20;没有数据驻留约束时,博客认为 Global 通常是更好的默认值。xAI 官方挂牌的模型价格从每百万输入 token $2、输出 token $6 起,快速变体为两倍价。
服务分三档:Standard 按量计费、无承诺;Priority 加收 75%(1.75 倍)换取更快的处理;Flex 半价(0.5 倍),面向非时敏负载。博客把差异算成一笔账:同样每百万输入 token $2.20 的区内 Standard 负载,Priority 要 $3.85,Flex 只要 $1.10。按博客的判断,选服务档位是比选区域更大的成本杠杆。