AREX Feed Article
Google 给 Agent 装了刹车:环境钩子 + 免费层上线
Google DeepMind 在 7 月 28 日发布了 Gemini Managed Agents API 的一次大版本更新。Gemini 3.6 Flash 取代 3.5 Flash 成为默认模型,环境钩子(environment hooks)允许开发者在沙箱内部拦截和审查每一次工具调用,免费层面向所有无付费绑定项目开放,外加预算硬上限、定时触发器和环境管理 API。Logan Kilpatrick(Google AI 团队成员,负责 Gemini、Google AI Studio 与 Gemini API)在 X 上发布了这条消息,Google 官方账号随后做了推荐,推文获得 558 次喜欢和 9.6 万次浏览。
这不是一次模型升级。这是 Google 给 AI Agent 装控制层的一次静默转向。
Gemini 3.6 Flash 打底,六项更新瞄准同一个靶心
本次更新的六项变化,单独看每一项都是功能迭代,放在一起才能看清方向。总结如下:
Gemini 3.6 Flash 成为默认模型。 antigravity-preview-05-2026 agent 现在默认运行 3.6 Flash,现有集成无需任何代码改动即可自动切换。3.6 Flash 在推理、编码和工具使用上做了平衡优化。不想自动升级的团队可以通过 agent_config.model 显式锁定到 3.5 Flash 或 3.5 Flash-Lite。AI Pricing Guru 的定价数据显示,3.6 Flash 的输入价格为每百万 token $1.50,输出 $7.50;3.5 Flash-Lite 输入仅 $0.30,输出 $2.50,成本差距可达三倍。
环境钩子是这次更新里最重的一颗棋子。 开发者在沙箱中放置 .agents/hooks.json,即可在每次工具调用前后执行自定义脚本。pre_tool_execution 钩子可以拒绝危险操作并告知 agent 拒绝原因,post_tool_execution 钩子用于校验、格式化或审计。匹配器支持正则表达式,可精确到单个工具或覆盖全部调用。AI 投行 OffDeal 已经用这一机制在生产环境中对 AI 分析师 Archie 生成的金融幻灯片执行像素级 logo 校验。
预算控制(max_total_tokens) 允许开发者为单次交互设置总 token 消耗上限。达到上限后 agent 安全暂停,保留环境状态,开发者可通过 previous_interaction_id 追加预算后继续——不是失败,而是暂停。
免费层支持 让无付费绑定的项目也能在 UI 和 API 中试用 Managed Agents。Google 声明预览期内不收取沙箱计算资源费用(CPU、内存、执行环境),只按标准费率收取模型推理和工具使用的 token 消耗。
定时触发器 将 agent、环境、提示词和 cron 表达式绑定为持久化资源,每次运行复用同一沙箱,文件跨执行持久化。Google Cloud 首席布道师 Richard Seroter 在引用推文中特别指出了这一功能的价值。
Environments API 允许从代码中列表、查看和删除沙箱会话,在断连后恢复环境 ID,或在流程结束后主动清理,不再依赖 7 天 TTL 自动回收。
不想让 Agent 干坏事?把校验脚本塞进沙箱就行
环境钩子解决的是一个架构级问题:在托管的远程沙箱里,开发者之前没有地方运行自己的校验代码。
Managed Agents 的工作方式是在 Google 云上为每次交互创建一个隔离的 Linux 沙箱。agent 在沙箱里执行代码、读写文件、安装包、搜索网页。在此之前,开发者只能看 agent 做了什么,不能在它做之前阻止它。如果 agent 写了一个有安全风险的命令,或者生成的文件格式不符合团队规范,开发者只能在事后发现——这时沙箱里已经跑完了一整条链路。
钩子改变了这一点。配置文件看起来像这样:
{ "security-gate": { "pre_tool_execution": [ { "matcher": "code_execution|write_file", "hooks": [ { "type": "command", "command": "python3 /.agents/hooks-scripts/gate.py", "timeout": 10 } ] } ] }, "auto-format": { "post_tool_execution": [ { "matcher": "*", "hooks": [ { "type": "command", "command": "python3 /.agents/hooks-scripts/auto_lint.py", "timeout": 15 } ] } ] }}security-gate 组在每次代码执行或文件写入前运行 gate.py。如果脚本返回 {"decision": "deny", "reason": "..."},工具调用被跳过,拒绝原因传入模型上下文——agent 知道自己被拦了、为什么被拦,可以在后续回合中调整行为。auto-format 组在每次工具调用后运行 auto_lint.py,强制执行代码风格。
钩子还支持 http 类型处理器,可以直接 POST 到外部校验服务。
社区对钩子的反应集中在安全与可靠性的分界线上。Winston B.(@DoDataThings,AI 开发者)评论:"环境钩子才是真正的新闻。在沙箱内阻止或 lint 工具调用,意味着故障模式从'agent 做了坏事'变成了'agent 尝试做坏事但在执行前被抓住了'。这和换一个模型是两种完全不同的可靠性叙事。"Ofek Shaked(@VibeCoderOfek,AI 工程师)提出更实际的关切:"免费层和模型选择器有用。真正的生产门槛在于那些环境钩子能否在实际流量下强制确定性的 pre 和 post 工具契约。"
OffDeal 创始人兼 CTO Alston Lin 在官方博客中详细说明了钩子如何改变了他们的工作流。OffDeal 的 AI 分析师 Archie 每天为银行家准备金融幻灯片,每张幻灯片可能包含 30 多个公司 logo,每个 logo 必须满足五项硬性标准:正确的公司、合适的尺寸和比例、包含公司名、透明背景、在白底幻灯片上具有足够对比度。林的原话是:"在 agent 钩子之前,我们无法在 Gemini 托管 agent 上实现这一点:沙箱是远程的,我们的校验代码无处可运行。有了钩子,post_tool_execution 钩子在 Archie 写出公司列表的那一刻就在沙箱内触发我们的校验流水线。"
Token 烧到上限自动暂停,保留现场等你追加预算
自主 agent 的最大恐惧之一是无限循环。agent 在推理、调用工具、重试失败、再推理之间反复横跳,token 消耗可以迅速膨胀。Google 此前没有提供交互级 token 上限。
max_total_tokens 解决了这个问题。它统计一次交互中输入、输出和思考 token 的总和,达到上限后交互返回 status: "incomplete",环境状态完整保留。开发者检查结果后决定是否追加预算继续运行。
AI Pricing Guru 的定价分析指出,这可能是本次发布中最重要的成本控制功能:"自主 agent 可以反复检查文件、推理、调用工具、重试失败。每次运行的 token 上限把开放式循环变成了可度量的最大暴露量。"该分析同时警告,过低的预算上限会导致大部分任务中断,加上人工介入和重试,可能比一个更大的、一次完成的上限更贵。
Google 没有为 Managed Agents 引入单独的平台费。模型推理和中间推理 token 按标准费率计费。沙箱计算资源(CPU、内存、执行环境)在预览期内不收费,但 AI Pricing Guru 建议生产环境预测应将沙箱计算纳入未来的成本情景。
Agent 不用每次手动启动了,设个 cron 就行
定时触发器让 agent 从"每一次都要手动启动"变成了"到点自动干活"。Google Cloud 首席布道师 Richard Seroter 在引用推文中写道:"我喜欢这些托管 agent 的定时触发器。设置一个 cron 计划,你的 agent 就会自动运行,无需任何干预。"
触发器的关键设计是每次运行复用同一个沙箱。这意味着文件在两次执行之间持久化——周一 agent 分析的数据文件,周三的定时任务可以继续使用。cron 与沙箱持久性的组合,让 Managed Agents 从单次 API 调用升级为持续运行的自动化工人。
Environments API 补齐了沙箱生命周期管理的最后一块拼图。之前开发者无法从代码层面管理沙箱——创建了但断连了,只能等 7 天 TTL。现在可以列出、查看和主动删除沙箱。
3.6 Flash 默认了——但生产环境最好锁住版本
Gemini 3.6 Flash 成为默认模型的变化是自动的。Kilpatrick 明确说"无需代码改动",Google 官方博客声明"你的下一次交互会自动使用新模型"。
这种零摩擦升级对快速迭代的开发者是福音,但对需要稳定性的生产环境有风险。AI Pricing Guru 建议:"在生产部署中锁定模型版本,单独测试新默认模型。"模型从 3.5 Flash 切换到 3.6 Flash 意味着 token 使用模式、响应质量和延迟都可能发生变化。3.6 Flash 输入价格与 3.5 Flash 相同($1.50/百万 token),但输出价格更低($7.50 vs $9.00)。
三个支持的模型覆盖了从高能力到低成本的光谱:3.6 Flash 适合需要平衡推理、编码和工具使用的任务;3.5 Flash 是前代通用 agent 模型;3.5 Flash-Lite 输入成本仅 $0.30/百万 token,适合大量低复杂度调用。
社区等 3.5 Pro,Google 却在修路
Logan Kilpatrick 的推文评论区出现了一个清晰的裂口。点赞最高的几条回复几乎不关心钩子和免费层:"Bro we are waiting for Gemini 3.5 Pro. Please ship the model"(Ali Haider,@ggg78g89);"Should I give up on 3.5 pro ever being released?"(Rohit Bhatiya);"Gemini 3.5 is definitely dead"(PVO81,获得 18 个赞)。
这种分裂本身就说明问题。一部分用户还在用"模型战争"的框架审视 Google——他们关心的是 GPT-5、Claude 4、Kimi K3 的对标模型何时出现。另一部分——在评论区中人数少但声音更聚焦的开发者——看到的是钩子、预算控制和免费层:"the block hook is the one I'd actually use here"(Somi AI,@somi_ai);"the ability to lint code before the agent runs it is huge"(Cluster Protocol)。
Sugee(@gbhakuni85,AI 和加密领域开发者)的引用推文抓住了关键矛盾:"Google 正在悄悄让 Gemini 成为 agent 的默认后端。钩子 + 模型选择 + 免费层 = 无需预付费即可更容易地交付生产 agent。3.6 Flash 作为默认模型意味着更快、更便宜的运行。这降低了开发者的摩擦,把 Google 直接放在了与 OpenAI 争夺 agent 基础设施的赛道上。"
从行业横向对比看,Google 的 Managed Agents 和 OpenAI 的 Agents SDK、Anthropic 的 MCP 构成了当前 agent 基础设施的三条路线。OpenAI 押注的是模型能力驱动 agent 行为,Anthropic 押注的是开放协议连接外部工具,Google 在这里选择的是"全托管沙箱 + 内置控制层"——把沙箱、钩子、预算、调度捆成一个端到端的平台。三者目前都处于快速迭代阶段,尚无明确的赢家。
比 benchmark 更难的考试:让企业敢在生产环境跑 Agent
过去 12 个月,AI 行业几乎所有注意力都在模型能力上——谁的模型在 MMLU 上多拿了 2 分,谁的模型在 coding benchmark 上超过了谁。Google 在这次更新里做的是另一件事:让 agent 能在生产环境中被信任。
环境钩子解决可控,预算上限解决可预测,定时触发器解决可自动化,Environments API 解决可管理,免费层解决可试错。这五件事放在一起,比一个更高的 benchmark 分数更能决定 agent 技术能不能从 demo 走进生产系统。
3.5 Pro 的缺席在评论区反复出现,市场对 Google 前沿模型能力的焦虑没有消失。这次更新的真正赌注不在模型能力上。它赌的是:当企业决定在生产环境部署 AI agent 时,可控的托管平台比最聪明的模型更有价值。
参考链接: