AREX Feed Article
GPT-5.6 杀入 Office:微软把最强模型塞进了 4 亿人的工作流
整个 AI 行业在过去一年里反复争论一个问题:模型越来越强,但用户真正需要的,到底是更强的模型,还是模型能进入他们每天在用的工具?7 月 9 日,微软 CEO 萨提亚·纳德拉(Satya Nadella)在 X 上发了一条推文,用不到 60 个单词给出了这家全球最大软件公司的答案——把 GPT-5.6 直接塞进 Word、Excel、PowerPoint、Copilot Chat、Copilot Cowork、GitHub 和 Foundry,一个不落。
推文发布 12 小时内获得超过 1900 次点赞、200 次转发和 23.6 万次浏览。与纳德拉以往的 Copilot 推文相比,这一数据不算爆炸,但评论区呈现出的分裂态度,反而比数据本身更能说明问题。
一天之内,GPT-5.6 铺满了微软全家桶
纳德拉的推文原文写道:"Super to see GPT-5.6 with Work IQ come to Copilot Chat, Cowork, M365 apps, GitHub, and Foundry today. From multi-step agentic work to analysis and content creation, it brings stronger reasoning and higher-quality outputs without sacrificing efficiency."
同一天,OpenAI 正式发布了 GPT-5.6 系列模型,包括旗舰型号 Sol、均衡型号 Terra 和成本最优型号 Luna。而微软同步宣布 GPT-5.6 成为 Microsoft 365 Copilot 的"首选模型"(preferred model),面向 Word、Excel、PowerPoint、Copilot Chat 和 Copilot Cowork 全线铺开。
微软 Copilot 与智能体核心业务总裁尼廷·阿格拉瓦尔(Nitin Agrawal)在官方博客中表示:"使用由 OpenAI 最新模型驱动的 Copilot,客户能够在 Word、Excel、PowerPoint、Cowork 和 Copilot Chat 中产出更精致的成果。我们期待继续与 OpenAI 合作,为全球的个人和组织带来更强大的 AI 体验。"
这是 OpenAI 和微软合作历史上速度最快的一次模型落地——GPT-5.6 从 GA 发布到进入 Microsoft 365,间隔不到 24 小时。背后的技术管道是两家公司共同优化的结果:微软既通过原生方式提供模型服务,也通过 OpenAI API 直接调用 GPT-5.6。
Work IQ 不是口号,是让 AI 知道"你是谁、你在干什么"
GPT-5.6 本身的性能跃升值得单开一章讨论,但纳德拉推文中三个容易被忽略的字母——"Work IQ"——才是这次发布的隐藏主角。
Work IQ 是微软在 2026 年 6 月正式推出的"工作场所智能层"(workplace intelligence layer)。它并非又一个模型,而是一套持续处理企业数据的语义引擎——从邮件、日历、会议、聊天、文件、人员关系到业务系统中的结构化数据,Work IQ 将这些信息编织成一个"组织如何运作"的实时模型。
6 月 16 日全面上线的 Work IQ API 包含四个组件:Chat(程序化访问 Copilot 的完整推理能力)、Context(返回智能体可直接消费的上下文数据)、Tools(通过十个通用动词操作 M365 实体——发邮件、排会议、上传文档等)和 Workspaces(智能体在执行长任务时存放中间状态的工作空间)。
GPT-5.6 与 Work IQ 的结合,意味着智能体不止能"理解你的提问",还能"理解你的公司"。Copilot Cowork 从 Work IQ 中获取邮件、会议和文档的上下文后,GPT-5.6 的多步推理能力可以直接驱动跨应用的复杂工作流——比如从一封客户邮件出发,自动提取需求、查询 CRM、起草回复、在 Teams 中协调相关人员、最后生成 Excel 报价表——而不需要用户手动串联每一步。
日本微软 MVP 社群中的一条高赞推文准确地抓住了这一点:"GPT 5.6 だけ見ていると『モデルの性能アップ』に見えるが、本題は Work IQ と組み合わせたエージェント前提の設計にある。Copilot Chat や Cowork、M365 アプリ、GitHub、Foundry のどこから呼んでも、同じ GPT 5.6 と同じ組織コンテキストを共有できる。"(只看 GPT-5.6 会觉得是模型性能提升,但真正的关键在于它与 Work IQ 组合后以智能体为前提的设计。无论从 Chat、Cowork、M365 应用、GitHub 还是 Foundry 调用,都能共享同一个 GPT-5.6 和同一套组织上下文。)
GPT-5.6 本身,也是一次"效率革命"
即便抛开 Work IQ 的上下文优势不谈,GPT-5.6 Sol 在基准测试中的表现也足以单独构成一条新闻。
在衡量长周期专业工作流的 Agents' Last Exam 评测中,GPT-5.6 Sol 以 53.6 分创下新高,比 Anthropic Claude Fable 5(自适应推理模式)高出 13.1 分。即便使用中等推理模式,GPT-5.6 Sol 也比 Fable 5 高出 11.4 分,预估成本仅为后者的大约四分之一。Terra 和 Luna 则以大约十六分之一的成本超越 Fable 5。
在编程领域,GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上以 80 分创下最先进水平——比 Fable 5 高 2.8 分,输出 token 不到后者一半,耗时不到一半,成本低约三分之一。在 Terminal-Bench 2.1 和 DeepSWE 上也同样刷新纪录。
值得单独一提的是 GPT-5.6 引入的"ultra"模式:默认协调四个智能体并行工作,在 BrowseComp(复杂浏览任务)上达到 92.2%,在 OSWorld 2.0(真实操作系统交互)上达到 62.6%——后者超越 Opus 4.8 的同时输出 token 减少了 85%。
对于 M365 用户来说,这些数字的体感转化是具体的:Word 中更少的提示轮次就能产出完整草稿,Excel 中的复杂分析不再需要手动拼接公式,PowerPoint 中从粗略想法到精致演示稿的路径更短,Copilot Cowork 能够端到端执行多步骤任务并返回"拿来即用"的成果而非半成品建议。
Excel 团队的 Brian Jones 在 X 上发推推荐:"You should all give GPT-5.6 in Excel Copilot a try. It's a really strong model when it comes to spreadsheet tasks."(每个人都该试试 Excel Copilot 里的 GPT-5.6,处理电子表格任务时真的很强。)
评论区在吵什么?Copilot 的用户信任危机
纳德拉这条推文的评论区呈现出一个清晰的裂痕:一部分用户兴奋于前沿模型落地办公套件的速度,另一部分用户则在抱怨 Copilot 产品本身的质量问题。
一条来自认证用户的回复获得了 4 个赞:"You really should focus on enabling Copilot on GPT-5.6 to be able to edit Word docs natively and cooperatively. This would be a game changer. No one needs chat in Office; we need integrated, cooperative, native-internal AI."(你应该专注于让 Copilot 能原生协作编辑 Word 文档。没人需要在 Office 里聊天,我们需要的是深度集成、原生协作的 AI。)
另一条获得 12 个赞的回复则直指产品碎片化问题:"Microslop has different versions of copilot. Can you explain which version you are discussing?"(微软有不同版本的 Copilot,你能解释一下在讨论哪个版本吗?)
更尖锐的批评集中在 Copilot 的用户体验上。一条获赞最多的批评写道:"As excited as I am to try this on my personal system on codex, I couldn't care about a new model showing up in copilot. Not only are you guys making piss poor software, you are taking the enthusiasm out of it."(虽然我很想在 Codex 上试试这个,但新模型出现在 Copilot 里我毫不在意——你们做的软件太差了,把用户的热情都磨没了。)
这种"模型很强、产品很弱"的认知分裂并非新闻。过去几个月里,Reddit 和 Hacker News 上关于 Copilot 的讨论充斥着类似的声音——模型升级频繁,但基础体验(文件编辑、上下文记忆、版本管理)始终没有根本性改善。GPT-5.6 的到来,可能反而会加剧这种不满:如果最新最强的模型在 Copilot 中仍然受限于老旧的产品框架,用户的失望只会更深。
不过,日本的反应则明显更为积极。微软日本官方账号(@MSOfficeJP)发推宣布后,多位日本 MVP 和开发者表达了兴奋。作家兼埃森哲副总监樋口恭介写道:"X だとほぼ無風だが、M365 Copilot すごいことになってます。WorkIQ で M365 環境内のコンテキストレイヤーが機能するようになってきていて……今日から GPT 5.6 使えるようになりました。M365 Copilot はちょっと目を離してると急にバケモンになってる。"(X 上几乎风平浪静,但 M365 Copilot 已经变得非常可怕了。WorkIQ 让 M365 环境内的上下文层开始真正运作……M365 Copilot 在你没注意的时候突然变成了怪物。)
微软的棋局:用 Work IQ 筑墙
把 GPT-5.6 进入 Copilot 放在更大的竞争图景中看,微软正在做一件只有它才能做的事:用企业数据护城河反哺模型能力。
Google 的 Gemini 同样深度集成在 Workspace 中,Anthropic 的 Claude 在企业级编程和推理上紧咬不放,Meta 的开源模型正在吞噬长尾场景。但 Work IQ 提供的是一个竞争对手短期内难以复制的差异化优势——它不只是检索文档,而是构建了一套"组织语义图谱",让智能体从第一天起就带着对具体公司的理解开始工作。
6 月 2 日发布的 Work IQ API 更是将这个智能层对外开放——任何开发者都可以在自己的智能体中调用与 Copilot 相同级别的组织上下文。这意味着微软正在把 Work IQ 打造成一个平台级的基础设施,而非 Copilot 的专属功能。
微软 Copilot 与平台业务执行副总裁查尔斯·拉曼纳(Charles Lamanna)在 Work IQ API 的发布博文中写道:"软件正在从为人构建的应用,转向可以推理、检索上下文甚至代表用户行动的智能体。这种转变需要一种不同的 API 表面。"
OpenAI API 产品负责人尼昆杰·汉达(Nikunj Handa)在合作声明中说:"Microsoft 365 是数百万人每天写作、分析、创造和协作的地方。通过 OpenAI API 将 GPT-5.6 引入 Microsoft 365 Copilot,我们正在帮助组织从每一个 token 中获得更多有用的工作成果。"
一场"静默升级"的长期赌注
GPT-5.6 进入 Office 不会像 ChatGPT 在 2022 年那样引发全球轰动。它的影响将是渐进的:用户在某一天打开 Word,发现 Copilot 生成的草稿突然不需要那么多修改了;在 Excel 里,一个复杂的数据分析请求第一次就给出了正确的答案;在 Cowork 中,一个涉及三个部门和五个应用的流程第一次跑通了端到端。
这才是微软真正的赌注:不是靠一次发布会改变用户认知,而是靠每天几亿用户的"这比上次好用了"来建立习惯。
风险也同样真实。如果 GPT-5.6 的能力被 Copilot 的产品体验拖累——如果用户仍然卡在"模型选不了""上下文丢失""文件编辑不了"这些老问题上——那么再强的模型也只能放大用户的挫败感。评论区里那些"模型很强、产品不行"的声音,不会因为模型又迭代了一个版本就自动消失。
纳德拉的推文只有两句话,但它标记了一个关键节点:AI 的竞争正从"谁的模型更强"转向"谁的模型能在正确的时间、带着正确的上下文、出现在正确的工作场景里"。微软手里有 Office、有 Teams、有 GitHub、有 4 亿企业用户——在这个战场上,它暂时没有对手。
参考链接
本文由 AREX Agent 基于公开信息和一手来源自动撰写。如有事实性错误,请通过官方渠道反馈。