AREX Feed Article
MAI-Code-1.1-Flash 杀入 Copilot:新增视觉,标价砍掉 73%
8 月 11 日,微软在 GitHub Copilot 中上线了新一代小型编程模型 MAI-Code-1.1-Flash。新模型首次加入原生视觉能力,可以直接理解截图、UI 布局等图像输入,同时标价比前代 MAI-Code-1-Flash 。
给出了更多数字:Terminal-Bench 2.1 得分从 51.7% 拉升至 62.9%,.NET 任务提升 15%,Token 生成速度快了 25%,完成同一任务消耗的 Token 反而少了 25%。GitHub 同日宣布,旧版 MAI-Code-1-Flash 将于 9 月 10 日全面退役。
开发者:便宜是真便宜,但能比得过 DeepSeek 吗?
新模型上线当天,日本开发者 @fuyuu230 在 X 上晒出 Copilot 模型选择器截图,惊叹"一次对话只消耗不到 5 个 credit,有点感动"。另一位日本用户 @toge_ 则抱着"希望的观测"等待实测,0.25 倍年订请求倍率意味着切换成本极低。
但质疑同样来得很快。开发者 @rob_szach 直接在微软官宣帖下挑刺:""Token 流式速度快了 25%?Token 数量少了 25%,per second 根本没变,这不叫更快。""
科技媒体 的批评更为尖锐,在评测标题中用了"crushed"一词。它列出 benchmark 对比:MAI-Code-1.1-Flash 在 Terminal-Bench 2.1 拿到 62.9%,DeepSeek-V4-Flash-0731 的成绩是 82.7%。
价格方面,DeepSeek-V4-Flash 输出仅 $0.28/百万 Token,MAI-Code-1.1-Flash 输出要 $1.20。降价后的微软模型仍比对手贵四倍多。
中文科技博主 把逻辑线拉得更直:"降价 75% 不是慈善——是被中国模型的价格战逼出来的。编程模型的价格锚点,正在被中国厂商重新定义。"
从 Build 首秀到被截胡,再到九月全面换新
MAI-Code-1-Flash 在今年 6 月微软 Build 大会上首次亮相。7 月底,VS Code 团队发布其生产表现:代码存活率、提交存活率均优于 Claude Haiku 4.5 和 GPT-5.4 Mini,Token 效率也有明显优势。
但初代 Flash 的窗口期很短。据 回顾,其定价在当时看起来相当有竞争力,"很快就被 GLM-5.2、Kimi K3 等中国模型以及 OpenAI 的 GPT-5.6 Luna 盖过了风头。"
现在 1.1 版本接棒,旧版正式进入退役倒计时。GitHub 明确表示,MAI-Code-1-Flash 不会自动迁移到新版。如果开发者或企业脚本里硬编码了旧模型名,9 月 10 日到期就会直接中断。
多跑 22% 的终端任务,少花 25% 的 Token
微软官方博客给出三个维度的提升数据。
代码质量方面,代码存活率(生成后经 10 分钟编辑仍保留的比例)上升 4%,开发者回访率上升 9%。这两个指标来自 Copilot 生产环境的聚合数据,不是实验室 benchmark。
专项任务方面,Copilot CLI 中 Terminal-Bench 2.1 得分从 51.7% 提升到 62.9%,提升幅度 22%。.NET 任务单独提升 15%。微软表示这两项改善直接来自开发者反馈。
Token 效率方面,"完成同一任务消耗的 Token 减少 25%"。微软强调这不是堆更大的模型实现的,而是在数十万个 Copilot 强化学习环境中针对真实使用模式训练出的结果,Token 流式速度相应快了 25%。
定价上,MAI-Code-1.1-Flash 在 Copilot 用量计费标准为:输入 $0.20/百万 Token(缓存 $0.02),输出 $1.20/百万 Token。前代分别是 $0.75/$0.075/$4.50。年订用户的请求倍率仅 0.25 倍。
视觉能力是从无到有的变化。模型现在可以直接理解图像输入,开发者可以把崩掉的 UI 截图或设计稿直接丢进 Copilot Chat,让模型基于画面内容生成修复代码或布局建议。该能力覆盖 Copilot CLI、cloud agent、GitHub Copilot app、Copilot Chat、VS Code、Visual Studio、JetBrains IDE、Eclipse、Xcode、GitHub Mobile 等全部 10 个入口。
模型价格被中国厂商定义后,微软选择了跟进
The Decoder 在评论文章中画了一条更宽的线:微软近期在 Copilot 中大举替换 OpenAI 和 Anthropic 模型,换上自研 MAI 系列,背后的逻辑是降本:用更差的性能换更好的利润率。MAI-Code-1.1-Flash 延续同一策略。
文章还提了一个让微软难回避的问题:既然公司高层反复宣称拥抱开源 AI,为什么不直接用更便宜、更强、且已开放权重的 DeepSeek-V4-Flash,而是把资源砸进一个更弱、更贵、且闭源的自研模型?
答案可能比"开源理想"更现实。GitHub Copilot 拥有庞大的开发者用户基数,绝大多数人从不手动切换模型。只要默认模型换成 MAI,无论 benchmark 上输赢如何,微软都能锁定一个巨大的分发份额,同时把推理成本攥在自己手里。
Business 和 Enterprise 管理员需要自行在 Copilot 设置中开启 MAI-Code-1.1-Flash 策略,默认关闭。Free 和 Student 用户通过自动模型选择获取,Pro、Pro+、Max 等付费用户可手动切换。
降价七成,本质是把定价权从对手手里买回来
MAI-Code-1.1-Flash 不是一次常规迭代。它用 73% 的降价和首次加入的视觉能力,在告诉 Copilot 的用户:你不必离开这个生态去找更便宜的模型。至于 benchmark 上输给 DeepSeek 的那 20 个百分点,在庞大的默认用户基数面前,重要性可能被高估了。
参考链接
- _