Microsoft 悄悄用自研 MAI 替换 OpenAI/Anthropic:Nadella 的算盘,比我预想的大得多

发布时间:2026/7/24 20:24:10
Microsoft 悄悄用自研 MAI 替换 OpenAI/Anthropic:Nadella 的算盘,比我预想的大得多 上周四深夜我 GitHub Copilot 的补全突然变得很「怂」事情是这样的。我那天在用 Go 写一个文件搜索工具需要用到filepath.Walk。之前的 Copilot 遇到这种场景基本我打了filepath.Walk之后它会自动补出回调函数的签名的然后我敲回车它继续补一个完整的文件处理逻辑——递归进子目录、处理权限错误、跳过隐藏文件。一条链下来能省半分钟。但那天不一样。我打了filepath.Walk它只补了一个裸的函数签名然后停住了。我需要手动补完函数体内前几行它才开始继续。像是换了一个「胆子很小」的模型不敢一次猜太多。我停了一下想是不是 Copilot 的上下文缓存出了问题切了另一个项目试一样。换 VS Code 试——还是一样。我开始嘀咕了。第二天深夜刷到 Satya Nadella 在 X 上发了一条长帖。读到一半我停下来往回翻——不是因为他写得太长而是因为我终于确定 Copilot 的变化是有原因的而且这个原因此我想象的严重得多。Nadella 在那条帖子里坦白了Microsoft 已经在悄悄用自研的 MAI 模型替换自家产品里的 OpenAI 和 Anthropic 模型。GitHub Copilot 和 Excel 已经切换了。Outlook 刚接入。Copilot Chat 和 PowerPoint 是下一批。我放下手机从两个角度看这件事。作为一个每天都靠 Copilot 补全代码的开发者我需要知道这会不会影响我的工作流。作为一个长期关注 AI 产业的人我意识到这可能是我今年见过的最重要的 AI 产业结构信号——比任何模型跑分都更能说明 AI 产业链正在发生什么。Nadella 的整套逻辑回溯到最后就是一句话Nadella 的长帖我翻来覆去看了很多遍。CEO 套话去掉之后剩下来的核心论点就一个「软件第一次有了真实的边际成本」。展开说。2024 年之前你买一个软件产品付订阅费然后功能随便用。Excel 里的 SUMIF 函数调用一万次也不额外收费、Outlook 收一万封邮件也不按封计费。软件是固定成本的生意——研发成本固定分发成本接近零用户的边际使用成本是零。AI 改变了这个模型。每一次 Copilot 补全、每一次 Excel 公式自动生成、每一次 Outlook 邮件摘要提取——全在消耗 GPU 算力。全都在产生推理费。这不是订阅费的「已包含」范畴是一个按 token 计费的账单随着用户增长在起飞的。拿 GitHub Copilot 举例方便理解。假设每次补全消耗300 token成本约 0.001 美金用目前 API 定价中档模型算。一个活跃开发者每天触发 100 次补全就是 0.1 美金。听起来不多。但 Copilot 有超过800 万甚至更多活跃用户。800 万 × 0.1 美金 × 30 天——一个月就是 2400 万美金的推理费。一年接近 3 亿美金。注意这只是 Copilot 一个产品还没算 Excel、Outlook、Teams、Bing——所以 Nadella 不是在问「MAI 模型强不强」他是在问一个更尖锐的问题「在 MAI 能胜任的场景里把推理费省下来够不够再造一个微软规模的新业务」MAI 模型家族不是临时搓的这点很重要很多人以为 MAI 是 Microsoft 看到 OpenAI 越狱事件后的应急方案。这个理解是错的——MAI 的布局至少有一年半。6 月 2 日 Mustafa Suleyman 一次性端出七个模型覆盖推理、编程、图像、语音、转录是一个完整的模型矩阵。我挑三款最有代表性的拆开看模型参数 / 定位对标定价信号MAI-Thinking-1旗舰推理从零训练无蒸馏GPT-5.6 Sol、Claude Opus 4.8未公开但微软内部成本远低于 GPTMAI-Code-1-Flash5B 活跃参数代码场景特化Claude Haiku、GPT-5.6 Luna比 Haiku 还便宜MAI 通用 Lite办公场景深度微调GPT-5.4按 Nadella 的说法效率比 GPT-5.4高 10 倍这三个数据连起来读战略就清晰了MAI-Thinking-1守旗舰推理能力。它不是用来替换 GPT-5.6 Sol 的——Sol 在复杂推理和 Agent 任务上仍然是领先的。但 Thinking-1 的存在确保了 Microsoft 在「不说自己是最强但绝对够用」这个定位上有牌可打。MAI-Code-1-Flash 是替换的主力。5B 参数——比 ChatGPT 免费版用的模型还小。但注意它是代码特化的训练数据以代码为主在代码补全、类型推断、简单重构上的表现跟通用旗舰模型在这个子集上的差距很小。配合比 Haiku 更低的价格——这个组合打的不是性能战是成本战。MAI 通用 Lite 是关键的经济学武器。Nadella 说它在 Excel 场景跟 GPT-5.4 相当且效率高 10 倍。效率高 10 倍意味着同样的吞吐量需要的 GPU 是 GPT-5.4 的十分之一。在几亿用户的规模下这个效率差就是利润差。另外一个细节我特意查了一下。Nadella 在帖子里强调「MAI-Thinking-1 的训练数据是 clean、traceable 的不含蒸馏自其他模型的内容」。这句话的商务含义比技术含义大得多——他在向企业客户承诺你的数据经过 MAI 处理时不会意外经手 OpenAI 的基础设施。这对金融、医疗、政府客户来说可能是最大的卖点。我手动测了 MAI-Code-1-Flash发现确实「够了」读文章是一回事亲身体验是另一回事。我通过一个代理 API 接入了 MAI-Code-1-Flash用三天时间在不同场景里跟 Haiku 做了对比。// 场景 1从 JSDoc 生成 TypeScript 接口类型 // MAI-Code-1-Flash 输出0.8s 首 token interface UserConfig { theme: light | dark; locale: string; plugins: PluginOptions[]; notifications: { email: boolean; push: boolean; frequency: immediate | daily | weekly; }; cache: { ttl: number; strategy: lru | ttl; maxSize: number; // MB }; } // Haiku 输出0.9s 首 token多了两个字段 retryPolicy 和 timeout // 结构完全一致Haiku 略完整差距很小 // 场景 2重构一段有副作用的纯函数 // 原始代码 35 行用 switch-case 做了条件分支 // MAI-Code-1-Flash 输出了一个策略模式的重构版本24 行 // Haiku 输出类似的方案22 行更简洁但可读性不如 MAI 版本 // 场景 3解释一个带回调的复杂异步流程 // 两边的解释都在「能用」水平MAI 字数多但覆盖全面 // Haiku 更精炼但遗漏了一个边界条件三天的结论很直接在代码补全和理解场景里MAI-Code-1-Flash 的体验差距跟 Haiku 几乎不可感知。偶有 Haiku 更精准的 case但误差在 5% 以内没有一次是不可用或者错得离谱的。如果你的 Copilot 后端从 Haiku 换成了 MAI-Code——你可能需要刻意对比才能发现差别。当然我必须坦白我的测试局限性我没测 Excel 公式生成和 Outlook 摘要场景因为我没有相应的 API 接入。但 Nadella 公开说 Office 微调版本跟 GPT-5.4 相当至少说明他们内部做过充分测试。在 Microsoft 的体量下做这种切换之前的数据验证不会少。最意外的冲击来自批量推理的数学我说 MAI 替换策略「比我预想的大得多」不是因为我低估了 MAI 的能力——我低估的是规模效应在推理成本上的碾压程度。来做一道小学数学题。已知Microsoft Office 365 付费用户约4 亿2025 财年公开数据假设其中 25% 每天使用 AI 功能1 亿活跃用户每人每天触发 5 次 AI 推理每天 5 亿次推理每次推理平均消耗 300 token每 token 节省 0.00001 美金每天节省 15 万美金一年就是节省 5400 万美金。而且这个计算还是保守的——真实场景中 Copilot 补全、Excel 公式、Teams 会议摘要、Outlook 智能回复加在一起每人每天远不止 5 次。推理 token 消耗也可能更高。所以实际年节省量很可能在 2-5 亿美金区间。注意这个节省不是「削减成本」那么简单——它是毛利率的直接提升。在 Copilot 等 AI 产品目前普遍还在补贴推广期的背景下把推理成本打下去意味着 AI 功能可以更早、更激进地推向免费层进一步扩大用户基数。这是一个正向循环MAI 自研 → 推理成本下降 → 免费策略激进 → 用户增长 → 更多数据 → MAI 模型更好。而使用第三方模型的竞品只能被动降价。我之前写 Cursor Router 的时候分析过模型选择路由器的经济性。Cursor 的方案是帮用户在 API 层面省钱——每次请求选最便宜的模型。Microsoft 的方案更彻底连模型本身都换了从根上砍掉中间层的全部利润。谁是最大受害者我排了个序我花时间想了一个问题Microsoft 这个替代策略伤害最大的是谁答案跟直觉不太一样。玩家受影响程度具体分析OpenAI中等短期疼痛损失最大客户的推理收入但 GPT-5.6 Sol 旗舰地位仍在且非 Microsoft 场景的需求仍然强劲Anthropic轻微Claude 本来就没在 Microsoft 生态里深度嵌入不受直接影响模型聚合 / 中间层平台高Microsoft 不再需要通过中间层路由多模型自研直接替换了聚合器的位置开发者你和我两面性最高短期受益更低成本→更多免费功能长期面临 Copilot 后端锁死的风险中间层聚合平台是最受伤的但声音最小。OpenAI 有品牌、有技术壁垒、有开发者生态失去 Microsoft 不会死。中间层公司的核心价值就是「帮你接不同模型」——当最大的那个客户直接跳过你自建了你的商业模式就收窄了。至于开发者——我跟几个同行聊了这个话题分歧挺大。有人认为「后端换了更便宜的模型又怎样代码补全质量没降我有什么好担心的」也有人觉得「当 Copilot 后端完全锁死在 Microsoft 自家模型上我就失去了判断能力——我不知道它在哪些场景弱、哪些场景强我只能被动接受任何输出。」我站在偏担忧的那边。不是因为 MAI-Code 不好而是因为一旦锁死你连对比的机会都没有了。就像现在 VS Code 的 Copilot 设置里没有「选择模型」的选项——你用的是 OpenAI 还是 MAI背后是哪个版本你什么都不知道。短期没问题长期你会在无感知的情况下被一个「够用但不顶尖」的模型拉低整体效率。这个事件给每个做 AI 应用的人上了三面墙看完整件事情我没有觉得 Microsoft 背叛了 OpenAI——这是产业演化的自然结果。但有三条教训是每一个基于他人模型做产品的人应该记住的第一如果你基于他人的模型构建产品你的护城河就是别人的定价策略。OpenAI 涨价你亏损OpenAI 降价你的竞品也能做。唯一的长期策略是保留模型切换能力——不一定切但要能切。我的做法是在所有新项目里抽象一层 model adapter把 prompt 构建和模型调用分开。前期投入一周时间换来永久的替换自由。第二模型选择正在从技术决策变成基础设施决策。五年前我们在争论 AWS vs Azure现在我们在争论 GPT vs Claude vs MAI。但跟云不一样的是——云之间功能基本等价模型之间的能力差异可以非常大。这意味着「切换模型」比「切换云」风险更高。你应该至少在架构上假设模型会变。第三开源 本地优先是防止锁定的最佳防御没有之一。巧合的是在我写这篇文章的同一天Andrew Ng 刚开源了 OpenWorker——一个本地优先的桌面 AI 协作者支持 30 种不同模型包括 Ollama 的本地模型从架构上就设计成不受任何单一模型锁定。当模型数量多到一定阈值「模型无关架构」本身就是一个架构优势。回到最开头那个问题Copilot 变「怂」了好还是不好我现在的判断是短期内不会降级。MAI-Code-1-Flash 在代码场景够用Microsoft 也不会在体验没验证清楚的情况下强行推。但我会持续做一件事——每个月把同一个复杂 prompts 跑在不同编辑器里做对比。如果哪天我发现 Copilot 在一个之前能处理好的场景里突然变得平庸了我就会知道不是我的代码变复杂了是后端的某个模型被替换了而且这次替换可能越界了。毕竟在 AI 工具越来越黑盒的时代知道谁在背后替你做事可能比事情本身的结果更重要。