JOTO
联系我们
← AI 智库
多模态模型

微软发布自研MAI系列AI模型,GPU成本最高降89%

2026 年 7 月 23 日

微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研模型,已投入Bing、PowerPoint、Dynamics 365等产品生产环境。图像模型在文本渲染等关键能力上突破,语音模型专注高吞吐低延迟场景。内部数据显示GPU成本最高降低89%,Excel中轻量编码模型MAI-Code-1-Flash经强化学习训练后性能媲美GPT-5.6。纳德拉提出‘前沿扩散’战略,强调模型可替换性与套件解耦。

微软发布自研MAI系列AI模型,GPU成本最高降89%

微软AI于周三发布两款全新自研模型——MAI-Image-2.5-Pro,这是该公司迄今保真度最高的图像生成模型;以及MAI-Voice-2-Flash,一款专为高吞吐量企业级工作负载构建的语音模型。公告由微软AI超级智能团队发布,明确指出这些模型已投入生产,服务于必应(Bing)、PowerPoint、OneDrive、Dynamics 365、Excel、GitHub Copilot及Azure等产品。该公司在公告博客中写道:“每一项增强功能都朝着同一目标迈进:由微软模型驱动的微软产品。”

MAI-Image-2.5-Pro与MAI-Voice-2-Flash如何占据AI成本曲线的两端

这两款新发布模型占据了微软所称的质量-速度-成本曲线的两端。MAI-Image-2.5-Pro瞄准高端层级:主打标志性图像、精细编辑及图像内文本的精准渲染——最后一项长期以来一直是图像生成模型公认的薄弱环节。微软对该模型的定价为:每百万文本输入token 5美元、每百万图像输入token 8美元、每百万图像输出token 106美元。基础版MAI-Image-2.5模型近期在Arena图像编辑排行榜上位列第二。

创意产业似乎已开始关注。全球广告巨头WPP的全球首席创意官罗布·赖利(Rob Reilly)在微软公告所附声明中称该Pro模型为“生成式媒体(GenMedia)工具的重大飞跃”,并补充道:“微软已稳固确立其在生成式AI领域的领导者地位。”

MAI-Voice-2-Flash则走向另一方向。该模型首次在微软Build开发者大会上预览亮相,Flash的运行速度是MAI-Voice-2的两倍,成本降低32%,定价为每百万字符15美元。它专为虽不炫目却规模庞大的高吞吐量语音市场而设计——包括呼叫中心、语音代理及实时语音应用,此类场景中延迟与单次通话成本的重要性远超表达力的边际提升。这两款模型共同体现了一种构建模型家族而非单一旗舰模型的战略。

微软的生产指标显示,自研模型可将GPU成本最高降低89%

Bing图像生成器目前已完全端到端运行于MAI-Image-2.5之上,标志着这款面向消费者的图像工具首次实现完全自主化。在PowerPoint中,微软表示MAI-Image-2.5相比OpenAI的图像模型GPT-Image-2可将GPU成本最高降低84%。在OneDrive中,MAI-Image-2.5现已成为关键图像编辑场景的默认模型,该公司报告称保存率提升26%,P95延迟降低约25%,中等利用率生产工作负载下的效率提升2.5倍。

在语音方面,MAI-Voice-2-Flash目前驱动Dynamics 365联络中心——包括T-Mobile和易捷航空(EasyJet)在内的客户均使用该平台——微软声称其GPU成本最高可降低89%。该模型亦已集成至面向开发者的Azure Voice Live,用于构建语音转语音代理。

微软的Dragon Copilot平台由17万名医疗保健提供者使用,上季度处理了2800万次患者就诊事件,目前其覆盖58种语言的多语言工作流已运行在MAI-Transcribe-1.5之上。微软表示,内部评估显示,该模型在大多数语言上的转录错误率和语言识别错误率均实现了50%的相对降幅。

揭秘让小型模型在Excel中击败GPT-5.6的“爬山”策略

微软详细说明了其称之为“爬山机器”的集成飞轮系统,该系统由数据、模型以及环绕它们的产品‘套件’(harness)共同构成。

最清晰的案例是MAI-Code-1-Flash,这款轻量级编码模型于6月在GitHub Copilot中发布。微软称,该模型在VS Code中的代码接受率比GPT-5.4 Mini和Claude Haiku 4.5高出约10%,同时中位令牌用量减少10%。开发者留存率也呈现类似趋势:与GPT-5.4 Mini相比,用户在多日内回归的可能性高出6%;与Claude Haiku 4.5相比则高出11%。

微软取用MAI-Code-1-Flash检查点,并进一步在Excel强化学习环境中对其进行训练,教会该编码模型掌握电子表格知识工作的工具与工作流。根据生产环境用户的反馈,该模型在最常见的Excel任务上已达到与GPT-5.6相当的水平——同时体积足够小,可在英伟达较旧的H100甚至A100 GPU上运行,而无需依赖最新一代加速器。

萨提亚·纳德拉的‘前沿扩散’宣言重塑了与OpenAI的关系

微软首席执行官萨提亚·纳德拉在X平台发布题为《前沿扩散与控制》的长文,阐述该系列公告。纳德拉写道:“我们现在可将已饱和的前沿能力规模化交付,并以更低的成本通过针对高频使用产品优化的模型实现,同时继续使用前沿模型满足前沿需求。”他还补充道,微软“正开始在其第一方产品界面中,将流量路由至MAI,只要我们的模型匹配或优于前沿替代方案。”

纳德拉谨慎指出,“来自OpenAI和Anthropic的前沿模型是与MAI并存于编排系统中的组成部分”——但他同时也阐明了一项明确的模型独立性原则,主张企业的评估“应在任何特定模型被移除后仍持续进行爬山式优化。”他辩称,‘将套件(harness)、记忆、上下文及技能置于模型之外’,正是赋予微软掌控力的关键所在。

开发者为更廉价的任务专用模型欢呼,而怀疑者则质疑微软的执行记录

线上反响既体现了该战略的吸引力,也反映出对其的质疑。一位X用户@mavihsk在回应纳德拉的帖子时写道:“当人们为细分任务使用小型模型时,我总是很欣喜。为什么我仅仅为了在Excel中更改字段就必须动用那个无所不知的模型?”另一位用户@nabu_lines则简洁概括了该主张:“当你停止过度使用最大模型时,成本与性能都会提升。”

其他人则对微软的执行记录持更不宽容态度。设计师@designedbyabin写道:“微软在倾听用户反馈方面表现最差”,并认为该公司“将因屡次未能理解用户需求而在AI竞赛中落败。”还有一位用户@tokenoverflow对模型独立性主张提出了更为冷峻的批评:“我希望在移除微软之后,它仍能继续爬山。”

怀疑者提出的观点确有道理。微软自我报告的各项指标——接受率、保存率、GPU节省量——均源自其内部评估,而非独立基准测试,且该公司自行决定公布哪些对比结果。

为何微软正将其内部AI方法论转化为Azure产品

该战略的最后一环在于,微软出售的是方法论本身,而不仅是模型。纳德拉明确将‘爬山’方法定位为“面向所有其他AI原生、SaaS或企业公司的模板”,并正通过Foundry及所谓‘前沿调优’(Frontier Tuning)将该工具链打包推出——使企业客户能够基于自身专有评估标准及强化学习环境训练专用模型。

该公司强调模型须经‘清洁、可追溯、企业级数据训练,且未经第三方模型蒸馏’,同样服务于这一商业目标。微软表示,目前已将‘爬山’方法扩展至Copilot Chat、Outlook以及PowerPoint,两款新模型均已通过Microsoft Foundry以及MAI Playground。该公司写道:“这一切都不是终点,我们才刚刚开始。”

JOTO 企业落地观察

  • 企业部署任务专用模型时,需重新评估‘模型即服务’的采购逻辑:当核心能力可由轻量模型在旧GPU上达成时,基础设施锁定风险与算力升级压力显著降低,但对模型-工具链-评估闭环的工程能力要求反而提高。
  • 这类系统的取舍在于‘可控性’与‘前沿性’的再平衡:将套件、记忆与技能从模型中解耦,意味着企业可独立迭代各层组件,但也要求团队具备跨层调试与联合优化能力,而非仅依赖黑盒API调用。
  • RAG知识工程在此类架构中角色发生迁移——当模型本身被频繁替换或微调时,知识注入方式需从静态文档嵌入转向动态上下文装配与反馈驱动的知识蒸馏,否则知识层将成为模型演进的瓶颈。
  • AI安全治理面临新挑战:模型可替换性提升的同时,不同代际模型(如MAI-Voice-2-Flash与GPT-Image-2)在偏见、鲁棒性、合规边界上的差异可能加剧系统整体行为的不可预测性,需建立模型级SLA与失效回退机制。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。