微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

微软于7月23日发布两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,主打不依赖第三方模型蒸馏,已集成至Bing、PowerPoint和Dynamics 365等产品中。前者降低高达84%的GPU成本,后者速度提升约2倍,直接服务企业和开发者。

微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

一句话看懂:微软于7月23日发布两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,主打不依赖第三方模型蒸馏,已集成至Bing、PowerPoint和Dynamics 365等产品中。前者降低高达84%的GPU成本,后者速度提升约2倍,直接服务企业和开发者。

事件核心:发生了什么

微软宣布旗下MAI系列新增两款模型:MAI-Image-2.5-Pro定位高精度图像生成,支持自然语言编辑指令,已作为Bing Image Creator的默认模型,并为PowerPoint提供图生图编辑功能。其定价为文本输入每百万token 5美元,图像输出每百万token 106美元。相比GPT-Image-2,GPU成本最多降低84%;在OneDrive部署后,相关场景成功率提升26%,P95延迟下降约25%,中等负载生产效率提升2.5倍。

另一款MAI-Voice-2-Flash针对高并发语音交互优化,速度较上一代提升约2倍,成本降低32%,已接入Dynamics 365 Contact Center,服务T-Mobile、易捷航空等客户,GPU成本最大可降低89%。此外,同系列的MAI-Transcribe-1.5已应用于医疗语音方案Dragon Copilot,服务17万医护人员,上季度处理2800万条患者问诊记录,支持58种语言,转录错误率在多数语言上降低约50%。

为什么重要

微软明确强调MAI系列训练数据经过清洗且可追溯,不依赖第三方模型蒸馏,这标志着微软在底层AI能力上正走向自主可控。与许多厂商选择蒸馏OpenAI或Google模型不同,微软从零开始自研,直接服务自家产品矩阵,有助于形成更紧密的产品-模型闭环,同时在成本控制(GPU开支降低80%以上)和延迟优化上取得量化成果。这也间接说明,在图像和语音生成领域,自研模型在商业落地中的实用性和经济性正快速提升。

对用户/开发者/创作者的影响

对Bing和PowerPoint用户而言,图片生成与编辑将更高效、成本更低;对开发者,MAI-Voice-2-Flash的Azure Voice Live服务支持构建实时语音交互代理,且可显著降低高频调用成本;对医疗等行业客户,MAI-Transcribe-1.5的低错误率和多语言支持意味着更可靠的语音转录体验。目前公开信息显示,微软下一代GB200计算集群已投入使用,MAI系列将持续扩展,开发者和企业可在Azure平台直接调用这些模型。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 微软是否会开放MAI系列模型的外部API价格,与现有图像/语音模型形成竞争;2. 在微软产品矩阵(如Teams、Copilot)中,MAI模型是否会逐步替代第三方模型;3. 其他云厂商(如AWS、Google Cloud)是否会跟进自研独立模型路线,还是继续依赖蒸馏策略。

来源:AIbase

celebrityanime
celebrityanime
文章: 15031

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注