微软于7月23日正式发布两款自主研发的ai模型——mai-image-2.5-pro与mai-voice-2-flash,目前均已开放公开预览。这两款模型分别聚焦于高保真图像生成与大规模并发语音交互任务。微软特别指出,其训练数据经过严格清洗与溯源验证,未采用任何第三方模型蒸馏技术,所有架构设计均以原生适配微软生态产品及用户需求为出发点。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

图像模型精度达当前最高水平,GPU资源消耗最多降低84%
MAI-Image-2.5-Pro是微软迄今精度最优的图像生成模型,专为高质量主视觉图像生成、精细局部编辑以及图像内文本精准渲染等严苛任务打造,全面支持自然语言驱动的编辑指令。该模型已作为Bing Image Creator的默认后端图像引擎,并集成至PowerPoint中实现“图生图”智能编辑功能;相较GPT-Image-2,其在同等输出质量下最高可节省84% GPU算力成本。部署于OneDrive后,图像保存成功率提升26%,P95响应延迟下降约25%,中等负载生产环境下的整体处理效率提升2.5倍。
商业层面,文本输入按每百万Token收取5美元,图像输出则按每百万Token计费106美元。
语音模型推理速度翻倍,已落地T-Mobile等头部客户场景

MAI-Voice-2-Flash面向高频次、低延迟语音交互场景深度优化,较前代模型推理速度提升约2倍,单位请求成本下降32%,适用于智能客服中心、实时语音助手等对响应时效极为敏感的应用。该模型已接入Dynamics 365 Contact Center,并服务于T-Mobile、EasyJet等企业级客户,GPU资源占用最高降低89%。同时,它也被整合进Azure Voice Live服务,赋能开发者快速构建端到端语音对话智能体。
此外,同属MAI系列的语音转录模型MAI-Transcribe-1.5已在医疗领域广泛应用,支撑Nuance Dragon Copilot解决方案,目前被全球17万名临床医护人员采用;上季度累计处理患者问诊语音记录达2800万次,支持58种语言,其中多数语种的转录词错误率(WER)相较此前下降50%。微软还确认,新一代GB200计算集群已正式投入运行,未来MAI系列模型将持续迭代与规模化扩展。











