微软进一步扩展自研 AI 模型矩阵,正式发布 MAI-Image-2.5-Pro 图像生成模型与 MAI-Voice-2-Flash 语音合成模型。两项模型已在 Bing Image Creator、PowerPoint、OneDrive、Dynamics 365 Contact Center 等产品中投入生产使用。

MAI-Image-2.5-Pro 图像模型
MAI-Image-2.5-Pro 是微软迄今为止最高保真度的图像生成模型,面向需要精细图像生成与编辑、主视觉素材及准确文字渲染的场景。该模型在 Arena 文本到图像排行榜中位列第三。
定价方面,MAI-Image-2.5-Pro 收费为 $5 每百万文本输入 token、$8 每百万图像输入 token、$106 每百万图像输出 token。用户现可在 MAI Playground 免费试用该模型。
MAI-Voice-2-Flash 语音模型
MAI-Voice-2-Flash 是面向低延迟、高并发语音应用场景(如客户服务代理)的文本到语音模型。微软表示,该模型速度是 MAI-Voice-2 的两倍,成本降低 32%,同时保留自然的语调和音质。定价为 $15 每百万字符。
该模型支持超过 15 种额外语言和新语音选项,目前已作为 Azure Voice Live 的一部分提供,开发者可借此构建低延迟语音代理。
生产环境部署成效
微软已在多项产品中全面采用自研模型。Bing Image Creator 现已完全由 MAI-Image-2.5 驱动,PowerPoint 也使用 MAI-Image-2.5 实现图像到图像功能。微软指出,切换至 MAI-Image-2 后,相比 OpenAI 的 GPT-Image-2,GPU 成本降低高达 84%。
OneDrive 中的图像编辑体验也由 MAI-Image-2.5 提供支持,保存率提升 26%,P95 延迟降低约 25%,中等负载下的效率提升 2.5 倍。
在语音领域,MAI-Voice-2-Flash 已支持 Dynamics 365 Contact Center,GPU 成本降低高达 89%。此外,MAI-Transcribe-1.5 现已为 Dragon Copilot 提供 58 种语言的多语言转录服务。
via Neowin