Microsoft представила две новые модели MAI и постепенно заменяет ими OpenAI в собственных сервисах

от автора

Microsoft AI анонсировала две новые модели: MAI‑Image-2.5-Pro для генерации изображений и MAI‑Voice-2-Flash для синтеза речи. Обе уже доступны разработчикам через Azure AI Foundry и песочницу MAI Playground. Релиз стал очередным шагом Microsoft по развитию собственной линейки ИИ‑моделей и снижению зависимости от сторонних решений.

MAI‑Image-2.5-Pro

По заявлению Microsoft, MAI‑Image-2.5-Pro стала самой качественной моделью компании для генерации изображений. Основной акцент сделан на высокой детализации, точной передаче текста внутри изображений и более естественном выполнении инструкций по редактированию. Модель поддерживает как генерацию изображений по текстовому описанию, так и image‑to‑image‑редактирование.

Стоимость использования:

  • $5 за миллион входных текстовых токенов;

  • $8 за миллион входных токенов изображений;

  • $106 за миллион выходных токенов изображений.

MAI‑Voice-2-Flash

Вторая новинка — MAI‑Voice-2-Flash, оптимизированная для сценариев, где критичны задержка и стоимость обработки.

Microsoft заявляет, что новая модель работает примерно в два раза быстрее, чем MAI‑Voice-2, а стоимость синтеза речи снизилась на 32% — до $15 за миллион символов. Она ориентирована на контакт‑центры, голосовых ассистентов и другие высоконагруженные корпоративные сервисы.

Импортозамещение внутри Microsoft

Наиболее интересной частью анонса стали не сами модели, а данные об их внедрении во внутренние продукты Microsoft.

  • Bing Image Creator полностью перешел на MAI‑Image-2.5;

  • в PowerPoint новая модель отвечает за генерацию и редактирование изображений, что позволило сократить вычислительные затраты до 84% по сравнению с использованием GPT‑Image-2;

  • в OneDrive доля изображений, которые пользователи сохраняют после генерации, выросла на 26%, а задержка ответа сократилась примерно на четверть;

  • MAI‑Voice-2-Flash используется в Dynamics 365 Contact Center, где вычислительные расходы удалось уменьшить до 89%;

  • модель MAI‑Transcribe-1.5 заменила предыдущую систему распознавания речи в Dragon Copilot. По данным Microsoft, для большинства из 58 поддерживаемых языков количество ошибок распознавания речи и определения языка сократилось примерно вдвое.

Последние несколько месяцев Microsoft последовательно расширяет семейство собственных моделей MAI. На конференции Build 2026 компания представила MAI‑Thinking-1, MAI‑Image-2.5, MAI‑Voice-2 и MAI‑Transcribe-1.5, заявив, что они обучены на собственных данных без дистилляции сторонних моделей.

Нынешний анонс показывает, что Microsoft переходит от экспериментов к масштабному внедрению собственных моделей в коммерческие продукты. При этом компания не отказывается от сотрудничества с OpenAI — модели GPT по‑прежнему доступны в Azure AI Foundry. Однако все больше внутренних сервисов Microsoft начинают использовать именно семейство MAI, особенно там, где критичны стоимость эксплуатации, скорость работы и контроль над всей технологической цепочкой.

ссылка на оригинал статьи https://habr.com/ru/articles/1063394/