Microsoft: обзор провайдера нейросетей, модели и цены 2026

Экспертный обзор Microsoft: модели, характеристики, бенчмарки, цены. Доступ в России через STIVA.ai — без VPN.

Microsoft развивает собственные нейросети: от облачной платформы к семействам MAI и Phi

Microsoft долго воспринимали прежде всего как инфраструктурного партнёра ИИ-команд. Azure стал одним из главных каналов распространения больших языковых моделей. Интеграция с продуктами компании помогла превратить генеративный ИИ из экспериментального инструмента в функцию офисного пакета, поисковой системы и корпоративной разработки. К августу 2026 года роль Microsoft изменилась: компания развивает собственные большие модели MAI, компактное семейство Phi, мультимодальные решения, а также инструменты для генерации изображений и обработки речи.

Microsoft строит не одну универсальную модель, а многоуровневую линейку. Для сложных задач компания предлагает большие модели MAI. Для локального запуска и недорогих API-запросов подходят Phi-4 и её производные. Для изображений и аудио используются отдельные мультимодальные и голосовые системы. Модели доступны через Azure AI Foundry. В России решения Microsoft можно использовать через STIVA.ai — площадку с оплатой в рублях, картами «Мир» и СБП, без VPN.

Microsoft — публичная компания с тикером NASDAQ:MSFT и капитализацией свыше $3 трлн. Её штаб-квартира находится в Редмонде, штат Вашингтон. На рынке ИИ компания контролирует не только разработку моделей, но и облачную инфраструктуру Azure. Ей также принадлежат корпоративные каналы продаж, инструменты разработки, операционные системы и офисные приложения. Поэтому даже модель, которая уступает лидерам в отдельных тестах, может получить практическое преимущество благодаря интеграции и доступности.

История и развитие ИИ-направления Microsoft

Microsoft основана в 1975 году Биллом Гейтсом и Полом Алленом. Сначала компания выпускала программное обеспечение для персональных компьютеров. Позже она перешла к корпоративным продуктам, серверным системам и облачной платформе Azure. Именно облако стало основой нынешней ИИ-стратегии: для обучения и работы крупных моделей нужны вычислительные кластеры, сеть, хранилища и мониторинг. Microsoft уже поставляла эти решения корпоративным клиентам.

Azure AI развивалась как набор сервисов, а не просто как доступ к виртуальным машинам с GPU. В экосистеме появились инструменты для обучения, развёртывания, оценки и тонкой настройки моделей. Позже Microsoft запустила Azure AI Foundry, где можно работать с моделями компании и сторонних разработчиков. Для заказчика это единая среда: в ней хранятся модель и данные, настраиваются права доступа, ведётся журнал запросов и публикуется приложение.

Параллельно Microsoft развивала партнёрство с OpenAI и внедряла большие языковые модели в Azure и собственные продукты. Этот период показал ценность не только базовой модели, но и её интеграции в корпоративные системы. Однако зависимость от внешнего разработчика ограничивала контроль над стоимостью, планами развития и оптимизацией под отдельные сценарии. Поэтому Microsoft начала активнее инвестировать в собственные модели.

Первым заметным результатом стала линейка Phi. В отличие от гигантских моделей, которым нужны дорогие серверные кластеры, Phi создавалась как семейство small language models — компактных языковых моделей. Здесь речь не только о сокращении числа параметров. Microsoft уделяла внимание отбору данных, специализации обучения и оптимизации под задачи, где важны задержка, стоимость и возможность запуска на ограниченном оборудовании.

После Phi-3 и Phi-3.5 компания выпустила Phi-4 в 2024–2025 годах. Базовая версия получила 14 млрд параметров и контекстное окно на 128K токенов. Затем появились компактная Phi-4-mini, reasoning-модификации и мультимодальная версия. В 2026 году Microsoft расширила линейку моделями MAI-1.5 и MAI-Image-2.5 Pro. Это уже полноценный портфель для работы с текстом, изображениями, речью и корпоративными приложениями.

Линейка моделей Microsoft в 2026 году

Модель Тип и контекст Цена API, $ за 1 млн токенов Назначение
Phi-4 LLM, 14B, 128K Input $0.125 / Output $0.50 Компактная универсальная языковая модель
Phi-4-mini LLM, 128K Input $0.075 / Output $0.30 Недорогие и быстрые текстовые приложения
Phi-4-reasoning Reasoning LLM, 32K Input $0.125 / Output $0.50 Задачи с пошаговым анализом
Phi-4-reasoning-plus Reasoning LLM, 32K Input $0.125 / Output $0.50 Расширенное рассуждение
Phi-4-mini-reasoning Reasoning LLM, 128K Input $0.075 / Output $0.30 Компактное рассуждение с длинным контекстом
Phi-4-multimodal Текст + изображение, 128K Input $0.08 / Output $0.32 Анализ документов и визуальных данных
Phi-4-multimodal audio Мультимодальная, аудиовход, 128K Input $4.00 / Output $0.32 Работа с речью и аудиосценариями
MAI-1.5 Большая языковая модель Не подтверждена Флагманское текстовое направление Microsoft в 2026 году
MAI-Image-2.5 Pro Генерация изображений Не подтверждена Флагманская модель изображений

Phi-4 и компактные языковые модели

Phi-4 — основная модель семейства. Это dense Transformer с 14 млрд параметров и контекстом на 128K токенов. В dense-архитектуре при обработке каждого токена активируются все параметры. В разреженных mixture-of-experts-моделях работает только часть параметров. Dense-подход проще для развёртывания и даёт более предсказуемую задержку, но при большом размере может быть менее экономичным.

Контекст на 128K токенов позволяет анализировать крупные документы, длинные переписки, исходный код и корпоративные инструкции. Это не значит, что модель одинаково хорошо обрабатывает каждый токен в таком окне. Результат зависит от структуры запроса, положения нужной информации и особенностей обучения. Для компактной модели такой лимит всё же заметно расширяет область применения по сравнению с локальными моделями малого размера.

Цена Phi-4 составляет $0.125 за 1 млн входных токенов и $0.50 за 1 млн выходных. В пересчёте на тысячу токенов это $0.000125 за input и $0.0005 за output. Разница между входом и выходом типична для API: генерация требует больше вычислений, чем обработка переданного контекста. Поэтому модель особенно выгодна для сервисов, которые классифицируют большие массивы документов и возвращают короткие метки или JSON.

Phi-4-mini снижает стоимость до $0.075 за 1 млн входных и $0.30 за 1 млн выходных токенов, сохраняя контекст на 128K. Модель подходит для маршрутизации запросов, обработки тикетов, извлечения полей и RAG-систем. Её также можно использовать в локальных ассистентах. По сравнению с большими моделями OpenAI, Anthropic или Google мини-версия Microsoft выигрывает прежде всего по цене, требованиям к ресурсам и возможности встроить её в прикладной продукт.

Reasoning-линейка

Phi-4-reasoning и Phi-4-reasoning-plus рассчитаны на задачи, где важны последовательный анализ и проверка вывода. Это математические операции, разбор условий, планирование и работа с программным кодом. Их контекст ограничен 32K токенами, поэтому он заметно меньше, чем у базовой Phi-4. Microsoft выбрала такой компромисс между глубиной рассуждения и объёмом исходных данных.

Цена обеих моделей совпадает с Phi-4 — $0.125 за вход и $0.50 за выход на 1 млн токенов. Phi-4-mini-reasoning стоит дешевле: $0.075 за вход и $0.30 за выход. При этом она сохраняет окно на 128K токенов. Выбирать модель лучше по тестам на собственных задачах, а не только по названию «reasoning». Такой режим может повысить качество сложных ответов, но часто создаёт больше промежуточного текста и увеличивает задержку.

Мультимодальность: текст, изображения и аудио

Phi-4-multimodal принимает текст и изображения, а её контекст достигает 128K токенов. Она подходит для разбора скриншотов, таблиц, схем, фотографий документов и элементов интерфейса. Стоимость составляет $0.08 за 1 млн входных токенов и $0.32 за 1 млн выходных.

Аудиоверсия тарифицируется иначе: $4.00 за 1 млн входных единиц и $0.32 за 1 млн выходных токенов. Высокая цена входа связана с обработкой аудио. До генерации текста системе нужно проанализировать акустический сигнал, его временную структуру и речевые признаки. В голосовом интерфейсе также следует учитывать транскрибацию, повторные запросы и синтез речи.

В аудиостек Microsoft входят MAI-Transcribe 1.5 для speech-to-text, MAI-Voice-2 и ускоренная MAI-Voice-2-Flash для text-to-speech. Azure Neural TTS остаётся legacy-решением. Такая специализация позволяет независимо масштабировать распознавание, понимание и синтез, вместо того чтобы поручать все операции одной универсальной LLM.

MAI и генерация изображений

MAI-1.5 — большая языковая модель Microsoft, актуальная на 2026 год. В карточке провайдера пока не подтверждены её точный размер, контекстное окно и публичная цена API. Поэтому сравнивать MAI-1.5 с Phi-4 по стоимости или аппаратным требованиям преждевременно. Модель занимает верхний уровень линейки и ориентирована на сложные ответы, а не на минимальную цену инференса. Выпущенная ранее MAI-1 относится к legacy и уступает место MAI-1.5.

Флагманом в генерации изображений названа MAI-Image-2.5 Pro. В линейке также есть стандартная MAI-Image-2.5 и MAI Image 2.5 Pro Edit для редактирования изображений. Тарифы этих моделей пока не подтверждены. Редактирование особенно полезно для бизнеса: часто нужно не создать картинку с нуля, а заменить объект, изменить фон или адаптировать изображение под объявление.

Подтверждённой видеомодели в линейке Microsoft на дату обновления нет. Это отличает текущий портфель от компаний, которые развивают отдельные продукты для text-to-video. Microsoft сосредоточена на тексте, изображениях, речи и корпоративной интеграции.

Архитектура, открытые веса и техническая позиция

Phi-4 построена на dense Transformer. Это хорошо изученная архитектура с оптимизированными реализациями, поддержкой квантования и переносом на разные типы ускорителей. Для локального запуска важны не только 14 млрд параметров. Нужно учитывать формат весов, длину контекста, размер KV-кэша и доступную видеопамять. При контексте на 128K токенов именно KV-кэш может занимать много памяти, особенно при параллельной обработке запросов.

Phi-4 относится к open-weight-моделям: веса доступны через Hugging Face. Это не то же самое, что полностью свободный open-source-проект в строгом юридическом смысле. Нужно проверить лицензию, ограничения на использование и условия распространения конкретной версии. Наличие весов даёт разработчику больше контроля по сравнению с закрытым API. Модель можно запускать в собственной инфраструктуре, профилировать, квантовать и адаптировать под внутренние данные.

Microsoft также предлагает fine-tuning Phi-4. Стоимость обучения указана на уровне $3 за 1 млн training-токенов, хостинг — $0.80 в час. Эти расходы считаются отдельно от inference: низкая цена запросов не делает дообучение автоматически дешёвым. Для многих задач сначала стоит проверить prompt engineering и retrieval-augmented generation. К fine-tuning имеет смысл переходить, если нужно стабильно соблюдать формат ответа, использовать отраслевую терминологию или поддерживать особый стиль классификации.

Публичные карточки провайдера не содержат полного набора численных результатов бенчмарков для всех версий Phi-4 и MAI. Поэтому не стоит приписывать Microsoft конкретные баллы на MMLU, GSM8K, HumanEval или мультимодальных тестах без ссылки на официальный отчёт и его методику. При сравнении с OpenAI, Anthropic, Google и открытыми системами вроде Llama нужно учитывать benchmark score, длину контекста, стоимость, latency, поддержку инструментов, лицензию и возможность локального развёртывания.

С инженерной точки зрения Phi-4 хорошо подходит для многоуровневой системы. Большая MAI-модель может обрабатывать сложные запросы. Phi-4-mini — выполнять предварительную классификацию, извлекать данные и фильтровать обращения. Такой каскад снижает среднюю стоимость запроса и позволяет не отправлять простые вопросы на самый дорогой уровень.

Цены и доступность

Основные тарифы Microsoft публикуются в Azure AI Foundry. Для Phi-4 ориентир составляет $0.125 за 1 млн входных токенов и $0.50 за 1 млн выходных. Phi-4-mini дешевле — $0.075 и $0.30. Текстово-визуальная Phi-4-multimodal стоит $0.08 за вход и $0.32 за выход. Reasoning-версии тарифицируются на уровне базовой Phi-4.

В реальном проекте итоговая стоимость включает не только токены. Нужно учитывать хранение данных, поиск по базе знаний, сетевой трафик, логирование, фильтры безопасности, fine-tuning и постоянный хостинг. В локальных и гибридных сценариях расходы переходят на GPU-серверы и сопровождение. Открытые веса Phi-4 позволяют выбирать между этими вариантами. Закрытые MAI-сервисы сильнее привязаны к облачному API.

Официальный канал для корпоративного использования — Azure AI Foundry. Он подходит компаниям, которым нужны управление доступом, аудит, политика обработки данных и централизованное развёртывание в Azure. Для быстрого тестирования без самостоятельной настройки облачной инфраструктуры удобнее агрегатор с готовым интерфейсом и понятной оплатой.

Как использовать модели Microsoft в России через STIVA.ai

В России модели Microsoft доступны через STIVA.ai. Сервис работает без VPN и поддерживает российские способы оплаты — карту «Мир» и СБП. Тарифы начинаются от 495 ₽ в месяц. Для индивидуального разработчика такой формат упрощает подключение к зарубежным ИИ-сервисам.

Для недорогих массовых запросов можно выбрать Phi-4-mini. Более сложный анализ лучше направлять в Phi-4. Задачи с формализованным рассуждением подойдут для Phi-4-reasoning или Phi-4-reasoning-plus. Изображения можно передавать в Phi-4-multimodal. Голосовой конвейер можно строить вокруг MAI-Transcribe 1.5 и MAI-Voice-2. Такой подход помогает не переплачивать за большую универсальную модель там, где достаточно компактной.

STIVA.ai подойдёт для знакомства с моделями до разработки собственного Azure-пайплайна. Сначала можно проверить качество на русскоязычных документах, оценить стабильность формата и сравнить версии Phi. Затем проще решить, нужен ли прямой Azure AI Foundry, локальный запуск открытых весов или гибридная схема.

Пользователям, которые хотят рекомендовать сервис коллегам или клиентам, доступна партнёрская программа STIVA.ai. Она не меняет технические характеристики моделей, но может пригодиться интеграторам, консультантам и авторам образовательных материалов.

Итоги

В 2026 году Microsoft — уже не только поставщик инфраструктуры для чужих LLM. Компания собрала собственный портфель. Phi-4 закрывает нишу доступных и потенциально локальных моделей. Reasoning-версии рассчитаны на сложный анализ. Мультимодальные варианты работают с изображениями и аудио. MAI-1.5 и MAI-Image-2.5 Pro занимают верхний уровень линейки.

Главное преимущество Microsoft — сочетание моделей, Azure AI Foundry и корпоративной экосистемы. Слабое место — неполная публичная информация о MAI-1.5 и моделях для изображений. Пока недостаточно подтверждённых данных об их цене, контексте и результатах тестов. Поэтому Phi-4 выглядит самой понятной точкой входа: известны её размер, контекст, API-тарифы, доступность весов и условия fine-tuning.

Для российских пользователей практический маршрут проходит через STIVA.ai: доступ от 495 ₽ в месяц, оплата картами «Мир» и через СБП, без VPN. Microsoft стоит рассматривать не как одну нейросеть, а как набор моделей под разные нагрузки — от компактного локального ассистента до корпоративного мультимодального сервиса.

FAQ

Какая модель Microsoft лучше подходит для недорогих API-запросов?

Для массовой классификации, извлечения данных, коротких ответов и маршрутизации запросов хорошей отправной точкой будет Phi-4-mini. Она поддерживает контекст на 128K токенов и стоит $0.075 за 1 млн входных токенов и $0.30 за 1 млн выходных. Если модель плохо справляется со сложными инструкциями, следующим уровнем станет Phi-4.

Можно ли запускать Phi-4 без Azure?

Да, Phi-4 относится к open-weight-моделям и доступна через Hugging Face. Её можно развернуть в собственной инфраструктуре, использовать квантование и контролировать данные. Требования к видеопамяти, скорость работы и допустимая область применения зависят от конкретной версии и конфигурации.

Чем Phi-4-reasoning отличается от обычной Phi-4?

Reasoning-версии рассчитаны на задачи, где нужен последовательный анализ условий и сложное принятие решений. У Phi-4-reasoning и Phi-4-reasoning-plus контекст составляет 32K токенов. Цена — $0.125 за вход и $0.50 за выход на 1 млн токенов. Для компактных сценариев доступна Phi-4-mini-reasoning с контекстом 128K и тарифом $0.075/$0.30.

Где использовать модели Microsoft в России?

Модели Microsoft доступны через STIVA.ai. Сервис работает без VPN, принимает оплату картами «Мир» и через СБП. Тарифы начинаются от 495 ₽ в месяц. Для корпоративного развёртывания в Azure используется Azure AI Foundry, а STIVA.ai удобнее для быстрого тестирования и регулярной работы из России.

Сэм Альтман

Руководитель OpenAI. Пишу тут для души.

Оцените автора
LeDigital