Alibaba / Qwen: обзор провайдера нейросетей, модели и цены 2026

Экспертный обзор Alibaba / Qwen: модели, характеристики, бенчмарки, цены. Доступ в России через STIVA.ai — без VPN.

Alibaba / Qwen — не отдельный стартап, а исследовательская и продуктовая платформа Alibaba Cloud. За несколько лет она стала одним из заметных разработчиков больших языковых моделей в Азии. Бренд Qwen появился в 2023 году, но за ним стоят вычислительные ресурсы, облачная инфраструктура и дистрибуция Alibaba Group — публичной компании NYSE:BABA со штаб-квартирой в Ханчжоу.

Qwen конкурирует сразу на нескольких уровнях. Закрытые флагманские модели Max соперничают с коммерческими системами OpenAI, Anthropic и Google. Открытые версии Qwen конкурируют с DeepSeek, Llama и Mistral. Alibaba также развивает модели для программирования, распознавания речи, синтеза голоса, работы с изображениями и видео.

Qwen интересен сочетанием открытых весов, больших контекстных окон и низкой цены API. В линейке 2026 года появились модели с контекстом до 1 млн токенов, крупные MoE-системы с сотнями миллиардов параметров и продукты для генерации мультимедиа. Российские пользователи могут работать с моделями через страницу Qwen на STIVA.ai. VPN и самостоятельная настройка зарубежной оплаты не требуются.

История и эволюция Qwen

Alibaba Cloud запустила бренд Qwen в 2023 году. В карточке провайдера основателями указаны Alibaba Group, Дэниел Чжан и подразделение Alibaba Cloud. Это отражает специфику проекта: Qwen развивался внутри крупной технологической группы, а не как независимая компания с отдельным венчурным финансированием.

Первые поколения Qwen решали базовые языковые задачи: поддерживали диалог, создавали краткие пересказы, переводили тексты, извлекали данные и генерировали код. Alibaba открыла веса значительной части моделей. Помимо крупных версий, требовательных к инфраструктуре, компания выпускала компактные варианты для собственных серверов и рабочих станций.

Линейка Qwen 2.5, представленная в 2024–2025 годах, закрепила этот подход. Qwen 2.5 72B стала одной из заметных открытых моделей своего класса. Её использовали в исследовательских проектах, корпоративных системах поиска и локальных ассистентах. Одновременно вышла Qwen 2.5 7B с более умеренными требованиями к памяти. Для разработчиков предназначена Qwen 2.5 Coder 32B.

Следующий этап — Qwen 3. В этой серии Alibaba активнее использовала смесь экспертов, или Mixture of Experts. MoE-модель может иметь большой общий объём параметров, но при обработке конкретного токена активирует только часть сети. Это помогает приблизить качество большой модели к стоимости инференса более компактной системы. В линейке появились Qwen 3 235B A22B, Qwen 3 Next 80B, модели 32B, 30B, 14B и 8B. Отдельно развивается ветка Qwen 3 Coder.

В 2026 году развитие пошло по нескольким направлениям. Флагманские Qwen 3 Max и Qwen 3.5 397B получили reasoning-режимы и крупные контекстные окна. Qwen 3.5 Plus и Flash сделали миллионный контекст доступнее. В мае вышла Qwen 3.7 Max. К августу в предварительном доступе заявлена Qwen 3.8 Max — новейшая флагманская модель компании.

Alibaba также расширила мультимодальную часть платформы. Qwen 3 VL 235B работает с изображениями и текстом. Qwen Image предназначена для генерации и редактирования изображений. За видео отвечают Wan и Happy Horse. В аудионаправлении развиваются Qwen-Audio, Qwen3 ASR и CosyVoice.

Основные модели Qwen в 2026 году

Ниже приведены модели и цены, зафиксированные в источниках провайдера на 5 августа 2026 года. Стоимость указана за 1 млн токенов отдельно для входных и выходных данных. Для моделей со статусом preview финальные тарифы ещё не опубликованы либо доступ к ним ограничен.

Модель Назначение Контекст API: input / output Особенности
Qwen 3.8 Max LLM, reasoning 262K Не подтверждена, preview Новейший флагман
Qwen 3.7 Max LLM, reasoning 262K $1.25 / $3.75 MoE, флагманская модель
Qwen 3.7 Flash LLM 1M $0.03 / $0.13 Высокая скорость и низкая цена
Qwen 3 VL 235B Мультимодальная 262K Не подтверждена Анализ изображений и текста
Qwen 3 Coder 480B Программирование 262K Не подтверждена Кодовая MoE-модель
Qwen 3.5 397B A17B LLM, reasoning 128K $0.60 / $3.60 MoE-флагман, 17B активных параметров
Qwen 3.5 Plus Универсальная LLM 1M $0.40 / $2.40; свыше 256K — $0.50 / $3.00 Баланс стоимости и качества
Qwen 3.5 Flash LLM 1M $0.10 / $0.40 Высоконагруженные сценарии
Qwen 3 Max LLM, reasoning 262K $0.78 / $3.90; cache hit — $0.156 Reasoning-флагман
Qwen 2.5 72B Открытая LLM 32K–128K $0.23 / $0.23 на DeepInfra Широко используется локально и через API

Флагманские reasoning-модели

Qwen 3 Max, Qwen 3.5 397B, Qwen 3.7 Max и preview-версия Qwen 3.8 Max рассчитаны на задачи, где простого продолжения текста недостаточно. Они подходят для многошагового рассуждения, анализа кода, работы с таблицами и математическими задачами. Модели также справляются с длинными документами и сложными инструкциями.

Qwen 3.7 Max построена по MoE-принципу и работает с контекстом 262 тысячи токенов. Тариф составляет $1.25 за миллион входных токенов и $3.75 за миллион выходных. У Qwen 3 Max вход дешевле — $0.78, но генерация стоит $3.90. Для повторяющихся промптов предусмотрена цена cache hit $0.156. Это снижает расходы приложений с длинными системными инструкциями и постоянной базой знаний.

Qwen 3.5 397B A17B интересна с инженерной точки зрения. В названии указаны 397 млрд общих параметров и около 17 млрд активных параметров на шаг. Контекст у модели меньше, чем у версий Plus и Flash, — 128K. При этом цена входа составляет $0.60 за миллион токенов. Модель подходит для задач, где качество рассуждения важнее работы с очень длинным документом.

Qwen 3.8 Max на момент подготовки обзора находится в preview. Поэтому сравнивать её по цене и стабильности результатов с уже доступными моделями преждевременно. Появление последовательных версий 3.7 и 3.8 говорит об ускорении цикла обновления закрытой флагманской линейки Alibaba.

Недорогие и длинноконтекстные модели

Qwen 3.7 Flash — одно из самых дешёвых предложений в верхнем сегменте API: $0.03 за миллион входных и $0.13 за миллион выходных токенов при контексте 1 млн токенов. Модель подходит для классификации, извлечения полей и массовой обработки переписки. Её также можно использовать в RAG-поиске и для подготовки черновиков. В задачах с глубокой проверкой рассуждений она не обязательно заменит флагман, но низкая цена позволяет обрабатывать большие объёмы данных.

Qwen 3.5 Plus занимает промежуточное положение. При контексте 1 млн токенов она стоит $0.40 / $2.40. Для запросов длиннее 256 тысяч токенов тариф повышается до $0.50 / $3.00. Qwen 3.5 Flash ещё дешевле — $0.10 / $0.40. Несколько моделей с миллионным окном позволяют выбирать решение под нагрузку: Flash подходит для потока однотипных запросов, Plus — для более сложных документов.

Код и мультимодальность

Qwen 3 Coder 480B — специализированная MoE-модель для программирования с 480 млрд параметров и контекстом 262K. В линейке также есть Qwen 3 Coder Plus, Coder Flash и Coder 30B. Они подходят для разных задач: автодополнения, рефакторинга, анализа крупного репозитория и генерации патчей.

Для работы с изображениями предназначены Qwen 3 VL 235B и семейство Qwen Image. VL-модель объединяет визуальное и языковое понимание. Она может анализировать скриншоты, документы, схемы и фотографии в рамках диалога. Qwen Image 3 Pro — флагман генерации изображений. Qwen Image 3 — стандартная версия, а Qwen Image Edit — модель для редактирования. Базовая Qwen Image остаётся более простым вариантом.

Видеонаправление включает HappyHorse 1.1 и HappyHorse 1.0, созданные на базе разработки Wan. В экосистеме также есть серии Wan 2.7, 2.6 и 2.5, модели Wan 2.2 A14B и 5B, Wan VACE 14B для видеомонтажа и Wan Effects для эффектов. Это отличает Alibaba от компаний, которые сосредоточены почти только на текстовом API.

Аудиомодели включают Qwen-Audio-3.0-TTS Plus и TTS Flash для синтеза речи, Qwen3 ASR Flash для speech-to-text и CosyVoice 2 для голосового синтеза. Qwen можно использовать как основу голосового интерфейса: сначала распознавать речь, затем передавать текстовую задачу языковой модели и озвучивать ответ.

Архитектура и технические особенности

Главная архитектурная ставка Qwen — сочетание MoE и dense-моделей. Крупные Qwen 3.7 Max, Qwen 3.5 397B, Qwen 3 235B и Qwen 3 Coder 480B используют смесь экспертов. В dense-моделях все параметры участвуют в обработке каждого токена. В MoE маршрутизатор выбирает подходящие экспертные блоки. Поэтому система может иметь сотни миллиардов параметров, сохраняя вычислительную нагрузку ближе к модели с несколькими десятками миллиардов активных параметров.

У такого подхода есть компромиссы. MoE требует распределённой инфраструктуры и быстрого обмена данными между ускорителями. Необходима также точная балансировка экспертов. При неудачной маршрутизации часть из них может перегружаться, а задержка — становиться менее предсказуемой. Для пользователя API это отражается на стоимости, скорости ответа и стабильности latency под высокой нагрузкой.

Небольшие Qwen 3 32B, 30B, 14B и 8B удобнее для самостоятельного развёртывания. В эту же категорию входят Qwen 2.5 72B и Qwen 2.5 7B. Qwen 2.5 72B особенно полезна там, где нужно сохранить контроль над данными и не зависеть от внешнего API. Для кода доступна Qwen 2.5 Coder 32B.

Контекстное окно стало одним из главных преимуществ нового ряда. Для Qwen 3.7 Flash, Qwen 3.5 Plus и Qwen 3.5 Flash заявлен контекст до 1 млн токенов. Это не означает, что модель одинаково хорошо использует каждый токен на любой длине. Качество поиска информации в середине большого документа, скорость обработки и цена зависят от конкретной реализации. Однако миллионный лимит позволяет анализировать репозитории, архивы переписки, большие договоры и коллекции внутренних документов без сильного дробления.

У Max-моделей контекст составляет 262K токенов, у Qwen 3.5 397B — 128K. Этого достаточно для большинства корпоративных RAG-систем, анализа кода и подготовки аналитических отчётов.

Что с бенчмарками

В данных, предоставленных на август 2026 года, нет подтверждённых числовых результатов Qwen 3.7 Max, Qwen 3.8 Max и других новейших моделей на конкретных тестах. Поэтому им не стоит приписывать условные баллы MMLU, GPQA, AIME, SWE-bench или MMMU. Для preview-модели Qwen 3.8 Max это особенно важно: ранние демонстрации не заменяют воспроизводимый независимый замер.

Сравнение Qwen с GPT, Claude, Gemini, DeepSeek, Llama и Mistral должно включать набор прикладных тестов, а не один рейтинг. Для reasoning-моделей подойдут математические задачи и тесты на исправление собственных ошибок. Для Coder — SWE-bench-подобные задания и проверка работы с многофайловым контекстом. Для VL — MMMU, OCR, таблицы и схемы. В бизнесе также имеют значение цена, скорость первого токена, процент ошибок, стабильность JSON-вывода и качество работы на русском языке.

По опубликованным характеристикам Qwen особенно хорошо подходит для трёх сценариев. Первый — дешёвая массовая обработка через Flash-модели. Второй — работа с длинным контекстом: Qwen 3.5 Plus и Qwen 3.7 Flash поддерживают до миллиона токенов. Третий — локальное развёртывание открытых моделей, недоступное для закрытых Max-систем без доступа к их весам. Качество reasoning нужно проверять на собственном наборе задач.

Цены и доступность

Цены Qwen выгодно отличаются от стоимости многих закрытых API, особенно для входных токенов. Самый заметный пример — Qwen 3.7 Flash: $0.03 за миллион токенов на входе и $0.13 на выходе. Qwen 3.5 Flash стоит $0.10 / $0.40, а Qwen 3.5 Plus — $0.40 / $2.40 с повышением тарифа для запросов длиннее 256K.

Флагманские системы дороже, но остаются конкурентоспособными. Qwen 3 Max тарифицируется по $0.78 / $3.90, Qwen 3.7 Max — по $1.25 / $3.75, Qwen 3.5 397B — по $0.60 / $3.60. Входные и выходные токены стоят по-разному. Длинные ответы с reasoning могут обойтись заметно дороже простого анализа документов. Поэтому в продакшене стоит ограничивать длину вывода, использовать кэширование и направлять простые запросы в Flash.

У Qwen 3 Max кэшированный ввод стоит $0.156 за миллион токенов. Это полезно для агентских систем, где каждый запрос содержит одну и ту же инструкцию, описание инструментов или корпоративную политику. В расчёт расходов нужно включать входные и выходные токены, кэшированные префиксы, мультимодальные данные и инфраструктуру.

Для Qwen 2.5 72B в карточке указана цена DeepInfra $0.23 / $0.23. Qwen 2.5 7B стоит $0.03 / $0.03, а Qwen 2.5 Coder 32B — $0.20 / $0.20. Это ориентиры конкретного провайдера, а не единый прайс для всех площадок. Тарифы Alibaba Cloud Model Studio, агрегаторов и локального инференса могут отличаться.

Официальный пользовательский интерфейс Qwen доступен на chat.qwen.ai. Сведения о моделях и API публикуются в документации Alibaba Cloud и на платформе Qwen. Разработчикам следует проверить совместимость API, лимиты запросов, регион хранения данных, поддержку потоковой генерации и доступность нужной модели.

Доступ к Qwen в России через STIVA.ai

Российскому пользователю может быть неудобно регистрироваться в зарубежном облаке и оплачивать API международной картой. STIVA.ai собирает доступ к моделям Qwen в одном интерфейсе. Для повседневной работы VPN не нужен.

Через раздел Qwen на STIVA.ai можно генерировать и редактировать тексты, анализировать документы и писать код. Набор доступных моделей зависит от текущей конфигурации сервиса и обновлений поставщика. Перед началом проекта стоит проверить карточку нужной модели.

Тарифы STIVA начинаются от 495 ₽ в месяц. Оплата доступна картами «МИР» и через СБП. Это не прямой биллинг Alibaba Cloud: пользователь оплачивает подписку STIVA, а не счёт Alibaba в долларах. Для команды такой формат удобен, если нужен единый российский платёж и доступ к нескольким ИИ-провайдерам.

Для коммерческой интеграции нужно уточнить лимиты, правила хранения запросов, доступность API и права на использование результатов. В тестовом режиме можно начать с Qwen 3.5 Flash или Qwen 3.7 Flash, а затем сравнить их на собственных данных с Qwen 3.5 Plus или Max. Открытые Qwen 2.5 и Qwen 3 подойдут для проектов, где важны автономность и закрытый контур.

Итог

Qwen сочетает закрытую флагманскую линейку, открытые веса и мультимодальные модели. Alibaba использует MoE для масштабирования крупных систем, предлагает контекст до 1 млн токенов и сохраняет низкие цены для массовых сценариев.

Оценку осложняет нехватка независимых и сопоставимых бенчмарков для новейших моделей 2026 года. Qwen 3.8 Max пока находится в preview. Заявленные характеристики не гарантируют превосходства над GPT, Claude, Gemini или DeepSeek в конкретной задаче. Поэтому выбор стоит делать по собственному тестовому набору, полной стоимости запросов и требованиям к размещению данных.

Для быстрого старта в России можно воспользоваться Qwen через STIVA.ai. Если нужна автономность, стоит изучить открытые Qwen 2.5 и Qwen 3. Для длинных документов и высокой пропускной способности подойдут Qwen 3.5 Flash, Qwen 3.5 Plus или Qwen 3.7 Flash. Для сложного reasoning и программирования лучше отдельно протестировать Max, 397B и Coder-линейку.

FAQ

Qwen — это отдельная компания или проект Alibaba?

Qwen — бренд и семейство моделей Alibaba Cloud, запущенное в 2023 году. Юридически и финансово это часть Alibaba Group, публичной компании NYSE:BABA, а не независимый стартап с отдельной оценкой. Направление работает из Ханчжоу, Китай.

Какая модель Qwen подходит для дешёвого API?

Среди моделей с опубликованными тарифами наиболее экономична Qwen 3.7 Flash — $0.03 за миллион входных и $0.13 за миллион выходных токенов. Для более сложных задач можно выбрать Qwen 3.5 Flash за $0.10 / $0.40 или Qwen 3.5 Plus за $0.40 / $2.40.

Можно ли запускать Qwen локально?

Да. К открытым относятся Qwen 2.5, Qwen 3 235B, Qwen 3 Next 80B и ряд компактных моделей. Закрытые Max-версии не стоит считать локальными: их веса и условия развёртывания не заявлены как открытые. Требования к видеопамяти зависят от размера модели, квантизации и движка инференса.

Как получить доступ к Qwen из России?

Для прямого использования можно изучить официальные сервисы Alibaba Cloud и интерфейс chat.qwen.ai. Более простой вариант — страница Qwen на STIVA.ai: тарифы начинаются от 495 ₽ в месяц, доступны карты «МИР» и СБП, VPN не нужен. Для партнёров и агентств у STIVA также действует партнёрская программа.

Сэм Альтман

Руководитель OpenAI. Пишу тут для души.

Оцените автора
LeDigital