- История и эволюция Qwen
- Основные модели Qwen в 2026 году
- Флагманские reasoning-модели
- Недорогие и длинноконтекстные модели
- Код и мультимодальность
- Архитектура и технические особенности
- Что с бенчмарками
- Цены и доступность
- Доступ к Qwen в России через STIVA.ai
- Итог
- FAQ
- Qwen — это отдельная компания или проект Alibaba?
- Какая модель Qwen подходит для дешёвого API?
- Можно ли запускать Qwen локально?
- Как получить доступ к Qwen из России?
Alibaba / Qwen — не отдельный стартап, а исследовательская и продуктовая платформа Alibaba Cloud. За несколько лет она стала одним из заметных разработчиков больших языковых моделей в Азии. Бренд Qwen появился в 2023 году, но за ним стоят вычислительные ресурсы, облачная инфраструктура и дистрибуция Alibaba Group — публичной компании NYSE:BABA со штаб-квартирой в Ханчжоу.
Qwen конкурирует сразу на нескольких уровнях. Закрытые флагманские модели Max соперничают с коммерческими системами OpenAI, Anthropic и Google. Открытые версии Qwen конкурируют с DeepSeek, Llama и Mistral. Alibaba также развивает модели для программирования, распознавания речи, синтеза голоса, работы с изображениями и видео.
Qwen интересен сочетанием открытых весов, больших контекстных окон и низкой цены API. В линейке 2026 года появились модели с контекстом до 1 млн токенов, крупные MoE-системы с сотнями миллиардов параметров и продукты для генерации мультимедиа. Российские пользователи могут работать с моделями через страницу Qwen на STIVA.ai. VPN и самостоятельная настройка зарубежной оплаты не требуются.
История и эволюция Qwen
Alibaba Cloud запустила бренд Qwen в 2023 году. В карточке провайдера основателями указаны Alibaba Group, Дэниел Чжан и подразделение Alibaba Cloud. Это отражает специфику проекта: Qwen развивался внутри крупной технологической группы, а не как независимая компания с отдельным венчурным финансированием.
Первые поколения Qwen решали базовые языковые задачи: поддерживали диалог, создавали краткие пересказы, переводили тексты, извлекали данные и генерировали код. Alibaba открыла веса значительной части моделей. Помимо крупных версий, требовательных к инфраструктуре, компания выпускала компактные варианты для собственных серверов и рабочих станций.
Линейка Qwen 2.5, представленная в 2024–2025 годах, закрепила этот подход. Qwen 2.5 72B стала одной из заметных открытых моделей своего класса. Её использовали в исследовательских проектах, корпоративных системах поиска и локальных ассистентах. Одновременно вышла Qwen 2.5 7B с более умеренными требованиями к памяти. Для разработчиков предназначена Qwen 2.5 Coder 32B.
Следующий этап — Qwen 3. В этой серии Alibaba активнее использовала смесь экспертов, или Mixture of Experts. MoE-модель может иметь большой общий объём параметров, но при обработке конкретного токена активирует только часть сети. Это помогает приблизить качество большой модели к стоимости инференса более компактной системы. В линейке появились Qwen 3 235B A22B, Qwen 3 Next 80B, модели 32B, 30B, 14B и 8B. Отдельно развивается ветка Qwen 3 Coder.
В 2026 году развитие пошло по нескольким направлениям. Флагманские Qwen 3 Max и Qwen 3.5 397B получили reasoning-режимы и крупные контекстные окна. Qwen 3.5 Plus и Flash сделали миллионный контекст доступнее. В мае вышла Qwen 3.7 Max. К августу в предварительном доступе заявлена Qwen 3.8 Max — новейшая флагманская модель компании.
Alibaba также расширила мультимодальную часть платформы. Qwen 3 VL 235B работает с изображениями и текстом. Qwen Image предназначена для генерации и редактирования изображений. За видео отвечают Wan и Happy Horse. В аудионаправлении развиваются Qwen-Audio, Qwen3 ASR и CosyVoice.
Основные модели Qwen в 2026 году
Ниже приведены модели и цены, зафиксированные в источниках провайдера на 5 августа 2026 года. Стоимость указана за 1 млн токенов отдельно для входных и выходных данных. Для моделей со статусом preview финальные тарифы ещё не опубликованы либо доступ к ним ограничен.
| Модель | Назначение | Контекст | API: input / output | Особенности |
|---|---|---|---|---|
| Qwen 3.8 Max | LLM, reasoning | 262K | Не подтверждена, preview | Новейший флагман |
| Qwen 3.7 Max | LLM, reasoning | 262K | $1.25 / $3.75 | MoE, флагманская модель |
| Qwen 3.7 Flash | LLM | 1M | $0.03 / $0.13 | Высокая скорость и низкая цена |
| Qwen 3 VL 235B | Мультимодальная | 262K | Не подтверждена | Анализ изображений и текста |
| Qwen 3 Coder 480B | Программирование | 262K | Не подтверждена | Кодовая MoE-модель |
| Qwen 3.5 397B A17B | LLM, reasoning | 128K | $0.60 / $3.60 | MoE-флагман, 17B активных параметров |
| Qwen 3.5 Plus | Универсальная LLM | 1M | $0.40 / $2.40; свыше 256K — $0.50 / $3.00 | Баланс стоимости и качества |
| Qwen 3.5 Flash | LLM | 1M | $0.10 / $0.40 | Высоконагруженные сценарии |
| Qwen 3 Max | LLM, reasoning | 262K | $0.78 / $3.90; cache hit — $0.156 | Reasoning-флагман |
| Qwen 2.5 72B | Открытая LLM | 32K–128K | $0.23 / $0.23 на DeepInfra | Широко используется локально и через API |
Флагманские reasoning-модели
Qwen 3 Max, Qwen 3.5 397B, Qwen 3.7 Max и preview-версия Qwen 3.8 Max рассчитаны на задачи, где простого продолжения текста недостаточно. Они подходят для многошагового рассуждения, анализа кода, работы с таблицами и математическими задачами. Модели также справляются с длинными документами и сложными инструкциями.
Qwen 3.7 Max построена по MoE-принципу и работает с контекстом 262 тысячи токенов. Тариф составляет $1.25 за миллион входных токенов и $3.75 за миллион выходных. У Qwen 3 Max вход дешевле — $0.78, но генерация стоит $3.90. Для повторяющихся промптов предусмотрена цена cache hit $0.156. Это снижает расходы приложений с длинными системными инструкциями и постоянной базой знаний.
Qwen 3.5 397B A17B интересна с инженерной точки зрения. В названии указаны 397 млрд общих параметров и около 17 млрд активных параметров на шаг. Контекст у модели меньше, чем у версий Plus и Flash, — 128K. При этом цена входа составляет $0.60 за миллион токенов. Модель подходит для задач, где качество рассуждения важнее работы с очень длинным документом.
Qwen 3.8 Max на момент подготовки обзора находится в preview. Поэтому сравнивать её по цене и стабильности результатов с уже доступными моделями преждевременно. Появление последовательных версий 3.7 и 3.8 говорит об ускорении цикла обновления закрытой флагманской линейки Alibaba.
Недорогие и длинноконтекстные модели
Qwen 3.7 Flash — одно из самых дешёвых предложений в верхнем сегменте API: $0.03 за миллион входных и $0.13 за миллион выходных токенов при контексте 1 млн токенов. Модель подходит для классификации, извлечения полей и массовой обработки переписки. Её также можно использовать в RAG-поиске и для подготовки черновиков. В задачах с глубокой проверкой рассуждений она не обязательно заменит флагман, но низкая цена позволяет обрабатывать большие объёмы данных.
Qwen 3.5 Plus занимает промежуточное положение. При контексте 1 млн токенов она стоит $0.40 / $2.40. Для запросов длиннее 256 тысяч токенов тариф повышается до $0.50 / $3.00. Qwen 3.5 Flash ещё дешевле — $0.10 / $0.40. Несколько моделей с миллионным окном позволяют выбирать решение под нагрузку: Flash подходит для потока однотипных запросов, Plus — для более сложных документов.
Код и мультимодальность
Qwen 3 Coder 480B — специализированная MoE-модель для программирования с 480 млрд параметров и контекстом 262K. В линейке также есть Qwen 3 Coder Plus, Coder Flash и Coder 30B. Они подходят для разных задач: автодополнения, рефакторинга, анализа крупного репозитория и генерации патчей.
Для работы с изображениями предназначены Qwen 3 VL 235B и семейство Qwen Image. VL-модель объединяет визуальное и языковое понимание. Она может анализировать скриншоты, документы, схемы и фотографии в рамках диалога. Qwen Image 3 Pro — флагман генерации изображений. Qwen Image 3 — стандартная версия, а Qwen Image Edit — модель для редактирования. Базовая Qwen Image остаётся более простым вариантом.
Видеонаправление включает HappyHorse 1.1 и HappyHorse 1.0, созданные на базе разработки Wan. В экосистеме также есть серии Wan 2.7, 2.6 и 2.5, модели Wan 2.2 A14B и 5B, Wan VACE 14B для видеомонтажа и Wan Effects для эффектов. Это отличает Alibaba от компаний, которые сосредоточены почти только на текстовом API.
Аудиомодели включают Qwen-Audio-3.0-TTS Plus и TTS Flash для синтеза речи, Qwen3 ASR Flash для speech-to-text и CosyVoice 2 для голосового синтеза. Qwen можно использовать как основу голосового интерфейса: сначала распознавать речь, затем передавать текстовую задачу языковой модели и озвучивать ответ.
Архитектура и технические особенности
Главная архитектурная ставка Qwen — сочетание MoE и dense-моделей. Крупные Qwen 3.7 Max, Qwen 3.5 397B, Qwen 3 235B и Qwen 3 Coder 480B используют смесь экспертов. В dense-моделях все параметры участвуют в обработке каждого токена. В MoE маршрутизатор выбирает подходящие экспертные блоки. Поэтому система может иметь сотни миллиардов параметров, сохраняя вычислительную нагрузку ближе к модели с несколькими десятками миллиардов активных параметров.
У такого подхода есть компромиссы. MoE требует распределённой инфраструктуры и быстрого обмена данными между ускорителями. Необходима также точная балансировка экспертов. При неудачной маршрутизации часть из них может перегружаться, а задержка — становиться менее предсказуемой. Для пользователя API это отражается на стоимости, скорости ответа и стабильности latency под высокой нагрузкой.
Небольшие Qwen 3 32B, 30B, 14B и 8B удобнее для самостоятельного развёртывания. В эту же категорию входят Qwen 2.5 72B и Qwen 2.5 7B. Qwen 2.5 72B особенно полезна там, где нужно сохранить контроль над данными и не зависеть от внешнего API. Для кода доступна Qwen 2.5 Coder 32B.
Контекстное окно стало одним из главных преимуществ нового ряда. Для Qwen 3.7 Flash, Qwen 3.5 Plus и Qwen 3.5 Flash заявлен контекст до 1 млн токенов. Это не означает, что модель одинаково хорошо использует каждый токен на любой длине. Качество поиска информации в середине большого документа, скорость обработки и цена зависят от конкретной реализации. Однако миллионный лимит позволяет анализировать репозитории, архивы переписки, большие договоры и коллекции внутренних документов без сильного дробления.
У Max-моделей контекст составляет 262K токенов, у Qwen 3.5 397B — 128K. Этого достаточно для большинства корпоративных RAG-систем, анализа кода и подготовки аналитических отчётов.
Что с бенчмарками
В данных, предоставленных на август 2026 года, нет подтверждённых числовых результатов Qwen 3.7 Max, Qwen 3.8 Max и других новейших моделей на конкретных тестах. Поэтому им не стоит приписывать условные баллы MMLU, GPQA, AIME, SWE-bench или MMMU. Для preview-модели Qwen 3.8 Max это особенно важно: ранние демонстрации не заменяют воспроизводимый независимый замер.
Сравнение Qwen с GPT, Claude, Gemini, DeepSeek, Llama и Mistral должно включать набор прикладных тестов, а не один рейтинг. Для reasoning-моделей подойдут математические задачи и тесты на исправление собственных ошибок. Для Coder — SWE-bench-подобные задания и проверка работы с многофайловым контекстом. Для VL — MMMU, OCR, таблицы и схемы. В бизнесе также имеют значение цена, скорость первого токена, процент ошибок, стабильность JSON-вывода и качество работы на русском языке.
По опубликованным характеристикам Qwen особенно хорошо подходит для трёх сценариев. Первый — дешёвая массовая обработка через Flash-модели. Второй — работа с длинным контекстом: Qwen 3.5 Plus и Qwen 3.7 Flash поддерживают до миллиона токенов. Третий — локальное развёртывание открытых моделей, недоступное для закрытых Max-систем без доступа к их весам. Качество reasoning нужно проверять на собственном наборе задач.
Цены и доступность
Цены Qwen выгодно отличаются от стоимости многих закрытых API, особенно для входных токенов. Самый заметный пример — Qwen 3.7 Flash: $0.03 за миллион токенов на входе и $0.13 на выходе. Qwen 3.5 Flash стоит $0.10 / $0.40, а Qwen 3.5 Plus — $0.40 / $2.40 с повышением тарифа для запросов длиннее 256K.
Флагманские системы дороже, но остаются конкурентоспособными. Qwen 3 Max тарифицируется по $0.78 / $3.90, Qwen 3.7 Max — по $1.25 / $3.75, Qwen 3.5 397B — по $0.60 / $3.60. Входные и выходные токены стоят по-разному. Длинные ответы с reasoning могут обойтись заметно дороже простого анализа документов. Поэтому в продакшене стоит ограничивать длину вывода, использовать кэширование и направлять простые запросы в Flash.
У Qwen 3 Max кэшированный ввод стоит $0.156 за миллион токенов. Это полезно для агентских систем, где каждый запрос содержит одну и ту же инструкцию, описание инструментов или корпоративную политику. В расчёт расходов нужно включать входные и выходные токены, кэшированные префиксы, мультимодальные данные и инфраструктуру.
Для Qwen 2.5 72B в карточке указана цена DeepInfra $0.23 / $0.23. Qwen 2.5 7B стоит $0.03 / $0.03, а Qwen 2.5 Coder 32B — $0.20 / $0.20. Это ориентиры конкретного провайдера, а не единый прайс для всех площадок. Тарифы Alibaba Cloud Model Studio, агрегаторов и локального инференса могут отличаться.
Официальный пользовательский интерфейс Qwen доступен на chat.qwen.ai. Сведения о моделях и API публикуются в документации Alibaba Cloud и на платформе Qwen. Разработчикам следует проверить совместимость API, лимиты запросов, регион хранения данных, поддержку потоковой генерации и доступность нужной модели.
Доступ к Qwen в России через STIVA.ai
Российскому пользователю может быть неудобно регистрироваться в зарубежном облаке и оплачивать API международной картой. STIVA.ai собирает доступ к моделям Qwen в одном интерфейсе. Для повседневной работы VPN не нужен.
Через раздел Qwen на STIVA.ai можно генерировать и редактировать тексты, анализировать документы и писать код. Набор доступных моделей зависит от текущей конфигурации сервиса и обновлений поставщика. Перед началом проекта стоит проверить карточку нужной модели.
Тарифы STIVA начинаются от 495 ₽ в месяц. Оплата доступна картами «МИР» и через СБП. Это не прямой биллинг Alibaba Cloud: пользователь оплачивает подписку STIVA, а не счёт Alibaba в долларах. Для команды такой формат удобен, если нужен единый российский платёж и доступ к нескольким ИИ-провайдерам.
Для коммерческой интеграции нужно уточнить лимиты, правила хранения запросов, доступность API и права на использование результатов. В тестовом режиме можно начать с Qwen 3.5 Flash или Qwen 3.7 Flash, а затем сравнить их на собственных данных с Qwen 3.5 Plus или Max. Открытые Qwen 2.5 и Qwen 3 подойдут для проектов, где важны автономность и закрытый контур.
Итог
Qwen сочетает закрытую флагманскую линейку, открытые веса и мультимодальные модели. Alibaba использует MoE для масштабирования крупных систем, предлагает контекст до 1 млн токенов и сохраняет низкие цены для массовых сценариев.
Оценку осложняет нехватка независимых и сопоставимых бенчмарков для новейших моделей 2026 года. Qwen 3.8 Max пока находится в preview. Заявленные характеристики не гарантируют превосходства над GPT, Claude, Gemini или DeepSeek в конкретной задаче. Поэтому выбор стоит делать по собственному тестовому набору, полной стоимости запросов и требованиям к размещению данных.
Для быстрого старта в России можно воспользоваться Qwen через STIVA.ai. Если нужна автономность, стоит изучить открытые Qwen 2.5 и Qwen 3. Для длинных документов и высокой пропускной способности подойдут Qwen 3.5 Flash, Qwen 3.5 Plus или Qwen 3.7 Flash. Для сложного reasoning и программирования лучше отдельно протестировать Max, 397B и Coder-линейку.
FAQ
Qwen — это отдельная компания или проект Alibaba?
Qwen — бренд и семейство моделей Alibaba Cloud, запущенное в 2023 году. Юридически и финансово это часть Alibaba Group, публичной компании NYSE:BABA, а не независимый стартап с отдельной оценкой. Направление работает из Ханчжоу, Китай.
Какая модель Qwen подходит для дешёвого API?
Среди моделей с опубликованными тарифами наиболее экономична Qwen 3.7 Flash — $0.03 за миллион входных и $0.13 за миллион выходных токенов. Для более сложных задач можно выбрать Qwen 3.5 Flash за $0.10 / $0.40 или Qwen 3.5 Plus за $0.40 / $2.40.
Можно ли запускать Qwen локально?
Да. К открытым относятся Qwen 2.5, Qwen 3 235B, Qwen 3 Next 80B и ряд компактных моделей. Закрытые Max-версии не стоит считать локальными: их веса и условия развёртывания не заявлены как открытые. Требования к видеопамяти зависят от размера модели, квантизации и движка инференса.
Как получить доступ к Qwen из России?
Для прямого использования можно изучить официальные сервисы Alibaba Cloud и интерфейс chat.qwen.ai. Более простой вариант — страница Qwen на STIVA.ai: тарифы начинаются от 495 ₽ в месяц, доступны карты «МИР» и СБП, VPN не нужен. Для партнёров и агентств у STIVA также действует партнёрская программа.




