- Zhipu AI (Z.ai): как китайская компания развила GLM в глобальную платформу открытых моделей
- История компании и эволюция GLM
- От ChatGLM к агентской инженерии
- Ключевые модели Z.ai
- Что изменилось в GLM-5.2
- Бенчмарки и реальная производительность
- Мультимодальные и прикладные продукты
- Цены и доступность
- Доступ к моделям Zhipu AI в России через STIVA.ai
- Сильные и слабые стороны Z.ai
- Что у компании получается хорошо
- Где остаются вопросы
- FAQ
- Что такое Zhipu AI и чем она отличается от Z.ai?
- Какая модель Z.ai лучше для программирования?
- Можно ли запустить GLM локально?
- Как получить доступ к GLM из России?
- Итог
Zhipu AI (Z.ai): как китайская компания развила GLM в глобальную платформу открытых моделей
Zhipu AI — китайская компания из экосистемы Университета Цинхуа, разработавшая семейство языковых моделей GLM. На внутреннем рынке бренд долгое время был известен как Zhipu AI или ChatGLM, а в июле 2025 года компания сменила международное название на Z.ai. Это не просто ребрендинг: разработчик выходит за пределы китайского рынка и развивает универсальную AI-платформу с открытыми весами, облачным API и собственными агентами.
К августу 2026 года Z.ai стала одним из самых заметных азиатских конкурентов OpenAI, Anthropic, Google и xAI. Её флагманская GLM-5.2 получила контекстное окно в 1 млн токенов и, по данным Artificial Analysis, заняла первое место среди open-weights-моделей. Модель распространяется под лицензией MIT. Цена API начинается с $1,40 за 1 млн входных токенов. Для разработчиков это сочетание производительности, открытых весов и доступной цены может быть привлекательнее закрытых API с жёсткими ограничениями на переносимость.
У Z.ai есть и слабые стороны: геополитические ограничения, зависимость от китайской инфраструктуры и неоднородность экосистемы. 16 января 2025 года компанию внесли в американский Entity List. Это осложняет работу с американскими поставщиками оборудования и облачными платформами. Одновременно ограничение подталкивает Z.ai развивать собственный стек и продавать модели международным пользователям через альтернативные каналы.
История компании и эволюция GLM
История Zhipu AI начинается в Университете Цинхуа. Компанию основали в 2019 году исследователь Tang Jie, профессор Tsinghua University, и Li Juanzi. В некоторых источниках 2021 год указан как дата оформления компании в её нынешнем корпоративном виде: разработчик вышел из университетской исследовательской среды и начал привлекать коммерческое финансирование. Генеральным директором стал Zhang Peng, а штаб-квартира разместилась в пекинском районе Хайдянь — одном из главных центров китайской IT-индустрии.
Первоначально компания развивала направление GLM — General Language Model. В отличие от чисто авторегрессионного подхода, характерного для ранних поколений GPT, GLM с самого начала строилась вокруг унифицированной схемы обучения с восстановлением пропусков и генерацией текста. Со временем семейство превратилось в линейку больших языковых моделей: от диалоговых ChatGLM до reasoning-моделей, которые планируют действия, вызывают инструменты и работают в агентских сценариях.
В 2023–2024 годах Zhipu AI закрепилась на китайском рынке как один из основных разработчиков LLM. Компания привлекала капитал от Alibaba, Ant Group, Tencent, Meituan, Xiaomi, HongShan и других инвесторов. В июне 2024 года она получила около $400 млн при оценке примерно $3 млрд, в декабре — ещё $411 млн. В июле 2025 года последовал раунд на $140 млн. До IPO общий объём привлечённых средств оценивался более чем в $1,5 млрд.
В апреле 2025 года Zhipu подала предварительные документы для выхода на Гонконгскую биржу. В июле 2026 года компания провела IPO и сообщила о постлистинговом раунде на $4 млрд. Caixin Global в мае 2026 года оценивала капитализацию Zhipu в $112 млрд. Эти цифры нужно воспринимать с оговоркой: оценки быстро менялись на фоне интереса к китайским AI-компаниям и не всегда отражают объём средств, непосредственно направленных на развитие моделей.
От ChatGLM к агентской инженерии
Ранние модели GLM воспринимались прежде всего как китайская альтернатива ChatGPT. Они хорошо работали с китайским языком, а некоторые версии можно было запускать локально. Затем компания сместила фокус на open-weight-модели, мультимодальность и интеграцию с инструментами.
- GLM-4 и производные получили большой контекст, вызов функций, структурированный вывод и открытые веса.
- GLM-4.5 и GLM-4.6 усилили reasoning-составляющую и возможности для программирования.
- GLM-4.7 стала полноценной MoE-моделью для задач рассуждения, tool calling и генерации структурированных данных.
- GLM-5, выпущенная в феврале 2026 года, обозначила переход от «vibe coding» — генерации кода по описанию — к agentic engineering. В этом подходе модель сама планирует работу, проверяет результат и взаимодействует с инструментами.
- GLM-5.1 и GLM-5.2 развили эту концепцию в моделях с сотнями миллиардов параметров и контекстом до 1 млн токенов.
Параллельно Z.ai расширяла модельный ряд за пределы текста. В экосистему вошли генератор изображений GLM-Image, видеомодель CogVideoX, системы распознавания речи GLM-ASR и OCR-модели. Отдельное направление — ZCode, десктопный агент, который работает не только с текстом в чате, но и с приложениями, файлами и операционной системой.
Ключевые модели Z.ai
Ниже перечислены основные модели линейки, доступные на август 2026 года. Цены указаны для API и могут различаться в зависимости от региона, провайдера и условий конкретного endpoint.
| Модель | Тип и релиз | Контекст | Цена, $ за 1 млн токенов | Особенности |
|---|---|---|---|---|
| GLM-5.2 | Reasoning LLM, MoE, 16 июня 2026 | 1 000 000 токенов | $1,40 input / $4,40 output; cached input $0,26 | Около 744 млрд параметров, около 40 млрд активных; MIT; IndexShare; управление уровнем reasoning effort |
| GLM-5.1 | Reasoning LLM, MoE, 7 апреля 2026 | 200 000 токенов | $1,40 / $4,40; cached input $0,26 | Предшественник GLM-5.2, рабочая модель для сложных задач и агентов |
| GLM-5 | Reasoning LLM, 12 февраля 2026 | 200 000 токенов | $1,00 / $3,20; cached input $0,20 | Флагманский переход от vibe coding к agentic engineering |
| GLM-5-Turbo | Ускоренная версия, 16 марта 2026 | 200 000 токенов | $1,20 / $4,00; cached input $0,24 | Более высокая скорость ответа при сохранении возможностей GLM-5 |
| GLM-4.7 | Reasoning LLM, MoE, 22 декабря 2025 | 204 800 токенов | $0,60 / $2,20; cached input $0,11 | Open-weight, reasoning, tool calling, structured output |
| GLM-4.7-Flash | Быстрая open-weight-модель, 19 января 2026 | 200 000 токенов | Бесплатно | Reasoning и вызов инструментов без платы за API |
| GLM-4.7-FlashX | Лёгкая flash-модель, 19 января 2026 | 200 000 токенов | $0,07 / $0,40; cached input $0,01 | Самый дешёвый платный вариант для массовых запросов |
Для мультимодальных сценариев компания предлагает GLM-5V-Turbo по цене $1,20 за 1 млн входных и $4 за 1 млн выходных токенов, GLM-4.6V по тарифу $0,30/$0,90 и GLM-Image стоимостью $0,015 за изображение. Видеогенерация CogVideoX-3 стоит $0,2 за видео, GLM-ASR-2512 — $0,03 за 1 млн токенов распознанной речи. В экосистеме также есть версии GLM-4.5 и GLM-4.6. Они подходят приложениям, которым не нужна максимальная глубина рассуждений GLM-5.
Что изменилось в GLM-5.2
Главное отличие GLM-5.2 — не только масштаб параметров. Модель использует разреженную mixture-of-experts-архитектуру: всего в ней около 744 млрд параметров, но для конкретного токена активируется примерно 40 млрд. Это увеличивает вычислительную ёмкость без пропорционального роста стоимости каждого шага инференса.
MoE не означает, что модель автоматически дёшева в эксплуатации. Для неё по-прежнему нужна сложная серверная инфраструктура, распределение слоёв между ускорителями и точная маршрутизация токенов между экспертами. Такой подход помогает Z.ai конкурировать с крупнейшими закрытыми моделями, сохраняя приемлемую экономику API и выпуская веса для самостоятельного развёртывания.
В GLM-5.2 заявлена архитектура IndexShare. По доступному описанию, она рассчитана на эффективную работу с длинным контекстом и повторно используемыми фрагментами информации. Это полезно при анализе больших репозиториев, технической документации, логов и многостраничных документов. Контекст в 1 млн токенов не делает модель безошибочной: с ростом входа повышаются требования к поиску релевантных частей, позиционному кодированию и контролю потери внимания. Однако для агентских задач такой запас уменьшает необходимость дробить проект на десятки независимых запросов.
Ещё одна особенность GLM-5.2 — управление уровнем reasoning effort. Разработчик может выбрать нужный баланс скорости, стоимости и глубины рассуждения. Для классификации или простого рефакторинга не нужен тот же вычислительный бюджет, что и для многошаговой отладки, анализа архитектуры или планирования действий в браузере. Такой контроль постепенно становится стандартной функцией reasoning-моделей.
Бенчмарки и реальная производительность
По данным Artificial Analysis, GLM-5.2 в июне 2026 года заняла первое место среди моделей с открытыми весами. Это заметный результат: рейтинг учитывает несколько классов задач, включая рассуждение, программирование и следование инструкциям. Но его не следует воспринимать как универсальное доказательство превосходства над каждой закрытой моделью.
GLM-5.2 хорошо подходит для задач, где нужно сочетать планирование и действие: написания и тестирования кода, работы с репозиториями, анализа документов, вызова внешних API и подготовки структурированных результатов. Преимущество здесь связано не только с объёмом знаний, но и со способностью модели выполнять длинную цепочку шагов.
GLM-5 и GLM-5.1 были промежуточными, но важными этапами. Первая модель предназначалась для перехода от генерации отдельных фрагментов кода к агентской разработке. GLM-5.1 стала более практичным workhorse-вариантом: с тем же порядком параметров MoE — около 744 млрд общих и около 40 млрд активных — но с контекстом 200 тысяч токенов и более предсказуемым рабочим профилем.
GLM-4.7 остаётся рациональным выбором, если проекту не требуется миллион токенов контекста. Её контекста в 204 800 токенов достаточно для большинства репозиториев среднего размера, больших технических документов и сложных диалогов. Стоимость $0,60 за 1 млн входных токенов заметно ниже, чем у GLM-5.2. GLM-4.7-FlashX за $0,07/$0,40 подходит для маршрутизации запросов, массового извлечения данных, предварительной обработки и недорогих чат-ботов.
Открытые веса позволяют проверять модель не только через облачный API. Но GLM-5.2 не предназначена для запуска на обычной видеокарте или домашнем компьютере: её масштаб требует серьёзной серверной конфигурации. Самостоятельное развёртывание будет доступно крупным компаниям, облачным операторам и исследовательским группам. Большинству пользователей проще использовать API или готовый интерфейс.
Мультимодальные и прикладные продукты
Z.ai развивает не только универсальную текстовую LLM.
- GLM-5V-Turbo и GLM-4.6V работают с изображениями и визуальными данными. Они подходят для анализа интерфейсов, скриншотов, документов и текстово-графических запросов.
- GLM-Image — генеративная модель изображений с тарифом $0,015 за изображение. Низкая стоимость делает её удобной для массовой генерации иллюстраций, рекламных вариантов и прототипов.
- CogVideoX-3 генерирует видео; цена заявлена на уровне $0,2 за видео. Модель использует отдельный вычислительный контур.
- GLM-ASR-2512 преобразует речь в текст и тарифицируется по $0,03 за 1 млн токенов.
- GLM-OCR извлекает текст и структуру из документов, сканов и изображений.
- ZCode — десктопный агент, который переносит возможности GLM из чата в рабочую среду пользователя: к файлам, приложениям и операциям на компьютере.
Такой набор напоминает стратегию крупных западных лабораторий: базовая LLM становится ядром, а вокруг неё строятся специализированные модели и агенты. Z.ai при этом активнее делает ставку на открытые веса и низкую цену. OpenAI и Anthropic в основном контролируют доступ к моделям через собственные облачные API.
Цены и доступность
Ценовая линейка Z.ai устроена понятно. Для недорогих операций есть GLM-4.7-FlashX за $0,07 за 1 млн входных токенов и $0,40 за выходные. GLM-4.7 стоит дороже, но предлагает более высокий уровень reasoning, большой контекст и инструменты. GLM-5 и GLM-5-Turbo рассчитаны на сложные агентские задачи. GLM-5.2 стоит $1,40/$4,40, что при контексте в 1 млн токенов выглядит конкурентоспособно для анализа крупных наборов данных и программных проектов.
Отдельно тарифицируется кэшированный ввод. Повторно используемые фрагменты промпта для GLM-5.2 стоят $0,26 за 1 млн токенов, для GLM-5.1 — столько же, для GLM-5 — $0,20, а для GLM-4.7 — $0,11. Это полезно в агентских системах, где в каждый запрос приходится включать одну и ту же системную инструкцию, описание инструментов или контекст проекта.
По стоимости Z.ai конкурирует прежде всего с другими open-weight-провайдерами — DeepSeek, Qwen и отдельными моделями Meta, Mistral и китайских лабораторий. Закрытые системы могут выигрывать в стабильности API, корпоративном управлении и мультимодальной интеграции. За это часто приходится платить более высокую цену и мириться с меньшей свободой развёртывания. GLM-4.7-FlashX и бесплатная GLM-4.7-Flash особенно полезны там, где важна стоимость одного запроса.
Доступ к моделям Zhipu AI в России через STIVA.ai
Для российских пользователей проблема обычно заключается не в выборе модели, а в оплате зарубежного API, регистрации аккаунта и стабильности доступа. Модели Zhipu AI доступны в России через STIVA.ai — платформу с востребованными нейросетевыми инструментами в одном интерфейсе.
Через сервис можно работать с моделями семейства GLM без самостоятельной настройки китайского или международного API. Это удобно для тестирования GLM-4.7, GLM-5 и мультимодальных вариантов перед интеграцией в собственный продукт. Программистам полезно сравнивать несколько моделей на одном наборе промптов: дешёвую GLM-4.7-FlashX для рутинных задач, GLM-4.7 для основного потока и GLM-5.2 для сложного reasoning.
Тарифы STIVA.ai начинаются от 495 ₽ в месяц. Оплата доступна российскими картами «МИР» и через СБП, подключение не требует VPN. Это не отменяет ограничений, связанных с политиками разработчиков и изменениями международной инфраструктуры, но снимает основные барьеры для пользователя из России.
Для тех, кто хочет рекомендовать сервис коллегам или аудитории, предусмотрена партнёрская программа STIVA.ai. Актуальные условия подписки, перечень моделей и варианты доступа лучше проверять на странице тарифов и моделей STIVA.ai: состав доступных endpoint и лимиты могут меняться.
Сильные и слабые стороны Z.ai
Что у компании получается хорошо
- Открытые веса. GLM-4.7 и GLM-5.2 позволяют строить решения с меньшей зависимостью от одного облачного поставщика.
- Сильная reasoning-линейка. Модели развиваются не только как чат-боты, но и как инструменты программирования, планирования и агентской работы.
- Большой контекст. Миллион токенов у GLM-5.2 полезен для репозиториев, документов, журналов событий и длительных рабочих сессий.
- Гибкая экономика. В линейке есть бесплатная модель, бюджетная FlashX, рабочая GLM-4.7 и флагман GLM-5.2.
- Несколько модальностей. Платформа работает с текстом, изображениями, видео, речью и OCR.
Где остаются вопросы
- Инфраструктурная сложность. Большие MoE-модели нельзя без серьёзной подготовки развернуть на случайном сервере, несмотря на открытость весов.
- Геополитические риски. Включение в US Entity List может влиять на оборудование, облака и международные партнёрства.
- Неравномерная экосистема. Документация и поведение API могут отличаться между версиями и каналами доступа.
- Бенчмарки не заменяют пилот. Первое место GLM-5.2 среди open-weights по Artificial Analysis не означает одинаково высокую точность на каждой прикладной задаче.
- Качество языков может различаться. Для русскоязычных корпоративных сценариев нужно отдельно проверить терминологию, фактическую точность и соблюдение формата вывода.
FAQ
Что такое Zhipu AI и чем она отличается от Z.ai?
Zhipu AI — прежнее международное название компании. В июле 2025 года разработчик перешёл на бренд Z.ai. GLM — семейство моделей компании, а ChatGLM — раннее и широко известное название её диалогового направления. Официальный международный сайт — z.ai; домен chatglm.cn не следует считать основным международным сайтом.
Какая модель Z.ai лучше для программирования?
Для сложной разработки и агентских сценариев стоит начать с GLM-5.2 или GLM-5.1. Если нужен баланс стоимости и возможностей, подойдёт GLM-4.7. Для автодополнения, классификации, простого рефакторинга и массовой обработки запросов рациональнее использовать GLM-4.7-FlashX. Финальный выбор зависит от размера репозитория, требований к скорости и необходимости tool calling.
Можно ли запустить GLM локально?
Некоторые модели семейства GLM имеют открытые веса и могут разворачиваться самостоятельно. Однако GLM-5.2 с примерно 744 млрд параметров требует серьёзной инфраструктуры. Для локального или частного запуска понадобятся серверные ускорители, распределённый инференс и оптимизация памяти. Большинству команд проще обращаться к API или использовать готовый доступ через STIVA.ai.
Как получить доступ к GLM из России?
Один из простых вариантов — использовать STIVA.ai. Тарифы начинаются от 495 ₽ в месяц, доступны оплата картами «МИР» и через СБП, VPN не требуется. Перед выбором тарифа стоит проверить актуальный список моделей и ограничения по запросам.
Итог
Z.ai больше не выглядит локальным китайским аналогом ChatGPT. Это самостоятельная модельная платформа с open-weight-линейкой, длинным контекстом, MoE-архитектурой, агентами и мультимодальными продуктами. GLM-5.2 показывает, что китайские лаборатории способны конкурировать на верхнем уровне не только числом параметров, но и качеством инженерных решений.
Главный вопрос для бизнеса — не является ли GLM-5.2 «лучшей моделью вообще», а подходит ли она архитектуре конкретного продукта. Если нужны открытые веса, гибкая цена, reasoning, вызов инструментов и работа с большими объёмами контекста, Z.ai стоит включить в пилот. Российские пользователи могут начать тестирование через STIVA.ai, без зарубежной оплаты и самостоятельной настройки доступа.




