- История Moonshot AI и развитие Kimi
- Линейка моделей Moonshot
- Kimi K3: ставка на миллион токенов
- Kimi K2.6 и Agent Swarm
- Kimi K2.5: доступный мультимодальный предшественник
- Kimi K2.7-Code и Highspeed
- Архитектура и технический профиль
- Цены, API и доступность
- Доступ к Moonshot AI в России через STIVA.ai
- FAQ
- Что такое Moonshot AI и чем она отличается от Kimi?
- Какую модель Moonshot выбрать для программирования?
- Какая модель лучше работает с большими документами?
- Можно ли пользоваться Moonshot AI из России?
Moonshot AI — одна из самых заметных китайских компаний в области больших языковых моделей. Стартап известен прежде всего семейством Kimi. Это не одна модель, а быстро растущая линейка мультимодальных систем, агентских решений и инструментов для отдельных задач. В 2026 году Moonshot развивает флагманскую Kimi K3, открывает веса K2.6, выпускает инструменты для программирования и строит пользовательскую экосистему вокруг Kimi.com.
Компания интересна не только масштабом заявленных моделей. Moonshot конкурирует с ведущими американскими разработчиками по длине контекста, качеству рассуждений и работе с кодом. Она также развивает мультимодальность и системы с группами специализированных агентов. Часть моделей доступна с открытыми весами, а API Moonshot заметно дешевле многих закрытых западных аналогов.
Российские пользователи могут работать с моделями Moonshot через STIVA.ai — платформу с оплатой в рублях, картами «Мир» и через СБП. Это избавляет от необходимости подключать зарубежный биллинг и использовать VPN.
История Moonshot AI и развитие Kimi
Moonshot AI основана в марте 2023 года в Пекине. Компанию создали выпускники Университета Цинхуа Yang Zhilin, Zhou Xinyu и Wu Yuxin. Генеральным директором стал Yang Zhilin. До запуска Moonshot основатели занимались машинным обучением и обработкой естественного языка. На фундаментальные модели компания сделала ставку практически с самого начала.
Название Kimi закрепилось за пользовательским продуктом и семейством моделей. Компания развивает сайт Kimi.com, мобильное приложение Kimi App, командные и десктопные инструменты, а также API-платформу platform.kimi.ai. В экосистему входят Kimi Code CLI для работы с кодом из терминала и Kimi Work — десктопный агент для многошаговых задач.
Первые модели Moonshot относились к серии moonshot-v1 с контекстом 8K, 32K и 128K токенов. На фоне большинства ранних коммерческих LLM именно длинный контекст был одним из главных аргументов компании. Такой режим позволял загружать в запрос большие документы, исходные кодовые базы или расшифровки и просить модель анализировать их целиком.
Следующим этапом стала серия K2. Она улучшила рассуждение и получила поддержку агентных сценариев. Однако в 2026 году Moonshot начала выводить старые API из эксплуатации: поддержку kimi-k2 прекратили 25 мая, а модели kimi-latest — 28 января. Moonshot-v1 и Kimi K2.5 перестают обслуживать новых пользователей; полный sunset заявлен на 31 августа 2026 года.
За короткий срок компания перешла от длинноконтекстной LLM к крупным MoE-системам с триллионами параметров. 20 апреля 2026 года вышла Kimi K2.6, 12 июня — специализированная Kimi K2.7-Code, а 16 июля — флагманская Kimi K3 с контекстом в миллион токенов.
Финансирование отражает амбиции Moonshot. В январе 2026 года компания привлекла $500 млн в раунде Series C под руководством IDG Capital. Совокупный объём привлечённых средств оценивается примерно в $2,5 млрд. В публикациях за 2025 год также упоминается раунд на $3,5 млрд при оценке $35 млрд. Эти сведения приводят источники вроде Instagram и StartupIntros, поэтому они менее надёжны, чем данные о Series C. Кроме того, сообщалось о переговорах по привлечению ещё $1 млрд при оценке $18 млрд.
Среди инвесторов Moonshot называют Alibaba, Tencent, IDG Capital, 5Y Capital и Cathay Capital. Разные оценки могут объясняться несколькими стадиями переговоров или вторичными сделками. Возможно, источники по-разному считают размер раунда. Компания располагает ресурсами, сопоставимыми с крупнейшими азиатскими AI-стартапами.
Линейка моделей Moonshot
| Модель | Тип и релиз | Контекст | API, $ за 1 млн токенов | Особенности |
|---|---|---|---|---|
| Kimi K3 | Мультимодальная MoE, 16 июля 2026 | 1 000 000 токенов | $3 input / $15 output; cache-hit input $0,30 | 2,8 трлн параметров, 32 млрд активных, нативная работа с изображениями, always-on reasoning |
| Kimi K2.6 | Мультимодальная MoE, 20 апреля 2026 | 256 000 токенов | $0,95 input / $4 output | 1 трлн параметров, 32 млрд активных, открытые веса, thinking/non-thinking, Agent Swarm до 300 субагентов |
| Kimi K2.5 | Мультимодальная MoE, 2025 | 256 000 токенов | $0,60 input / $3 output | Сильные результаты в агентных, кодовых и визуальных задачах; постепенно снята с продажи |
| Kimi K2.7-Code | Модель для программирования, 12 июня 2026 | 256 000 токенов | $0,95 input / $4 output; cache-hit $0,19 | На 30% меньше reasoning-токенов, оптимизация под coding-агентов |
| Kimi K2.7-Code-Highspeed | Ускоренная coding-версия, 2026 | 256 000 токенов | Цена не подтверждена | Около 180 токенов в секунду, до 260 токенов в секунду на коротком контексте |
Kimi K3: ставка на миллион токенов
Kimi K3 — главный релиз Moonshot на август 2026 года. Это мультимодальная Mixture-of-Experts-модель с заявленными 2,8 трлн параметров. При обработке конкретного токена используются 32 млрд из них. Такая архитектура распределяет параметры между экспертами и не требует вычислять весь плотный трансформер на каждом шаге.
Контекст в 1 млн токенов — ключевая характеристика K3. Это не значит, что модель одинаково хорошо «помнит» каждый фрагмент огромного входа. Результат зависит от положения информации, структуры документа и способности модели связывать факты. Но миллион токенов позволяет анализировать большие репозитории, юридические массивы и архивы переписки в одном рабочем процессе.
K3 нативно понимает изображения, а reasoning включён постоянно. В моделях с раздельными режимами пользователь сам выбирает, нужно ли рассуждение. Постоянный режим упрощает работу агентов: им не приходится переключаться между обычной генерацией и thinking. Обратная сторона — простой запрос может стоить дороже и обрабатываться дольше.
Цена K3 составляет $3 за миллион входных токенов и $15 за миллион выходных. Для повторно используемого контекста предусмотрена цена cache-hit input $0,30. Кэш особенно полезен агентам, которые обращаются к одному репозиторию или системному промпту. Веса модели компания обещала опубликовать 27 июля 2026 года; окончательный статус публикации и состав открываемых компонентов следует проверять в официальной документации.
Kimi K2.6 и Agent Swarm
K2.6 — самая интересная модель Moonshot для открытой экосистемы. Это MoE-система с триллионом общих параметров и 32 млрд активных параметров. Модель выпущена с открытыми весами по лицензии Modified MIT. Это потенциально позволяет развернуть её самостоятельно, дообучить и встроить в собственный продукт. Однако Modified MIT не равна классической MIT автоматически: перед коммерческим использованием нужно изучить текст лицензии и ограничения.
У K2.6 есть два режима. Non-thinking подходит для быстрых ответов, классификации и извлечения информации. Thinking рассчитан на отладку, планирование, анализ документов и работу с инструментами.
Главная технологическая особенность K2.6 — Agent Swarm. Система может распределять задачу между 300 субагентами, каждый из которых занимается своей частью работы. Это не означает, что любой запрос автоматически превращается в 300 параллельных вызовов. Эффективность зависит от оркестрации: задачу нужно правильно разделить, обозначить границы ответственности и проверить итоговые данные.
Agent Swarm подходит для исследовательских задач, анализа больших коллекций файлов и сложной разработки. Для короткого вопроса о синтаксисе Python такая архитектура избыточна. Масштабирование увеличивает задержку, расход токенов и сложность контроля.
Kimi K2.5: доступный мультимодальный предшественник
K2.5 стала переходным звеном между ранней K2-линейкой и K2.6. Точная дата релиза в 2025 году не подтверждена, но модель получила контекст 256K, мультимодальные возможности и переключаемые режимы thinking/non-thinking.
Moonshot называла K2.5 open-source SoTA в агентных, кодовых и визуальных задачах. Это позиция разработчика, а не универсальный результат независимых тестов. Поэтому модель нужно сравнивать по конкретным бенчмаркам и версиям промптов. При этом она была конкурентоспособной по цене, размеру контекста и работе с инструментами.
Её API-цена — $0,60 за миллион входных токенов и $3 за миллион выходных. Это дешевле K2.6 и K3, но экономия теряет смысл, если приложению нужны функции, которых нет в старой версии. После запуска K3 K2.5 снята с продажи для новых пользователей, а полный sunset старых моделей запланирован на 31 августа.
Kimi K2.7-Code и Highspeed
K2.7-Code выпущена 12 июня 2026 года как специализированная модель для программирования. Её контекст — 256K токенов, цена совпадает с K2.6: $0,95 за вход и $4 за выход на миллион токенов. Для кэшированных входных данных действует цена $0,19.
Moonshot заявляет, что K2.7-Code использует на 30% меньше reasoning-токенов, чем K2.6. Меньшее число внутренних шагов может снизить стоимость и задержку coding-агента. Но итоговое качество зависит не только от объёма рассуждений. Важнее, насколько хорошо модель читает репозиторий, запускает тесты, разбирает ошибки и вносит минимальные изменения.
Версия K2.7-Code-Highspeed рассчитана на интерактивную разработку. Заявленная скорость составляет около 180 токенов в секунду и до 260 токенов в секунду на коротком контексте. Цена этой версии на август 2026 года не подтверждена. Быстрый режим удобен в терминале и IDE, где ответ нужен почти сразу. Для автономного рефакторинга важнее стабильность и качество длинных цепочек действий.
Архитектура и технический профиль
Все ключевые новые модели Moonshot используют MoE-подход. В плотной модели каждый токен проходит через один и тот же полный набор параметров. Mixture of Experts выбирает только часть экспертных блоков. Поэтому у K2.6 заявлен общий объём в 1 трлн параметров, но активными остаются 32 млрд. У K3 разрыв ещё больше: 2,8 трлн общих параметров против 32 млрд активных.
MoE даёт два преимущества. Модель может хранить больше специализаций. Кроме того, один шаг обходится дешевле, чем в плотной модели с тем же общим числом параметров. Но инфраструктура усложняется: нужны маршрутизация токенов между экспертами, балансировка нагрузки и распределённое хранение весов. Узким местом становится не только FLOPS, но и передача данных между GPU.
Вторая линия развития — длинный контекст. Moonshot прошла путь от 8K и 32K в moonshot-v1 до 128K, затем 256K в K2-серии и 1 млн токенов в K3. Для разработчиков это означает, что документы можно реже предварительно суммировать и разбивать на части. При этом длинное окно не отменяет retrieval-архитектуру: для больших баз знаний по-прежнему полезно сначала находить релевантные фрагменты, а затем отправлять их модели.
Третья особенность — разделение режимов рассуждения. K2.6 и K2.5 позволяют выбирать thinking или non-thinking. В API это удобно: простой запрос можно выполнить быстро и дёшево, а сложный — передать в режим с расширенным рассуждением. K3, напротив, использует always-on reasoning и предлагает единый профиль качества.
В опубликованных материалах K2.6 заявлено соответствие GPT-5.5 на SWE-Bench Pro. Это сильная заявка для задач программирования, но не доказательство общего превосходства. SWE-Bench Pro зависит от версии набора, инструментального окружения, лимитов времени и способа проверки патчей. При выборе модели стоит провести собственные тесты, особенно если кодовая база написана на менее распространённом стеке.
В сравнении с закрытыми моделями OpenAI, Anthropic и Google Moonshot выигрывает за счёт длинного контекста, низкой цены и открытых весов отдельных моделей. У конкурентов обычно зрелее инструменты безопасности, документация и корпоративные гарантии. Среди китайских разработчиков, включая DeepSeek, Alibaba и Zhipu AI, Moonshot делает особый упор на Kimi как на единую среду: от пользовательского чата до CLI и агентных рабочих процессов.
Цены, API и доступность
Самой дешёвой из актуальных моделей остаётся Kimi K2.5: $0,60 за миллион входных токенов и $3 за миллион выходных, но её жизненный цикл завершается. K2.6 и K2.7-Code стоят $0,95 и $4 соответственно. Флагман K3 заметно дороже — $3 за вход и $15 за выход. Для приложений с повторяющимся контекстом K3 может оказаться выгоднее номинального тарифа благодаря cache-hit input за $0,30.
Разница между входными и выходными токенами принципиальна. В агентных системах расходы часто формируют не ответы пользователю, а системные инструкции, история действий, содержимое файлов и результаты инструментов. Поэтому при оценке стоимости нужно считать полный токенный оборот, а не только длину финального ответа.
Старые moonshot-v1 8K, 32K и 128K, а также kimi-k2 и kimi-latest официально выводятся из эксплуатации. Для новых проектов их выбирать не стоит. Даже если endpoint ещё отвечает, последующая миграция может потребовать изменить формат запросов, системные промпты и настройки reasoning.
Доступ к Moonshot AI в России через STIVA.ai
Российским пользователям не обязательно регистрироваться в зарубежном сервисе Moonshot и использовать иностранную карту. Модели провайдера доступны через STIVA.ai, где Moonshot размещён в каталоге под slug moonshot.
Платформа рассчитана на пользователей, которым нужен простой биллинг и быстрый старт: подписка стоит от 495 ₽ в месяц, поддерживаются карты «Мир» и СБП, VPN не требуется. Через STIVA можно использовать модели Moonshot в привычном интерфейсе и выбирать режим под задачу — от диалога и анализа документов до генерации и проверки кода.
Для разработчиков принцип выбора тот же, что и при прямом API-доступе. K3 подходит для сложных мультимодальных и длинноконтекстных задач. K2.6 — для проектов с открытыми весами, режимами thinking/non-thinking и агентной декомпозицией. K2.7-Code специализируется на программировании, а Highspeed — на скорости интерактивного ответа.
У STIVA есть отдельная партнёрская программа. Актуальные условия подключения и список доступных моделей следует проверять на странице сервиса: Moonshot в 2026 году быстро обновляет линейку, а K2.5 и старые moonshot-v1 переходят в режим вывода из эксплуатации.
FAQ
Что такое Moonshot AI и чем она отличается от Kimi?
Moonshot AI — компания-разработчик из Пекина, основанная в марте 2023 года. Kimi — её основной бренд моделей и пользовательских продуктов: Kimi.com, Kimi App, Kimi Code CLI и Kimi Work. В разговорной речи названия Moonshot и Kimi часто используют как взаимозаменяемые, но первое обозначает компанию, а второе — продуктовую и модельную экосистему.
Какую модель Moonshot выбрать для программирования?
Для coding-агентов предназначена Kimi K2.7-Code. Она оптимизирована для работы с репозиториями и использует примерно на 30% меньше reasoning-токенов, чем K2.6. Если важна скорость ответа в терминале, можно выбрать K2.7-Code-Highspeed. K2.6 остаётся универсальнее и подходит проектам, где нужны мультимодальность, открытые веса или Agent Swarm.
Какая модель лучше работает с большими документами?
Kimi K3 имеет контекст до 1 млн токенов и подходит для больших массивов текста, изображений и кода. K2.6, K2.5 и K2.7-Code ограничены 256K токенов, чего достаточно для большинства отдельных документов, крупных файлов и средних репозиториев. Размер окна не гарантирует одинаково высокую точность на каждой позиции, поэтому критические сведения нужно проверять.
Можно ли пользоваться Moonshot AI из России?
Да. Один из практичных вариантов — STIVA.ai: сервис предоставляет доступ к моделям Moonshot с оплатой от 495 ₽ в месяц, поддержкой «Мир» и СБП, без VPN. Перед подключением стоит проверить, какие версии доступны в текущем тарифе, поскольку K2.5 и старые модели Moonshot проходят процедуру sunset 31 августа 2026 года.
Moonshot AI постепенно превращается из разработчика длинноконтекстного чат-бота в платформу агентных систем. Её сильные стороны — масштаб моделей, большой контекст, открытые веса и низкая цена. Для корпоративного внедрения важнее не число параметров K3, а стабильность API, воспроизводимость бенчмарков и качество работы агентов на конкретных данных и инструментах.




