deepseek: обзор провайдера нейросетей, модели и цены 2026

Экспертный обзор deepseek: модели, характеристики, бенчмарки, цены. Доступ в России через STIVA.ai — без VPN.

deepseek

DeepSeek: как китайская лаборатория изменила экономику больших языковых моделей

DeepSeek — китайская компания-разработчик больших языковых моделей, связанная с фондом High-Flyer. Проект появился как независимая исследовательская лаборатория, а не как побочный продукт крупного облачного или поискового бизнеса. Такой старт многое объясняет: DeepSeek с самого начала вкладывалась не в красивую оболочку чат-бота, а в оптимизацию обучения, архитектуру Mixture of Experts, работу с длинным контекстом и снижение стоимости инференса.

Главный эффект DeepSeek для рынка оказался не только технологическим. Выпуск моделей V3 и R1 показал, что система с сотнями миллиардов параметров может обучаться и работать дешевле, чем предполагали крупнейшие американские лаборатории. В январе 2025 года появление DeepSeek-R1 вызвало резкую переоценку стоимости вычислительной инфраструктуры для ИИ: инвесторы, разработчики и облачные провайдеры начали обсуждать не только дефицит ускорителей, но и эффективность их использования самой моделью.

DeepSeek одновременно разрабатывает модели с открытыми весами и предоставляет доступ к ним через API. Лаборатория также публикует архитектурные решения. Её модели особенно сильны в программировании, математике и анализе документов. Они подходят и для задач, где требуется пошаговое рассуждение. Для российского пользователя доступ к ним удобнее всего получать через страницу DeepSeek на STIVA.ai, где модели провайдера собраны в одном интерфейсе.

История и эволюция DeepSeek

От High-Flyer к отдельной ИИ-лаборатории

История DeepSeek начинается с High-Flyer — китайского количественного инвестиционного фонда, который активно использовал машинное обучение для финансового моделирования. Основатель компании Лян Вэньфэн (Liang Wenfeng) занимался алгоритмической торговлей и накопил опыт в создании распределённых вычислительных систем. В 2023 году на базе этих компетенций появилась DeepSeek.

Для лаборатории это был необычный путь. У неё не было многолетнего потребительского продукта, поисковой системы или рекламной платформы для субсидирования обучения моделей. Поэтому команда с самого начала оптимизировала каждый уровень стека: от схемы параллельного обучения до маршрутизации токенов между экспертами. Позднее это стало одним из конкурентных преимуществ DeepSeek.

DeepSeek Coder и первые специализированные модели

Одним из первых заметных направлений стал DeepSeek Coder. Модель обучали на больших массивах исходного кода и технических текстов. Она поддерживала заполнение кода, генерацию функций, объяснение программ и работу с несколькими языками программирования. В отличие от универсальных чат-моделей, Coder с самого начала оптимизировалась под практические задачи разработчика.

Параллельно развивалась линейка DeepSeek Math. Она не стала массовым чат-ботом, но показала, что команда умеет работать со специализированным дообучением и математическим рассуждением. Эти наработки позднее пригодились при создании reasoning-моделей — систем, которые перед выдачей ответа формируют внутреннюю цепочку рассуждений.

DeepSeek-V2: ставка на MoE и Multi-head Latent Attention

В мае 2024 года вышла DeepSeek-V2. Это была крупная Mixture of Experts-модель с примерно 236 млрд параметров, из которых для обработки конкретного токена активировалось около 21 млрд. Такая схема позволяла получить качество большой модели, не оплачивая вычисления по всем параметрам на каждом шаге.

Вторая ключевая технология — Multi-head Latent Attention, или MLA. В классическом трансформере объём ключей и значений, которые нужно хранить для контекстного окна, быстро растёт вместе с длиной последовательности. MLA сжимает представление key-value в латентное пространство и снижает нагрузку на память во время инференса. Для длинных документов это не косметическая оптимизация: именно KV-кэш часто становится узким местом при обслуживании больших моделей.

DeepSeek-V2 также привлекла внимание ценой API. На момент выхода стоимость обработки токенов была значительно ниже, чем у многих закрытых систем сопоставимого класса. Это заставило конкурентов пересматривать тарифы и ускорило переход рынка к более дешёвым MoE-архитектурам.

V2.5 и V3: переход к универсальной модели

DeepSeek-V2.5 объединила возможности диалоговой и кодовой моделей. Она лучше справлялась с обычными текстовыми запросами и сохранила сильную позицию в программировании. Следующим крупным релизом стала DeepSeek-V3, представленная в декабре 2024 года.

V3 получила 671 млрд параметров, однако на один токен маршрутизируется примерно 37 млрд. В модели используется 128 экспертов, а каждый токен направляется к ограниченному числу наиболее подходящих экспертов. Это принципиальная разница между «размером модели» и реальной стоимостью запроса: 671 млрд — общий объём параметров, а не число параметров, вычисляемых на каждом шаге.

При обучении V3 команда применила auxiliary-loss-free load balancing. В обычных MoE-системах для равномерного распределения нагрузки между экспертами добавляют вспомогательную функцию потерь. Она помогает избежать ситуации, когда несколько экспертов получают почти все токены, но одновременно может ухудшать основную оптимизацию. DeepSeek предложила регулировать баланс маршрутизации без отдельного штрафа в функции потерь.

V3 также использует Multi-Token Prediction — предсказание нескольких будущих токенов в процессе обучения. Подход помогает модели лучше захватывать структуру последовательностей. При использовании соответствующих механизмов декодирования он может ускорять генерацию. Это позволило DeepSeek заявить о сравнительно умеренной стоимости обучения V3 — около 5,6 млн долларов вычислительных расходов. Прямое сравнение с бюджетами конкурентов требует осторожности: разные компании по-разному считают аренду оборудования, эксперименты и подготовку данных.

DeepSeek-R1 и появление reasoning-моделей

В январе 2025 года вышла DeepSeek-R1 — модель для задач, где ответ требует рассуждения, проверки промежуточных шагов и исправления ошибок. В отличие от обычного режима V3, R1 может тратить больше вычислений на один запрос перед формированием финального ответа. Пользователь видит это как более длинное «размышление», хотя внутренняя цепочка рассуждений может отображаться не полностью или быть отфильтрована интерфейсом.

R1 обучалась с применением reinforcement learning. Важную роль сыграл алгоритм Group Relative Policy Optimization, или GRPO. Он позволяет оптимизировать модель относительно группы сгенерированных ответов и не использовать отдельную большую модель-критика в классическом виде. Для математических и программных задач это особенно удобно: ответ можно проверить автоматически — например, запустив код или сравнив результат с правильным числовым значением.

После R1 DeepSeek выпустила семейство дистиллированных моделей на базе Qwen и Llama. Их размеры варьировались от нескольких миллиардов до десятков миллиардов параметров. Это дало разработчикам возможность запускать reasoning-подходы локально. Относительно компактные варианты подходят для обычных рабочих станций и серверных GPU.

Ключевые модели DeepSeek

Модель Тип и архитектура Параметры Контекст Основные задачи
DeepSeek Coder Специализированная языковая модель Линейка моделей разных размеров Зависит от версии, до 16K Генерация, исправление и объяснение кода
DeepSeek-V2 MoE, MLA 236 млрд всего, около 21 млрд активно До 128K Диалоги, анализ документов, код
DeepSeek-V2.5 Универсальная MoE-модель Сопоставима с V2 по архитектурному классу До 128K в зависимости от реализации Чат, программирование, технические тексты
DeepSeek-V3 MoE, MLA, Multi-Token Prediction 671 млрд всего, около 37 млрд активно До 128K; в API часто используется лимит 64K Универсальный чат, код, анализ, генерация
DeepSeek-R1 Reasoning-модель на базе V3 671 млрд всего, около 37 млрд активно До 128K, зависит от API и интерфейса Математика, логика, код, сложное планирование
DeepSeek-R1-Distill Дистиллированные версии на базе Qwen и Llama От 1,5 до 70 млрд Обычно до 32K–128K Локальный запуск, эксперименты, reasoning

Названия DeepSeek-V3 и DeepSeek-R1 в разных сервисах могут отличаться. API-провайдеры нередко используют обозначения deepseek-chat для V3 и deepseek-reasoner для R1. После обновлений модели также могут получать новые ревизии без полной смены пользовательского названия. Поэтому при интеграции нужно проверять не только имя, но и заявленный лимит контекста, максимальную длину ответа и режим рассуждения.

Архитектура и технические особенности

Почему MoE снижает стоимость

Плотная модель на 70 или 400 млрд параметров использует практически весь набор весов для каждого токена. MoE делит сеть на экспертов и добавляет маршрутизатор. Он решает, какие эксперты должны обработать текущий токен. В результате модель может иметь большой общий объём знаний, но тратить вычисления только на небольшую часть параметров.

У DeepSeek это решение не сводится к простому сокращению расходов. Эксперты постепенно специализируются: одни лучше работают с кодом, другие — с математическими конструкциями. Третьи эффективнее обрабатывают редкие языки или синтаксис естественной речи. Но у MoE есть собственные сложности: дисбаланс нагрузки, обмен данными между GPU, переполнение буферов и нестабильность маршрутизации. DeepSeek-V3 интересна тем, что многие из этих проблем решаются на уровне архитектуры и алгоритма обучения, а не только увеличением числа ускорителей.

MLA и длинный контекст

Поддержка длинного контекста часто рекламируется как простая характеристика — 32K, 64K или 128K токенов. На практике важнее, сколько памяти требуется для обслуживания такого запроса и насколько хорошо модель сохраняет информацию в начале документа. MLA уменьшает размер KV-кэша, поэтому V2 и V3 могут эффективнее работать с длинными последовательностями, чем трансформеры с традиционной attention-схемой.

Однако 128K не означает, что модель одинаково хорошо использует каждый токен. При работе с многостраничным контрактом или крупной кодовой базой остаются проблемы извлечения нужного фрагмента, конфликтующих инструкций и потери деталей в середине контекста. Для производственных систем полезно сочетать длинное окно с поиском по документам. Текст также стоит разбивать на фрагменты и повторно проверять результат.

Обучение R1 и режим рассуждения

R1 отличается от обычной чат-модели не только тем, что «думает дольше». Ей нужно выбрать стратегию решения, проверить промежуточный результат и иногда вернуться к предыдущему шагу. На математических задачах это даёт заметный прирост. На простых запросах reasoning-режим может быть избыточен: ответ становится медленнее и дороже, а качество не обязательно растёт.

GRPO особенно хорошо подходит для задач с проверяемым результатом. Уравнение можно решить и сверить. Программу — выполнить. Ответ в тесте — сравнить с эталоном. С открытыми вопросами сложнее: автоматическая награда может поощрять формально убедительный, но неверный текст. Поэтому R1 не отменяет фактчекинг и тестирование, особенно в юридических, медицинских и финансовых сценариях.

Бенчмарки и реальное качество

В опубликованных разработчиками результатах DeepSeek-R1 показывала около 79,8% на AIME 2024, 97,3% на MATH-500 и примерно 71,5% на GPQA Diamond. На Codeforces модель демонстрировала результат, соответствующий примерно 96-му перцентилю участников. На SWE-bench Verified показатель находился около 49%, но итог зависит от версии теста, настроек инструментов и того, разрешён ли модели доступ к среде выполнения.

DeepSeek-V3 в сравнительных таблицах показывала около 88,5% на MMLU, 75,9% на MMLU-Pro, 59,1% на GPQA и 82,6% на HumanEval. На задачах LiveCodeBench результат был заметно ниже — около 40%. Это хорошо показывает разницу между генерацией отдельных функций и решением свежих задач программирования без утечки данных из обучающего корпуса.

Эти цифры нельзя воспринимать как универсальный рейтинг. MMLU измеряет широкий набор академических знаний. HumanEval проверяет относительно короткие программные функции. SWE-bench оценивает работу с реальными репозиториями и тестами. Модель может занимать высокое место в одной таблице и заметно уступать в другой. Кроме того, ответы reasoning-моделей зависят от лимита времени на рассуждение, числа попыток и наличия инструментов.

Практический вывод из бенчмарков DeepSeek простой: V3 хорошо подходит для массовых текстовых и кодовых задач. R1 стоит выбирать там, где цена ошибки выше стоимости дополнительного времени на рассуждение.

DeepSeek против OpenAI, Anthropic, Google и открытых моделей

В сравнении с GPT-4o и более поздними моделями OpenAI сильная сторона DeepSeek — цена, открытые веса крупных базовых моделей и доступность API в формате, совместимом с OpenAI. Это упрощает миграцию: во многих приложениях достаточно заменить endpoint и имя модели. OpenAI, в свою очередь, обычно предлагает более зрелую мультимодальность, инструменты, управление безопасностью и стабильную экосистему.

С Claude от Anthropic DeepSeek соперничает в программировании и анализе длинных текстов. Claude часто воспринимается как более аккуратный редактор и сильный помощник для работы с документами. R1 при этом интереснее в формализуемой математике и задачах алгоритмического рассуждения. В конкретном проекте разница определяется не только базовой моделью, но и качеством промптов, RAG-поиска и постобработки.

С Gemini DeepSeek сравнивают прежде всего по цене и качеству reasoning. Google сильнее интегрирует модели с мультимодальными входами, поиском и собственными облачными сервисами. DeepSeek делает ставку на текст, код, открытые исследования и экономичную генерацию.

Среди открытых конкурентов ближайшими соперниками являются семейства Qwen, Llama и Mistral. DeepSeek-V3 крупнее большинства открытых плотных моделей и сложнее для самостоятельного запуска. Дистиллированные версии R1 позволяют переносить идею reasoning на более скромное оборудование. Для локального запуска это часто практичнее, чем разворачивать полную V3.

Цены и доступность

Официальный API DeepSeek получил известность благодаря низкой стоимости. Для распространённых обозначений API порядок цен был следующим: у deepseek-chat — около $0,27 за миллион входных токенов без попадания в кэш, $0,07 за миллион токенов при cache hit и $1,10 за миллион выходных токенов. Для deepseek-reasoner — примерно $0,55 за миллион входных токенов без кэша, $0,14 при попадании в кэш и $2,19 за миллион выходных токенов.

Тарифы могут меняться, а разные посредники добавляют собственную наценку. Важна и разница между входными и выходными токенами: R1 способна генерировать длинный reasoning-трейс, поэтому фактический расход на сложной задаче выше, чем при коротком ответе V3. При большом количестве одинаковых системных инструкций кэширование заметно снижает стоимость.

В веб-интерфейсе пользователь обычно выбирает между быстрым режимом, экспертным режимом и визуальным анализом, если его поддерживает конкретный сервис. На странице DeepSeek в интерфейсе STIVA.ai доступны режимы Instant, Expert и Vision. Первый рассчитан на быстрые ответы. Expert — на более сложные рассуждения. Vision — на работу с изображениями и визуальными материалами в рамках возможностей подключённой модели.

Доступ к DeepSeek в России через STIVA.ai

Российским пользователям не обязательно самостоятельно настраивать зарубежный API, искать рабочие зеркала или разбираться с оплатой иностранной картой. На STIVA.ai модели DeepSeek доступны через единый русскоязычный сервис. Это удобно для обычного чата и для специалистов, которым нужно переключаться между быстрым и reasoning-режимом.

Подписка STIVA.ai начинается от 495 ₽ в месяц. Оплатить её можно картами «Мир» и через СБП. Подключение работает без VPN. Такой вариант удобнее прямого API, если пользователю не нужны программные интеграции, управление токенами и самостоятельный расчёт лимитов.

Для команд и разработчиков при выборе сервиса нужно проверить ограничения конкретного тарифа: число сообщений, доступность Vision, размер загружаемых файлов, максимальный контекст и приоритет обработки. У моделей с большим окном контекста также важно учитывать реальную длину ответа и то, как сервис считает запросы в режиме Expert.

Партнёрская программа STIVA.ai доступна на отдельной странице партнёрки. Она может заинтересовать авторов технических каналов, интеграторов и специалистов, которые рекомендуют ИИ-инструменты клиентам или своей аудитории.

FAQ

Какая модель DeepSeek лучше для программирования?

Для коротких функций, рефакторинга и объяснения кода обычно достаточно DeepSeek-V3 в режиме deepseek-chat. Если нужно спроектировать алгоритм, найти причину сложной ошибки, разобрать несколько взаимосвязанных файлов или решить задачу на алгоритмы, лучше попробовать DeepSeek-R1. При этом результат нужно запускать и проверять тестами: reasoning не гарантирует компилируемый код.

Чем DeepSeek-R1 отличается от DeepSeek-V3?

V3 — универсальная MoE-модель, оптимизированная под быстрый диалог, генерацию текста, анализ и программирование. R1 использует отдельный режим обучения с подкреплением и тратит больше вычислений на рассуждение. R1 сильнее на математике, логике и многошаговом планировании, но обычно отвечает медленнее и расходует больше выходных токенов.

Можно ли запустить DeepSeek локально?

Полные V3 и R1 требуют крупного кластера GPU и не подходят для обычного домашнего компьютера. Дистиллированные R1-Distill на базе Qwen и Llama доступны в размерах от 1,5 до 70 млрд параметров. Малые варианты можно запускать на одной видеокарте после квантования. Модели на 32–70 млрд потребуют значительно больше видеопамяти или распределённого запуска.

Как пользоваться DeepSeek в России без VPN?

Практичный вариант — использовать DeepSeek через STIVA.ai. Доступ предоставляется в российском интерфейсе, тарифы начинаются от 495 ₽ в месяц, оплатить подписку можно через СБП или картой «Мир». Это избавляет от необходимости оформлять зарубежную карту и самостоятельно поддерживать нестабильную схему доступа.

Итог

DeepSeek важна не потому, что стала ещё одним чат-ботом. Её вклад — в демонстрации того, как архитектурные решения, оптимизация обучения и открытая публикация весов могут изменить баланс сил на рынке. V2 показала потенциал MLA и MoE. V3 довела эту комбинацию до уровня универсальной флагманской модели. R1 сделала reasoning-подход массовым и доступным по цене.

У DeepSeek есть ограничения: качество зависит от режима и лимита рассуждений, результаты на разных языках неоднородны, а выводы модели нужно проверять. Остаются и вопросы к политике ответов. Но для программирования, технических текстов, математики и прототипирования это один из наиболее интересных провайдеров своего класса. В России попробовать его проще всего через STIVA.ai — с оплатой в рублях, без VPN и с выбором между быстрым, экспертным и визуальным режимами.

Сэм Альтман

Руководитель OpenAI. Пишу тут для души.

Оцените автора
LeDigital