NVIDIA: обзор провайдера нейросетей, модели и цены 2026

Экспертный обзор NVIDIA: модели, характеристики, бенчмарки, цены. Доступ в России через STIVA.ai — без VPN.

NVIDIA: как производитель ускорителей стал разработчиком открытых ИИ-моделей

NVIDIA для рынка искусственного интеллекта — уже не только поставщик GPU. Компания контролирует несколько уровней стека: аппаратные ускорители, CUDA и библиотеки вычислений, серверные платформы, инструменты развёртывания и собственные нейросетевые модели. Линейка Nemotron показывает, что NVIDIA хочет конкурировать не только за инфраструктурный бюджет, но и за место в прикладном AI-стеке — от компактных моделей для локальных серверов до флагманских reasoning-систем с сотнями миллиардов параметров.

На август 2026 года главным релизом компании остаётся семейство Nemotron 3. В него входят модели с гибридной latent MoE-архитектурой, разными вычислительными профилями и контекстом до 512 тысяч токенов. Старшая Nemotron 3 Ultra 550B сочетает примерно 500 млрд параметров с активацией около 50 млрд на токен. Младшая Nemotron 3 Nano 30B активирует около 3,2 млрд параметров из 31,6 млрд. Такой разброс позволяет NVIDIA работать с задачами сложного рассуждения, корпоративным поиском и edge-сценариями.

Модели NVIDIA проектируются с учётом конкретной вычислительной среды. Для Nemotron 3 заявлена поддержка NVFP4 — четырёхбитного обучения и вычислений на архитектуре Blackwell. В удачном сценарии это снижает требования к памяти и стоимость инференса. Итоговая эффективность зависит от конкретного GPU, длины контекста, характера запроса и используемого runtime.

История компании и эволюция Nemotron

NVIDIA основана в 1993 году Дженсеном Хуангом, Крисом Малакоски и Кёртисом Приэмом. Штаб-квартира находится в Санта-Кларе, штат Калифорния. Компания начинала с разработки графических процессоров, но выиграла за счёт превращения GPU в универсальный ускоритель вычислений. Ключевым поворотом стала CUDA: разработчики получили возможность использовать графические процессоры не только для рендеринга, но и для научных расчётов, машинного обучения и высокопроизводительных вычислений.

Когда глубокое обучение стало массовым, NVIDIA уже обладала нужным сочетанием оборудования, компиляторов и библиотек. Вокруг CUDA сформировалась экосистема с cuDNN, TensorRT, NCCL, серверными платформами DGX и облачным доступом к ускорителям. Для крупных языковых моделей это оказалось не менее важно, чем характеристики отдельных чипов: обучение и инференс требуют распределённых вычислений, эффективной работы с памятью и стабильного взаимодействия между ускорителями.

Собственная программа языковых моделей NVIDIA развивалась поэтапно. Ранее компания выпускала Nemotron-4 340B Instruct, затем модели семейства Nemotron Mini и варианты на базе Llama. К таким legacy-релизам относятся Llama-3.1 Nemotron 70B Instruct и Llama-3.3 Nemotron Super 49B v1.5. Эти модели показывали, как постобучение, preference optimization и фильтрация данных меняют поведение открытых базовых моделей.

В 2025 году появились Nemotron Nano 9B V2 и Nemotron Nano 12B V2 VL. Первая — компактная dense-модель для недорогого текстового инференса. Вторая — vision-language система, которая обрабатывает изображения. В 2026 году NVIDIA перешла к новой архитектурной линии Nemotron 3 и расширила семейство моделями Nano, Super и Ultra. Параллельно появились специализированные компоненты: Nemotron 3.5 Content Safety для модерации и Nemotron 3 Embed 1B для векторного представления документов и запросов.

Все основные новые варианты Nemotron 3 заявлены как open weights и доступны на Hugging Face в форматах BF16 и FP8. Это не означает полной свободы от лицензионных ограничений. Для разработчика важнее другое: веса можно скачать, развернуть в собственной инфраструктуре и не передавать запросы внешнему API.

Ключевые модели NVIDIA

Модель Архитектура и назначение Контекст Параметры Цена API
Nemotron 3 Ultra 550B A55B MoE, reasoning, флагман 512K около 500B всего, 50B active $0,50 input / $2,20 output за 1M токенов
Nemotron 3 Super 120B A10B MoE, сложное рассуждение 128K около 100B всего, 10B active примерно $0,10 / $0,40, оценка
Nemotron 3 Nano 30B A3B MoE, экономичный open-source инференс 128K 31,6B всего, 3,2B active не подтверждена
Nemotron 3 Nano Omni Мультимодальная MoE-модель 128K не раскрыто в карточке не подтверждена
Nemotron Nano 9B V2 Dense LLM, недорогие текстовые задачи 128K 9B $0,04 / $0,16
Nemotron Nano 12B V2 VL Vision-language, текст и изображения 128K 12B $0,20 / $0,60
Nemotron 3.5 Content Safety Классификация и модерация контента не указан не раскрыто не подтверждена
Nemotron 3 Embed 1B Embedding для поиска и RAG не указан 1B не подтверждена
Parakeet TDT 0.6B v3 Распознавание речи, ASR не применимо 0,6B зависит от площадки

Nemotron 3 Ultra 550B

Ultra — самая крупная модель линейки. Обозначение A55B означает, что при общем размере около 550 млрд параметров на каждом токене активируется примерно 50 млрд. Это другой профиль по сравнению с dense-моделью аналогичного размера: память для хранения весов всё равно нужна, но вычислительная нагрузка на отдельный токен ниже благодаря маршрутизации по экспертам.

Главное преимущество Ultra — контекст 512K. Такое окно рассчитано на работу с большими кодовыми базами, длинными техническими документами и многочасовыми стенограммами. Сам по себе большой контекст не гарантирует точного извлечения информации из середины документа. При тестировании нужно проверять long-context retrieval, needle-in-a-haystack и устойчивость ссылок между частями документа. Для агентных сценариев важна также стабильность ответа после множества итераций.

Цена в OpenRouter составляет $0,50 за миллион входных токенов и $2,20 за миллион выходных. Для reasoning-модели это конкурентная ставка, особенно если инфраструктура провайдера использует разреженную активацию и оптимизированные Blackwell-ядра. Стоимость длинных ответов может быстро вырасти: reasoning-системы расходуют больше output-токенов, а агентные приложения многократно вызывают модель в рамках одной задачи.

Nemotron 3 Super 120B и Nano 30B

Nemotron 3 Super 120B A10B выглядит сбалансированным вариантом для корпоративных приложений. Около 100 млрд параметров при активации 10 млрд позволяют получить более сложное поведение, чем у компактных моделей, без полной стоимости dense-модели такого размера. Контекст — 128K. Ориентировочная цена API составляет $0,10 за миллион входных и $0,40 за миллион выходных токенов, но официальный тариф пока не подтверждён.

Nemotron 3 Nano 30B A3B подходит разработчикам, которым нужна открытая модель с умеренными требованиями к GPU. При 31,6 млрд параметров суммарно и 3,2 млрд активных параметров она годится для локального развёртывания, внутренних ассистентов и извлечения данных. Nano не следует оценивать только по размеру модели: для MoE важны объём памяти под веса, пропускная способность памяти и фактическая стоимость маршрутизации экспертов.

В той же ветке находится Nemotron 3 Nano Omni — мультимодальная версия с контекстом 128K. Подробные параметры и тариф в предоставленной документации не подтверждены. Её практическая ценность будет зависеть от качества обработки изображений, таблиц и документов, а не только от заявленной мультимодальности.

Nano 9B V2, Nano 12B V2 VL и специализированные модели

Nemotron Nano 9B V2 — dense-модель с контекстом 128K. На DeepInfra указана цена $0,04 за миллион входных токенов и $0,16 за миллион выходных. Это рациональный вариант для массовых операций: суммаризации, преобразования текста и маршрутизации обращений. Модель также подходит для простых локальных copilot-сценариев.

Nemotron Nano 12B V2 VL добавляет зрительный канал. Цена на DeepInfra составляет $0,20 / $0,60 за миллион токенов input/output, контекст также равен 128K. Модель подходит для анализа документов, изображений интерфейсов и диаграмм. Перед внедрением в production нужно отдельно тестировать OCR, таблицы, мелкий текст и устойчивость к визуальным помехам.

Nemotron 3.5 Content Safety предназначена для контент-модерации и классификации. Это не универсальный чат-бот, а компонент защитного контура. Её можно применять до вызова основной LLM и после генерации ответа. Nemotron 3 Embed 1B решает другую инфраструктурную задачу — строит embeddings для семантического поиска, RAG и кластеризации документов.

Для голосовых сценариев у NVIDIA есть Parakeet TDT 0.6B v3 — модель распознавания речи. Она не относится к Nemotron 3, но расширяет стек за пределы текста. Связка Parakeet, Embed и Nemotron позволяет построить конвейер от аудиозаписи до поиска по расшифровке и генерации ответа.

Архитектура, контекст и качество

Nemotron 3 использует hybrid latent MoE — гибридную архитектуру с разреженной активацией экспертов и латентными представлениями. В dense-модели каждый слой обрабатывает токен одним и тем же набором параметров. В MoE маршрутизатор выбирает часть экспертов, поэтому модель может иметь большой общий объём параметров при меньшей вычислительной стоимости на токен.

У этого подхода есть ограничения. Память под все эксперты всё равно должна быть доступна во время инференса, если система не применяет выгрузку или распределение по узлам. Маршрутизация также усложняет балансировку нагрузки. Реальная задержка может оказаться выше теоретической, если оборудование или runtime плохо работают с разреженными операциями. Поэтому сравнивать Ultra или Super с dense-конкурентами только по числу параметров некорректно.

NVFP4 — ещё один технический акцент Nemotron 3. Четыре бита уменьшают объём весов и требования к памяти, а поддержка обучения в этом формате особенно интересна для Blackwell. Разработчику нужно различать обучение, постобучение, хранение весов и инференс. Хорошая точность в NVFP4 не возникает автоматически: нужны калибровка, подходящие kernels, контроль чувствительных слоёв и проверка на целевых данных.

Веса доступны в BF16 и FP8. BF16 обычно выбирают ради стабильности и совместимости. FP8 — ради большей пропускной способности и экономии памяти. Для локального запуска важны не только параметры модели, но и размер KV-cache. У Nemotron 3 Super и Nano окно 128K, у Ultra — 512K. Заполнение всего окна может потребовать намного больше памяти, чем загрузка самих весов.

В предоставленной карточке NVIDIA не приводит числовые результаты Nemotron 3 Ultra, Super и Nano на MMLU, GPQA, AIME, GSM8K, HumanEval или SWE-bench. Поэтому приписывать моделям конкретные места в рейтингах неправильно. Заявление о flagship reasoning нужно проверять на математических задачах, научных вопросах уровня GPQA и задачах генерации и исправления кода в SWE-bench. Отдельно стоит оценить следование инструкциям, tool use и работу с длинным контекстом.

Для мультимодальных моделей к этому списку добавляются VQA, OCRBench и тесты на понимание документов. Для Nemotron 3.5 Content Safety нужны собственные confusion matrix по категориям нарушений, а не только средняя accuracy: пропуск нарушения и ошибочная блокировка имеют разную цену. Embedding-модель следует проверять на retrieval recall, nDCG и качестве конечного RAG-ответа. Высокий результат на абстрактном embedding-бенчмарке не гарантирует хорошего поиска по русскоязычной базе.

В сравнении с закрытыми моделями OpenAI, Anthropic или Google NVIDIA делает ставку на контроль над весами, аппаратную оптимизацию и самостоятельное развёртывание. В сравнении с открытыми семействами Meta Llama, Qwen и DeepSeek решающими факторами будут качество постобучения, лицензия, поддержка русского языка и стоимость GPU. У NVIDIA есть сильное преимущество в интеграции с собственным железом, но одновременно возникает зависимость от CUDA и Blackwell, если нужна максимальная эффективность.

Цены и варианты доступа

Самая прозрачная цена в текущем наборе данных относится к Nemotron 3 Ultra 550B: $0,50 за миллион входных и $2,20 за миллион выходных токенов через OpenRouter. Nano 9B V2 на DeepInfra стоит $0,04 / $0,16, а Nano 12B V2 VL — $0,20 / $0,60. Тариф Super около $0,10 / $0,40 является оценкой. Цены Nano 30B, Nano Omni, Content Safety и Embed 1B пока не подтверждены.

Прямое сравнение тарифов требует учитывать направление токенов. У reasoning-моделей вход часто дешевле выхода, но модель может генерировать длинные цепочки рассуждений. Для RAG-системы с большими документами основную часть счёта формирует input. Для программного агента с последовательными действиями важнее output и число вызовов. Кэширование префиксов, ограничение максимального ответа и маршрутизация простых запросов на Nano обычно дают больший эффект, чем выбор между близкими тарифами.

Для самостоятельного запуска доступны веса Nemotron 3 на Hugging Face в BF16 и FP8. Это вариант для компаний с собственными GPU-серверами, требованиями к приватности или большим стабильным трафиком. Небольшим командам удобнее API, playground NVIDIA build.nvidia.com или агрегаторы, где не нужно самостоятельно настраивать распределённый inference.

Доступ к NVIDIA в России через STIVA.ai

Российским пользователям не обязательно самостоятельно разбираться с зарубежными платёжными инструментами и маршрутизацией запросов. Модели NVIDIA доступны в России через STIVA.ai. На площадке можно выбрать сценарий — от компактных текстовых моделей до тяжёлых reasoning-вариантов Nemotron, если конкретная модель входит в текущий каталог.

STIVA предлагает тарифы от 495 ₽ в месяц, принимает оплату картами «Мир» и через СБП. VPN для работы не нужен. Это не отменяет различий между моделями: для анализа кода и сложных инструкций подойдут Super или Ultra. Для массового недорогого текста — Nano 9B V2 или Nano 30B. Для изображений — Nano 12B V2 VL и другие мультимодальные варианты.

Перед началом работы полезно проверить лимиты выбранного тарифа, доступное контекстное окно, ограничения на размер файла и правила обработки данных. Для экспериментов подойдёт страница NVIDIA на STIVA, а полный список доступных ИИ-инструментов опубликован на главной странице STIVA.ai. Пользователи, которые подключают сервис для команды или собственного проекта, могут изучить партнёрскую программу STIVA.

FAQ

Что такое Nemotron 3 Ultra 550B — обычная большая LLM или MoE?

Это reasoning-модель с hybrid latent MoE-архитектурой. В ней около 500 млрд параметров, но на одном токене активируется примерно 50 млрд. Контекстное окно составляет 512K токенов. Модель рассчитана на сложные задачи рассуждения, длинные документы и программирование. Она также подходит для агентных сценариев.

Можно ли запустить модели NVIDIA локально?

Да. Для Nemotron 3 заявлены open weights, доступные на Hugging Face в форматах BF16 и FP8. Однако Ultra и Super требуют серьёзной инфраструктуры: нужно учитывать память под веса, KV-cache, распределение экспертов и совместимость inference-движка с MoE и NVFP4. Nano-модели значительно реалистичнее для локального запуска.

Какая модель NVIDIA лучше для недорогих запросов?

Для текстовых задач с небольшим бюджетом логично начать с Nemotron Nano 9B V2: её тариф на DeepInfra составляет $0,04 за миллион входных и $0,16 за миллион выходных токенов. Если нужна более сложная логика, стоит протестировать Nemotron 3 Nano 30B. Для задач уровня reasoning подойдёт Nemotron 3 Super 120B. Выбор лучше делать по собственному набору запросов, а не только по числу параметров.

Где пользоваться NVIDIA в России?

Модели провайдера доступны через STIVA.ai. Сервис предлагает тарифы от 495 ₽ в месяц, поддерживает оплату «Мир» и СБП и работает без VPN. Конкретный набор Nemotron и лимиты зависят от актуального каталога и выбранного тарифа.

NVIDIA строит не просто линейку языковых моделей, а связку «GPU — runtime — открытые веса — API». Nemotron 3 Ultra и Super интересны масштабом и разреженной архитектурой. Nano делает линейку практичнее, а Content Safety, Embed и Parakeet добавляют отдельные компоненты для полноценной AI-платформы.

Сэм Альтман

Руководитель OpenAI. Пишу тут для души.

Оцените автора
LeDigital