ElevenLabs: обзор провайдера нейросетей, модели и цены 2026

Экспертный обзор ElevenLabs: модели, характеристики, бенчмарки, цены. Доступ в России через STIVA.ai — без VPN.

За четыре года ElevenLabs прошла путь от стартапа с одной технологией синтеза речи до аудиоплатформы. Компания начинала с генерации естественной речи и клонирования голосов. К августу 2026 года она продаёт целый набор инструментов для работы со звуком: text-to-speech, speech-to-text, дубляж, звуковые эффекты, музыку, преобразование голоса и голосовых агентов.

Рынок отреагировал на эту экспансию однозначно. 4 февраля 2026 года ElevenLabs привлекла $500 млн в раунде Series D при оценке $11 млрд. Раунд возглавила Sequoia Capital. Общий объём привлечённых средств достиг $781 млн. Для компании, основанной в 2022 году, это необычно быстрый рост: в январе 2024-го ElevenLabs оценивалась в $1,1 млрд, а в январе 2025-го — уже в $3,3 млрд.

Но высокая оценка объясняется не только качеством синтеза. ElevenLabs строит вертикальную платформу. Один и тот же голос можно использовать для озвучки текста, диалога с пользователем, дубляжа видео или создания аудиоконтента. Поэтому компания конкурирует не только с PlayHT и WellSaid Labs, но и с более крупными платформами — Google Cloud, Microsoft Azure, Amazon и OpenAI.

История и эволюция ElevenLabs

Компания появилась в 2022 году. Её основали польские предприниматели Пётр Домбковский (Piotr Dąbkowski), бывший инженер Google по машинному обучению, и Мати Станишевский (Mati Staniszewski), ранее работавший в Palantir стратегом по внедрению продуктов. Штаб-квартира ElevenLabs связана с Лондоном и Нью-Йорком: юридически компания зарегистрирована в Нью-Йорке, а операционная деятельность ведётся из Лондона.

Изначально ElevenLabs занималась синтезом речи, которая звучит не как дикторская запись, а как живая человеческая речь. В ранних генераторах TTS проблема обычно заключалась не в разборчивости слов, а в просодии. Модель правильно произносила фразу, но не всегда умела убедительно расставлять паузы, менять интонацию и передавать эмоциональный контекст. ElevenLabs сосредоточилась именно на этих задачах.

Отдельным направлением стало клонирование голоса. Instant Voice Clone позволяет быстро получить рабочую копию голоса по короткому образцу. Professional Voice Clone рассчитан на более точное воспроизведение тембра, артикуляции и характерной манеры речи. Функция нашла применение в озвучке видео, подкастах, играх, электронном обучении и локализации контента.

В июне 2023 года компания привлекла $19 млн в Series A при оценке около $100 млн. В январе 2024-го последовал раунд Series B на $80 млн, после которого ElevenLabs получила статус единорога с оценкой $1,1 млрд. В январе 2025 года a16z и ICONIQ Growth вложили ещё $180 млн в Series C, подняв оценку до $3,3 млрд.

Следующий этап был связан с масштабированием бизнеса. В сентябре 2025 года инвесторы получили возможность продать доли через tender offer при оценке $6,6 млрд. К концу 2025 года годовой регулярный доход компании, ARR, превысил $330 млн. В феврале 2026-го оценка выросла более чем втрое за год — до $11 млрд.

Среди инвесторов ElevenLabs — Sequoia Capital, Andreessen Horowitz (a16z), ICONIQ Growth, NEA, SV Angel, Nat Friedman и Daniel Gross. В числе инвесторов также Майк Кригер из Instagram, Брендан Айриб из Oculus, Deutsche Telekom и LG Technology Ventures. Такой список показывает, что компанию рассматривают не только как разработчика голосового API, но и как поставщика инфраструктуры для медиа, коммуникаций и потребительских приложений.

Продуктовая линейка расширялась поэтапно. После TTS появились Voice Changer и Voice Isolator. Затем компания выпустила инструменты дубляжа и Studio. В январе 2026 года ElevenLabs представила Scribe v2 для распознавания речи, а в мае — Music v2 и Dubbing v2. Параллельно компания развивает ElevenAgents — голосовых агентов, способных вести разговор с пользователем в реальном времени. Ещё одно направление — ElevenCreative с инструментами для создания аудиоконтента.

Ключевые модели и продукты

Продукт Тип Релиз Цена Что умеет
Eleven v3 TTS Июнь 2025: alpha, затем GA После акции — уровень Multilingual v2 70+ языков, выразительная просодия, audio tags, диалоги с несколькими спикерами
Eleven Turbo v2.5 Низколатентный TTS 2024–2025 Стандартные тарифы Баланс качества и скорости, подходит для разговорных приложений
Flash Сверхбыстрый TTS 2024–2025 Стандартные тарифы Задержка менее секунды, сценарии real-time и voice agents
Voice Changer Speech-to-Speech Доступен в Studio и API 1000 credits за минуту Перенос речи в другой голос с сохранением содержания и характеристик исполнения
Voice Isolator Обработка аудио Актуальная версия платформы Зависит от тарифа Выделение голоса и очистка записи от фонового шума
SFX v2 Генерация звуковых эффектов 2025 200 credits за генерацию Создание royalty-free эффектов по текстовому описанию
Music v2 Генерация музыки Май 2026 900 credits за минуту Создание музыкальных фрагментов и фоновых композиций
Scribe v2 Speech-to-Text Январь 2026 330 credits за минуту Транскрипция более чем на 99 языках
Scribe v2 Realtime Потоковый STT Ноябрь 2025 Публичная цена не подтверждена Транскрипция аудио в реальном времени
Dubbing v2 Автоматический дубляж Май 2026 2000–10 000 credits за минуту Перевод и озвучка видео с сохранением структуры диалогов

Eleven v3: ставка на выразительность

Eleven v3 — главная TTS-модель компании. Её ранняя alpha-версия вышла в июне 2025 года, после чего модель перешла в общий доступ. В отличие от низколатентных Turbo и Flash, v3 ориентирована прежде всего на качество исполнения и эмоциональную выразительность.

Модель поддерживает более 70 языков и специальные текстовые маркеры, например [whispers], [sighs] и [laughs]. Они задают не только содержание реплики, но и способ её произнесения. В многофразовых сценариях можно описывать диалог нескольких персонажей и назначать им разные голоса.

Это полезно для аудиокниг и игр. Модель также подходит для рекламных роликов и драматизированных подкастов. Однако audio tags не превращают её в полноценного актёра: результат зависит от языка, длины фрагмента и точности промпта. Для серийного производства всё равно нужны прослушивание и монтаж удачных генераций.

При запуске v3 действовала скидка 80% до конца июня 2025 года. После завершения акции модель стала тарифицироваться на уровне Multilingual v2. На практике v3 выбирают ради выразительности, а не минимальной задержки или самой низкой стоимости.

Turbo v2.5 и Flash

Turbo v2.5 занимает промежуточное положение между студийным синтезом и real-time-генерацией. Она предназначена для приложений, где ответ должен появляться быстро, но речь при этом должна оставаться естественной. Модель подходит для интерактивных персонажей и голосовых интерфейсов. Её также можно использовать в учебных сервисах и клиентской поддержке.

Flash сильнее оптимизирована под скорость. ElevenLabs заявляет задержку менее секунды, поэтому модель используют как основу для ElevenAgents и других разговорных сценариев. У такой скорости есть обратная сторона: сложная эмоциональная подача и длинные выразительные фрагменты лучше удаются Eleven v3.

Распознавание, дубляж и генеративный звук

Scribe v2 расширила платформу в сторону распознавания речи. Модель поддерживает более 99 языков и тарифицируется из расчёта 330 credits за минуту. Версия Scribe v2 Realtime, представленная в ноябре 2025 года, добавляет потоковую транскрипцию. Публичная цена realtime-режима на август 2026 года не подтверждена.

Dubbing v2 превращает ElevenLabs из поставщика отдельных голосов в инструмент локализации. Сервис переводит видео, озвучивает его на другом языке и старается сохранить распределение реплик между персонажами. Стоимость составляет от 2000 до 10 000 credits за минуту. Диапазон зависит от сценария и выбранного режима обработки.

Music v2, выпущенная в мае 2026 года, отвечает за генерацию музыки и стоит 900 credits за минуту. SFX v2 создаёт отдельные звуковые эффекты по описанию: шаги, удары, шумы окружения или механические звуки. Для SFX заявлена royalty-free модель использования, но условия лицензии всё равно нужно проверить перед коммерческим выпуском.

Технические детали: архитектура, задержка и ограничения

ElevenLabs не раскрывает полный состав архитектуры своих моделей и не публикует исчерпывающие спецификации по числу параметров, размеру скрытых представлений или обучающему корпусу. Поэтому сравнивать v3 с текстовыми LLM по параметрам или классическим «контекстным окнам» некорректно.

Для TTS контекст — это не только максимальное число токенов во входном тексте. На качество влияют длина непрерывного фрагмента, доступная история диалога, разметка ролей и особенности конкретного языка. Значение также зависит от способа сегментации текста. ElevenLabs не заявляет единого публичного значения контекстного окна в токенах для Eleven v3, Turbo v2.5 или Flash. На практике длинный материал обычно разбивают на сцены или абзацы, чтобы контролировать произношение, паузы и стабильность голоса.

У Scribe v2 ситуация иная: для STT важны длина загружаемого аудио, потоковая обработка и качество временных меток. Компания сообщает поддержку более 99 языков, но не предоставляет единую таблицу с одинаковыми метриками WER для каждого языка и типа записи.

Публичного независимого бенчмарка, который сравнивал бы Eleven v3, Google Cloud TTS, Azure Neural Voices, OpenAI TTS, PlayHT и Cartesia на одном наборе текстов, пока нет. Заявление о «самой выразительной» модели следует трактовать как позицию ElevenLabs, а не как результат общепринятого отраслевого теста. Для синтеза речи стандартные метрики вроде MOS полезны, но плохо описывают эмоции, шёпот, смех и персонажные голоса. То же касается длинных диалогов.

Корректнее разделять продукты по режимам:

  • Eleven v3 — максимальная выразительность и управление манерой речи;
  • Turbo v2.5 — компромисс между качеством и задержкой;
  • Flash — sub-second latency для интерактивных приложений;
  • Voice Changer — преобразование уже записанного исполнения, а не генерация речи из текста;
  • Scribe v2 — распознавание речи, дополняющее TTS-часть платформы.

Voice Changer особенно интересен для продакшена. В обычном TTS пользователь управляет текстом, но теряет часть актёрской подачи. Speech-to-Speech сохраняет темп, паузы и эмоциональное исполнение исходного диктора, меняя тембр и идентичность голоса. Это удобно для персонажной озвучки и локализации. При этом к исходному аудио предъявляются более высокие требования.

Техническое преимущество ElevenLabs — не отдельная модель, а связка API, Studio, клонирования и постобработки. Studio помогает собирать длинные проекты. Voice Isolator очищает исходные записи, а Voice Changer переносит исполнение. Dubbing Studio автоматизирует локализацию. Конкуренты с сильными облачными API часто предлагают широкий выбор голосов, но не всегда объединяют столько творческих инструментов в одном интерфейсе.

При этом у ElevenLabs есть системные риски. Клонирование голоса требует контроля согласия и прав на образец. Для медиакомпаний критичны лицензирование, удаление спорного контента и маркировка синтетической речи. Чем ближе генерация к реальному голосу человека, тем важнее проверить источник данных и условия использования.

Цены и доступность

ElevenLabs использует подписку и внутреннюю систему credits. Точный расход зависит от продукта: TTS обычно считают по объёму текста или символам, а отдельные инструменты имеют собственные расценки за минуту или генерацию. Для SFX v2 указана стоимость 200 credits за генерацию. Voice Changer стоит 1000 credits за минуту, Music v2 — 900 credits за минуту, а Scribe v2 — 330 credits за минуту.

Тариф Цена в месяц Ориентировочный объём TTS Клонирование Качество
Free $0 Около 10 минут Нет 128 кбит/с
Starter $5–6 Около 30 минут Instant Clone 128 кбит/с
Creator $22 Около 121 минуты Professional Clone 128 кбит/с
Pro $99 Около 600 минут 1 Professional Clone 192 кбит/с
Scale $299 Около 1800 минут 3 Professional Clones 192 кбит/с
Business $1320 Около 6000 минут 10 Professional Clones 192 кбит/с, SLA
Enterprise Индивидуально Индивидуально Индивидуально Индивидуально

Free подходит для тестирования голосов и API, но не для регулярного коммерческого производства. Starter рассчитан на небольшие объёмы и даёт Instant Voice Clone. Creator — наиболее доступный тариф с Professional Voice Clone. Pro и Scale предназначены для команд, которым нужно несколько постоянных голосов и более высокое качество вывода. Business добавляет SLA и увеличивает квоту.

На фоне облачных TTS-сервисов ElevenLabs дороже, если считать только синтез символов. Но сравнение по стоимости минуты не учитывает Studio, клонирование, дубляж, Voice Changer и инструменты редактирования. Для разработчика, которому нужен только недорогой нейтральный голос, Google, Azure или Amazon могут оказаться выгоднее. Для производства контента с выразительной подачей ElevenLabs часто сокращает время на монтаж и работу с дикторами.

Доступ в России через STIVA.ai

Пользователи из России могут получить доступ к моделям ElevenLabs через страницу провайдера ElevenLabs на STIVA.ai. Это вариант для тех, кому нужен единый интерфейс доступа к генерации речи и другим ИИ-инструментам без самостоятельного подключения зарубежной банковской карты или инфраструктуры.

Тарифы STIVA.ai начинаются от 495 ₽ в месяц. Оплата доступна картами «МИР» и через СБП, VPN не требуется. Перед началом работы стоит проверить, какие именно модели и функции включены в выбранный пакет. TTS, клонирование, транскрипция, SFX, музыка и дубляж расходуют credits по-разному.

Основной каталог доступен на STIVA.ai. Для авторов, которые приводят новых пользователей, действует партнёрская программа STIVA.ai. Такой способ доступа удобен для фрилансеров и студий озвучки. Он также подходит разработчикам ботов и небольшим медиакомандам, которым не нужен отдельный корпоративный контракт с ElevenLabs.

Перспективы компании

ElevenLabs уже вышла за рамки рынка «озвучки текста». Следующая точка конкуренции — разговорные агенты, которые не просто синтезируют реплику, а ведут диалог с учётом контекста, перебиваний и задержек. Здесь компании приходится конкурировать с платформами, сильными в языковых моделях и инфраструктуре real-time: OpenAI, Google, Microsoft, Cartesia и специализированными разработчиками voice AI.

Сильная сторона ElevenLabs — качество голоса и накопленная экосистема. Слабая — сложность контроля: чем больше инструментов объединено в одной платформе, тем труднее обеспечить предсказуемость лицензий, расходов и качества на разных языках. Успех ElevenAgents и Dubbing v2 будет зависеть от естественности речи. Не менее важны стабильность API, задержка, управление диалогом и защита от злоупотреблений клонированием.

В марте 2026 года компания объявила о планах вложить $1 млрд в технологию восстановления голоса для 1 млн людей, потерявших голос. Это направление может стать одним из самых значимых применений синтеза речи. Здесь ценность определяется не выразительностью рекламного ролика, а точностью персонализации, медицинской безопасностью и возможностью сохранить индивидуальный тембр пользователя.

FAQ

Что выбрать: Eleven v3, Turbo v2.5 или Flash?

Eleven v3 подходит для аудиокниг, игр, рекламы и диалогов, где важны эмоции и выразительная интонация. Turbo v2.5 лучше использовать в интерактивных приложениях с требованиями к скорости. Flash предназначена для голосовых агентов и других real-time-сценариев, где задержка менее секунды важнее максимальной актёрской подачи.

Можно ли клонировать голос человека?

Да. Instant Voice Clone доступен начиная с тарифа Starter, а Professional Voice Clone — с Creator. Использовать следует только собственный голос либо запись, на которую получено явное согласие владельца. Для коммерческого проекта нужно дополнительно проверить права на распространение и условия лицензии.

Есть ли у ElevenLabs публичные данные о контекстном окне и бенчмарках?

Единого официального значения контекстного окна в токенах для Eleven v3, Turbo v2.5 и Flash публично не заявлено. Также нет общепринятого независимого бенчмарка, который полностью сравнивал бы выразительность этих моделей с конкурентами. Поэтому качество лучше оценивать на собственных текстах, особенно если проект связан с диалогами, редкими именами и несколькими языками.

Как пользоваться ElevenLabs в России?

Доступ к моделям провайдера можно оформить через STIVA.ai. Тарифы начинаются от 495 ₽ в месяц, доступны оплата картой «МИР» и СБП, VPN не нужен. Перед оплатой стоит сопоставить объём генерации с расходом credits конкретного инструмента.

ElevenLabs сильна там, где синтетический голос должен не просто произнести текст, а сыграть его. Компания постепенно превращает эту экспертизу в аудиоплатформу: от расшифровки до дубляжа, голосовых агентов и восстановления речи.

Сэм Альтман

Руководитель OpenAI. Пишу тут для души.

Оцените автора
LeDigital