- История и развитие Fish Audio
- Линейка моделей и продуктов
- S2.1 Pro
- S2
- S1
- Transcribe 1 и клонирование голоса
- Технические особенности: архитектура, контекст и качество
- Цены и доступность
- Доступ в России через STIVA.ai
- Итог
- FAQ
- Что такое Fish Audio?
- Какая модель Fish Audio лучше подходит для диалогов?
- Есть ли у Fish Audio бесплатный доступ?
- Как пользоваться Fish Audio в России?
Fish Audio: доступный voice AI с выразительной речью, клонированием голоса и API
Fish Audio разрабатывает голосовые нейросети и платформу для работы с речью: синтезирует текст, клонирует голоса и распознаёт аудио. В линейке провайдера есть мультиязычные модели TTS, решения для длинных диалогов с несколькими персонажами и API для интеграции в приложения. В 2026 году компания заметно выделяется на рынке: она открыла доступ к флагманской модели S2.1 Pro через бесплатный API-идентификатор s2.1-pro-free.
Позиционирование Fish Audio сформулировано довольно точно: «Priced like a startup, open like a community». Компания хочет сделать voice AI не дорогой демонстрационной технологией для крупных студий, а рабочим инструментом для разработчиков, небольших команд и независимых создателей контента. Её модели рассчитаны не только на чтение текста. Они передают интонацию, поддерживают несколько говорящих и позволяют управлять манерой речи в длинных сценариях.
Для российских пользователей Fish Audio интересна ещё и способом доступа. Модели провайдера доступны через страницу Fish Audio на STIVA.ai. Сервис работает в России, принимает оплату картами «МИР» и через СБП, не требует VPN, а тарифы начинаются от 495 ₽ в месяц.
История и развитие Fish Audio
Fish Audio развивалась как компания, сосредоточенная на голосовых интерфейсах, а не как универсальная лаборатория генеративного ИИ. Это существенно влияет на подход к продуктам. В TTS сегодня конкурируют не только качеством произношения. Не меньше значат умение соблюдать роль, менять интонацию, вести диалог и сохранять просодию в длинном тексте.
Первые продукты Fish Audio были рассчитаны на генерацию речи и клонирование голоса. Базовая модель Fish Audio S1 стала основой для API-сценариев, где от системы требовалась прежде всего стабильная генерация аудио. Позднее компания усложнила задачу: S2 получила мультиязычность, управляемую выразительность и поддержку нескольких голосов. Затем появилась S2.1 Pro — версия для длинных форм, многоходовых диалогов и работы с низкой задержкой.
Компания привлекла $52 млн seed-финансирования. Для голосового стартапа это существенный объём: разработка качественной TTS требует больших наборов аудиоданных и дорогостоящей инфраструктуры для обучения и обслуживания моделей. При этом Fish Audio не ограничилась закрытым корпоративным API. Доступность моделей и публикация технических материалов стали частью стратегии привлечения разработчиков.
Ключевым этапом стал выпуск технического отчёта S2. В нём модель описывается как мультиязычная, управляемая и выразительная TTS-система с ultra-low latency. Затем компания представила S2.1 Pro и в 2026 году открыла для неё бесплатный доступ через API. Так Fish Audio стала не только поставщиком коммерческого синтеза, но и удобной точкой входа для экспериментов с голосовыми моделями.
Линейка моделей и продуктов
| Модель или продукт | Тип | Цена | Основное назначение |
|---|---|---|---|
| S2.1 Pro | TTS | Бесплатно через API: s2.1-pro-free | Выразительный мультиязычный синтез, long-form, multi-speaker, multi-turn, низкая задержка |
| S2 | TTS | $15 за 1 млн UTF-8 bytes | Мультиязычная управляемая речь, выразительность и несколько говорящих |
| S1 | TTS | $15 за 1 млн UTF-8 bytes, около $0,36 за час | Базовый синтез речи для прикладных сценариев |
| Transcribe 1 | STT | $15 за 1 млн UTF-8 bytes | Транскрибация речи в текст |
| Voice Cloning | TTS | Зависит от сценария и тарифа | Создание синтетического голоса на основе образца |
S2.1 Pro
S2.1 Pro — флагманская модель Fish Audio на 2026 год. Её сильная сторона — не только естественное звучание отдельных фраз. Модель рассчитана на цельные голосовые фрагменты: аудиокниги, подкасты, сцены с несколькими персонажами, обучающие материалы и диалоговых агентов.
Поддержка long-form позволяет работать с длинными текстами без постоянного дробления сценария на короткие независимые предложения. Это снижает риск, что голос будет менять тембр, скорость и эмоциональный рисунок от одного фрагмента к другому. Режим multi-speaker предназначен для нескольких говорящих. Multi-turn поддерживает последовательный диалог, где реплики связаны с предыдущим контекстом.
Определение «мультимодальная» в описании Fish Audio стоит понимать в контексте голосовой платформы. S2.1 Pro работает не только как простой преобразователь строки в аудио, но и учитывает дополнительные признаки исполнения и структуру сценария. При этом публичные материалы не дают оснований считать её полноценной универсальной мультимодальной моделью уровня текст-изображение-аудио.
Ultra-low latency делает S2.1 Pro подходящей для интерактивных приложений. Это полезно в голосовых помощниках, игровых персонажах и сервисах автоматического обслуживания, где пользователь ждёт ответ почти сразу после своей реплики. Для аудиокниги задержка не столь критична, а в голосовом диалоге она напрямую влияет на ощущение естественности.
S2
S2 — более ранняя модель нового поколения. Она сочетает мультиязычность, управление характеристиками речи и поддержку нескольких говорящих. В сравнении с S1 это не просто улучшение произношения: S2 ориентирована на управление исполнением. Разработчик получает больше возможностей для сценариев, где важны не только слова, но и способ их произнесения.
Модель подходит для озвучки видео, диалоговых сцен, рекламных роликов и корпоративных материалов. Её тарификация — $15 за 1 млн UTF-8 bytes. Такая схема удобна для API-сервисов, но требует расчёта: стоимость зависит от объёма входного текста, а не от количества символов в привычном для пользователя смысле. Кириллические и другие многобайтные символы занимают больше UTF-8 bytes, чем латинские.
S1
Fish Audio S1 — базовая TTS-модель. Она подходит для задач, где не нужны сложная актёрская подача, несколько персонажей или длительное сохранение контекста. Это могут быть уведомления, короткие инструкции и стандартные голосовые сообщения.
Цена S1 также составляет $15 за 1 млн UTF-8 bytes; в карточке продукта приведён ориентир около $0,36 за час. Сравнивать эти значения напрямую не всегда корректно: час аудио зависит от скорости речи, пауз и плотности текста. Для бизнес-расчёта лучше ориентироваться на собственный объём текстов и фактическую длину сгенерированного аудио.
Transcribe 1 и клонирование голоса
Transcribe 1 решает обратную задачу — преобразует речь в текст. Это позволяет использовать Fish Audio не только для генерации аудио, но и для полного голосового контура: распознать запрос пользователя, обработать его в приложении и вернуть синтетический ответ.
Стоимость Transcribe 1 указана на уровне $15 за 1 млн UTF-8 bytes. Здесь нужно учитывать особенности биллинга конкретного API и формат входных данных. Для STT привычнее считать минуты или часы аудио, однако Fish Audio в представленной тарифной модели привязывает продукт к объёму текстового представления.
Voice Cloning создаёт голос на основе референсной записи. Технология подходит для персональных ассистентов, локализации роликов, игровых персонажей и медиаархивов. Но она требует контроля прав: запись должна принадлежать пользователю или использоваться с согласия владельца голоса. Техническая возможность клонирования не отменяет требований к согласию, маркировке синтетического контента и защите от имитации реальных людей.
Технические особенности: архитектура, контекст и качество
Fish Audio делает ставку на свойства, которые сложно одновременно реализовать в одной TTS-системе: выразительность, управляемость, длинный контекст и низкую задержку. В традиционном синтезе речи разработчик часто выбирает между качеством и скоростью. Быстрые модели хорошо работают на коротких фразах, но теряют эмоциональную целостность на длинных сценах. Выразительные модели дают более живую подачу, но могут быть медленнее и менее предсказуемыми.
S2 и S2.1 Pro описываются как мультиязычные модели. Для пользователя это означает возможность работать с несколькими языками в одной платформе, не создавая отдельный стек синтеза для каждого рынка. Однако мультиязычность не гарантирует одинаковое качество на всех языках. Для русского языка при тестировании нужно отдельно проверять ударения, имена собственные, сокращения, числительные и переключение между кириллицей и латиницей.
Поддержка multi-speaker требует от модели сохранять различия между персонажами. В простом TTS-сценарии достаточно выбрать один голос и передать текст. В многоактёрской сцене нужно связать реплики с конкретными голосовыми профилями, не допустить обмена тембрами и сохранить естественный ритм диалога. Fish Audio позиционирует S2 и S2.1 Pro для таких задач.
Под multi-turn обычно понимается последовательность ходов диалога, в которой генерация учитывает предыдущие реплики. Для голосового агента это важнее эффектной единичной фразы: модель должна корректно произносить короткие ответы, вопросы, уточнения и перебивки, не создавая впечатление набора несвязанных аудиоклипов.
Точные размеры контекстного окна S2 и S2.1 Pro в доступной карточке провайдера не указаны. Поэтому некорректно приписывать моделям конкретное число токенов или минут аудио. Fish Audio заявляет поддержку long-form и multi-turn, но это не то же самое, что опубликованное контекстное окно. Разработчику нужно проверить лимиты API, максимальный размер запроса и правила разбиения длинного текста в документации текущей версии.
С бенчмарками ситуация похожая. Технический отчёт S2 заявляет мультиязычность, управляемую выразительность и ultra-low latency, однако в доступных материалах нет численных результатов конкретных тестов, которые можно было бы корректно сопоставить с показателями конкурентов. Для TTS одной метрики всё равно недостаточно: оценки естественности, разборчивости и сходства голоса не всегда отражают качество диалога и устойчивость интонации в десятиминутном тексте.
Сравнивать Fish Audio лучше по сценариям. ElevenLabs остаётся сильным конкурентом в премиальном синтезе, voice design и инструментах для создателей контента. OpenAI, Google и другие крупные платформы выигрывают за счёт экосистемы и интеграции с универсальными моделями. Cartesia делает акцент на скорости и интерактивном голосе. Открытые проекты вроде XTTS дают больше контроля над локальным запуском, но требуют собственных GPU, настройки окружения и контроля качества.
Преимущество Fish Audio — сочетание выразительных функций, API-ориентированного продукта и относительно низкого ценового порога. Это не означает лидерства по каждому языку или задаче. Провайдер особенно интересен там, где нужно быстро собрать прототип или production-сервис с несколькими голосами, не переходя сразу к дорогому корпоративному контракту.
Цены и доступность
Для API Fish Audio указывает цену $15 за 1 млн UTF-8 bytes для S2, S1 и Transcribe 1. Через OpenRouter модели доступны по ставке $0,0001 за секунду; также указан тариф $15 за 1 млн UTF-8 bytes. OpenRouter удобен разработчикам, которые уже используют единый шлюз для нескольких AI-провайдеров, но прямой API Fish Audio может дать более точный контроль над голосовыми настройками.
В 2026 году S2.1 Pro доступна через API бесплатно под именем модели s2.1-pro-free. Бесплатный доступ удобен для тестирования качества, прототипирования и небольших приложений. Перед запуском коммерческого сервиса нужно проверить актуальные ограничения режима: лимиты запросов, очереди, квоты, допустимые сценарии использования и стабильность SLA.
| Тариф | Цена при помесячной оплате | Цена при оплате за год | Условия |
|---|---|---|---|
| Free Tier | $0 | — | Базовый доступ |
| Plus | $15 в месяц | $5,50 в месяц при годовой оплате, $66 в год | Экономия $114 в год относительно помесячной оплаты |
| Pro | $100 в месяц | $37,50 в месяц при годовой оплате, $450 в год | 2 000 000 кредитов в месяц, экономия $750 в год |
| Max | $999 в месяц | $749 в месяц при годовой оплате, $8 988 в год | Экономия $3 000 в год |
Тарифная сетка рассчитана на разную нагрузку. Free Tier подходит для знакомства с платформой. Plus рассчитан на индивидуальных пользователей и небольшие проекты. Pro с двумя миллионами кредитов в месяц подходит для регулярной генерации контента. Max предназначен для интенсивного использования, но его экономический смысл нужно считать по фактическому объёму аудио и правилам списания кредитов.
Доступ в России через STIVA.ai
В России Fish Audio можно использовать через STIVA.ai — каталог и точку доступа к моделям ИИ-провайдеров. Это практичный вариант для тех, кому не подходит самостоятельная оплата зарубежного API или настройка нескольких промежуточных шлюзов.
Тарифы STIVA.ai начинаются от 495 ₽ в месяц. Оплатить подписку можно картой «МИР» или через СБП, VPN не требуется. Пользователь получает доступ к моделям провайдера через русскоязычный интерфейс и может тестировать голосовые сценарии без самостоятельного решения вопросов с зарубежным биллингом.
STIVA.ai полезна и на этапе сравнения. Один и тот же текст можно прогнать через разные голосовые модели, проверить произношение русских имён, скорость генерации и устойчивость голоса на длинной сцене. Для команды это удобнее, чем создавать отдельные интеграции с каждым провайдером до выбора основной модели.
Тем, кто хочет рекомендовать сервис другим пользователям, доступна партнёрская программа STIVA.ai. Актуальные условия, лимиты и состав доступных моделей лучше проверять перед подключением: у AI-провайдеров меняются версии API, квоты и правила бесплатного использования.
Итог
Fish Audio — заметный игрок в сегменте voice AI, который сочетает качество студийного синтеза с доступным API для разработчиков. S1 закрывает базовые задачи, S2 добавляет управляемую выразительность и работу с несколькими говорящими, а S2.1 Pro рассчитана на длинные сценарии, многоходовые диалоги и интерактивные приложения.
Главный аргумент провайдера в 2026 году — бесплатный API-доступ к S2.1 Pro. Он снижает стоимость входа и позволяет проверять модель на собственных текстах, а не только по рекламному демо. Для production-интеграции нужно отдельно оценить лимиты, задержку, стабильность, поддержку русского языка, правила клонирования голоса и реальную стоимость на рабочем объёме.
В России самый простой путь к моделям Fish Audio — использовать STIVA.ai: тарифы от 495 ₽ в месяц, оплата картами «МИР» и через СБП, без VPN.
FAQ
Что такое Fish Audio?
Fish Audio — платформа голосового ИИ для синтеза речи, клонирования голоса и транскрибации аудио. Её основные модели TTS — S1, S2 и S2.1 Pro. Для распознавания речи используется Transcribe 1.
Какая модель Fish Audio лучше подходит для диалогов?
Для длинных диалогов с несколькими персонажами лучше всего подходит S2.1 Pro: она поддерживает long-form, multi-speaker и multi-turn, а также заявлена как модель с ultra-low latency. S2 подходит для похожих задач, если бесплатный режим S2.1 Pro недоступен или нужны другие условия API.
Есть ли у Fish Audio бесплатный доступ?
Да. В 2026 году S2.1 Pro доступна через API под идентификатором s2.1-pro-free. Кроме того, в тарифной сетке есть Free Tier. Перед коммерческим использованием нужно проверить актуальные квоты и ограничения бесплатного доступа.
Как пользоваться Fish Audio в России?
Модели доступны через STIVA.ai. Тарифы начинаются от 495 ₽ в месяц, поддерживаются карты «МИР» и СБП, VPN не нужен.




