
fish-s2.1-proFish Audio S2.1 Pro — модель синтеза речи, которая покрывает 83 языка одним идентификатором модели, а её главное преимущество здесь в том, что клонирование голоса ничего не стоит: вы отправляете чистый образец от десяти секунд, меньше чем за двадцать секунд получаете идентификатор голоса и дальше передаёте его как reference_id в каждом запросе. Мы подряд создали три клона при замерах, и за все три списалось ноль, а провайдер не документирует никакого лимита на количество голосов в аккаунте. Вывод приходит в mp3, wav, pcm или opus, скорость регулируется от 0.5 до 2.0. Единственное, что нужно учесть заранее, — единица тарификации: эта модель считается за 1000 UTF-8 байт входного текста, а не за 1000 символов, как остальные речевые модели здесь, и китайский иероглиф весит три байта против одного у латинской буквы. Тысяча английских символов стоит $0.03, тысяча китайских — это три тысячи байт и $0.09. Считайте бюджет по байтам, а не по количеству знаков.
Unlimited voice slots; a clone trains in under 20 seconds and is usable immediately
Not per character — Chinese text costs three times Latin text of the same length
No per-language endpoint or premium for non-English speech
fish-s2.1-pro for production; fish-s2.1-pro-free at a sixth of the price, slower and without guarantees
Fish Audio S2.1 Pro — это API категории «аудио и речь» от Fish Audio. Fish Audio S2.1 Pro — модель синтеза речи, которая покрывает 83 языка одним идентификатором модели, а её главное преимущество здесь в том, что клонирование голоса ничего не стоит: вы отправляете чистый образец от десяти секунд, меньше чем за двадцать секунд получаете идентификатор голоса и дальше передаёте его как reference_id в каждом запросе. Мы подряд создали три клона при замерах, и за все три списалось ноль, а провайдер не документирует никакого лимита на количество голосов в аккаунте. Вывод приходит в mp3, wav, pcm или opus, скорость регулируется от 0.5 до 2.0. Единственное, что нужно учесть заранее, — единица тарификации: эта модель считается за 1000 UTF-8 байт входного текста, а не за 1000 символов, как остальные речевые модели здесь, и китайский иероглиф весит три байта против одного у латинской буквы. Тысяча английских символов стоит $0.03, тысяча китайских — это три тысячи байт и $0.09. Считайте бюджет по байтам, а не по количеству знаков. Через платформу APIMODELS доступ к этой модели идёт по единому API с прозрачной оплатой по факту использования. Текущая цена: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005.
Профессиональная озвучка для видео, анимации и рекламы с большим выбором голосов.
Быстро собрать аудио для подкаста, в том числе с диалогом нескольких говорящих.
Превратить текст в естественную, связную речь для выпуска аудиокниг.
Дубляж и перевод на разные языки, чтобы контент дошёл до аудитории по всему миру.
Fish Audio S2.1 Pro доступна через APIMODELS по цене: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005. Оплата идёт по факту использования — вы платите только за то, что сгенерировали.
Зарегистрируйтесь на APIMODELS, получите API-ключ и обращайтесь к нашему единому эндпоинту. Есть подробная документация с примерами на cURL, Python и Node.js.
APIMODELS отдаёт ту же самую модель Fish Audio S2.1 Pro через свою агрегирующую платформу. Мы предоставляем единый интерфейс API, поэтому отдельные аккаунты у каждого поставщика не нужны — один ключ открывает доступ ко всем моделям.
Because that is how the upstream model charges, and passing the same unit through keeps the two sides from drifting. A Latin letter is one UTF-8 byte, a Chinese character is three, and an emoji is four. So 1,000 English characters is 1,000 bytes and costs $0.03, while 1,000 Chinese characters is 3,000 bytes and costs $0.09. Every other speech model on apimodels.app bills per 1,000 characters, so if you are switching from one of those, re-estimate CJK workloads on bytes rather than assuming the character count carries over.
No. Cloning is free and we found no cap on how many voices an account can hold. We created three clone slots back to back while measuring and each one was billed at zero. Send a clean sample of at least ten seconds, get a voice id back in roughly five to twenty seconds, then pass that id as reference_id on any later synthesis request. You only pay for the speech you generate afterwards, at the normal per-byte rate.
Use the free tier (model id fish-s2.1-pro-free) to audition voices and build prototypes, and the standard tier for anything a user waits on. They run the same model, so quality is identical, but the free tier is best-effort: the same 2,000-byte passage took 41 seconds there against 17 seconds on the standard tier in our measurement. The free tier also carries no data agreement, meaning the provider may use those requests to improve their models, and its low price has a published end date that has already moved four times.
В APIMODELS Fish Audio S2.1 Pro соседствует более чем с 60 моделями под одним API-ключом и общим балансом, поэтому выбор — это вопрос соответствия задаче, а не привязки к поставщику. Модель поддерживает 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0; вы можете сравнить её по цене и возможностям с другими моделями категории «аудио и речь» и переключиться, изменив одну строку с именем модели — без нового аккаунта и без переписывания интеграции. Все варианты категории «аудио и речь» с актуальными ценами — на apimodels.app/models.
Fish Audio S2.1 Pro поддерживает: 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0. Полный список параметров и примеры вызовов — в документации APIMODELS.
Да. APIMODELS отдаёт Fish Audio S2.1 Pro через единый API и один ключ — отдельные аккаунты у каждого поставщика не нужны, и вам не приходится самостоятельно решать вопросы регионального сетевого доступа к каждому из них.
Принимаем Stripe (Visa, Mastercard и другие международные карты) и Alipay. Баланс становится доступен сразу после оплаты.