
fish-s2.1-proO Fish Audio S2.1 Pro é um modelo de texto para fala que cobre 83 idiomas a partir de um único identificador, e o que o distingue nesta plataforma é que clonar uma voz não custa nada: você envia uma amostra limpa de pelo menos dez segundos, recebe um identificador de voz em menos de vinte segundos e o passa como reference_id em cada pedido seguinte. Criamos três clones seguidos durante as medições e todos foram cobrados a zero; o fornecedor não documenta qualquer limite de vozes por conta. A saída vem em mp3, wav, pcm ou opus, com velocidade ajustável entre 0.5 e 2.0. O único ponto a planear é a unidade de cobrança: este modelo é cobrado por 1000 bytes UTF-8 de texto de entrada, e não por 1000 caracteres como os outros modelos de voz daqui, e um caractere chinês ocupa três bytes contra um de uma letra latina. Mil caracteres em inglês custam $0.03; mil caracteres em chinês são três mil bytes e custam $0.09. Faça o orçamento por bytes, não por contagem de caracteres.
Unlimited voice slots; a clone trains in under 20 seconds and is usable immediately
Not per character — Chinese text costs three times Latin text of the same length
No per-language endpoint or premium for non-English speech
fish-s2.1-pro for production; fish-s2.1-pro-free at a sixth of the price, slower and without guarantees
Fish Audio S2.1 Pro é uma API de áudio e voz da Fish Audio. O Fish Audio S2.1 Pro é um modelo de texto para fala que cobre 83 idiomas a partir de um único identificador, e o que o distingue nesta plataforma é que clonar uma voz não custa nada: você envia uma amostra limpa de pelo menos dez segundos, recebe um identificador de voz em menos de vinte segundos e o passa como reference_id em cada pedido seguinte. Criamos três clones seguidos durante as medições e todos foram cobrados a zero; o fornecedor não documenta qualquer limite de vozes por conta. A saída vem em mp3, wav, pcm ou opus, com velocidade ajustável entre 0.5 e 2.0. O único ponto a planear é a unidade de cobrança: este modelo é cobrado por 1000 bytes UTF-8 de texto de entrada, e não por 1000 caracteres como os outros modelos de voz daqui, e um caractere chinês ocupa três bytes contra um de uma letra latina. Mil caracteres em inglês custam $0.03; mil caracteres em chinês são três mil bytes e custam $0.09. Faça o orçamento por bytes, não por contagem de caracteres. Pela plataforma APIMODELS, você acessa este modelo por uma API unificada com preços transparentes de pagamento por uso. Preço atual: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005.
Gere locuções de nível profissional para vídeos, animações e anúncios, com vozes variadas.
Produza rapidamente o áudio do seu podcast, com suporte a diálogos de vários personagens.
Converta texto em voz natural e fluida para produzir audiolivros.
Dublagem e tradução multilíngue com IA para alcançar audiências globais.
O Fish Audio S2.1 Pro está disponível pela APIMODELS a: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005. A cobrança é por uso — você paga apenas pelo que gera.
Cadastre-se na APIMODELS, obtenha sua chave de API e chame nosso endpoint unificado. Oferecemos documentação detalhada com exemplos em cURL, Python e Node.js.
A APIMODELS oferece o mesmo modelo Fish Audio S2.1 Pro pela nossa plataforma de agregação. Fornecemos uma interface de API unificada, então você não precisa de contas separadas por provedor: uma única chave para acessar todos os modelos.
Because that is how the upstream model charges, and passing the same unit through keeps the two sides from drifting. A Latin letter is one UTF-8 byte, a Chinese character is three, and an emoji is four. So 1,000 English characters is 1,000 bytes and costs $0.03, while 1,000 Chinese characters is 3,000 bytes and costs $0.09. Every other speech model on apimodels.app bills per 1,000 characters, so if you are switching from one of those, re-estimate CJK workloads on bytes rather than assuming the character count carries over.
No. Cloning is free and we found no cap on how many voices an account can hold. We created three clone slots back to back while measuring and each one was billed at zero. Send a clean sample of at least ten seconds, get a voice id back in roughly five to twenty seconds, then pass that id as reference_id on any later synthesis request. You only pay for the speech you generate afterwards, at the normal per-byte rate.
Use the free tier (model id fish-s2.1-pro-free) to audition voices and build prototypes, and the standard tier for anything a user waits on. They run the same model, so quality is identical, but the free tier is best-effort: the same 2,000-byte passage took 41 seconds there against 17 seconds on the standard tier in our measurement. The free tier also carries no data agreement, meaning the provider may use those requests to improve their models, and its low price has a published end date that has already moved four times.
Na APIMODELS, o Fish Audio S2.1 Pro roda junto com mais de 60 modelos usando uma única chave de API e um único saldo, então escolher é questão de adequação, não de dependência. Ele suporta 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0 e você pode avaliá-lo em preço e capacidade frente a outros modelos de áudio e voz, trocando ao alterar uma única string com o nome do modelo — sem nova conta ou integração. Veja todas as opções de áudio e voz com preços ao vivo em apimodels.app/models.
O Fish Audio S2.1 Pro suporta: 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0. Consulte a documentação da APIMODELS para todos os parâmetros e exemplos de chamada.
Sim. A APIMODELS expõe o Fish Audio S2.1 Pro por uma única API unificada e uma só chave, sem contas separadas por provedor e sem precisar lidar com o acesso de rede regional de cada provedor.
Aceitamos Stripe (Visa, Mastercard e outros cartões internacionais) e Alipay. O saldo fica disponível imediatamente após o pagamento.