
fish-s2.1-proFish Audio S2.1 Pro es un modelo de texto a voz que cubre 83 idiomas desde un único identificador, y lo que lo distingue en esta plataforma es que clonar una voz no cuesta nada: envías una muestra limpia de al menos diez segundos, recibes un identificador de voz en menos de veinte segundos y lo pasas como reference_id en cada petición posterior. Creamos tres clones seguidos durante las mediciones y los tres se cobraron a cero; el proveedor no documenta ningún límite de voces por cuenta. La salida llega en mp3, wav, pcm u opus, con velocidad ajustable entre 0.5 y 2.0. Lo único que conviene planificar es la unidad de facturación: este modelo se cobra por cada 1000 bytes UTF-8 de texto de entrada, no por cada 1000 caracteres como el resto de modelos de voz de aquí, y un carácter chino ocupa tres bytes frente a uno de una letra latina. Mil caracteres en inglés cuestan $0.03; mil caracteres en chino son tres mil bytes y cuestan $0.09. Presupuesta por bytes, no por recuento de caracteres.
Unlimited voice slots; a clone trains in under 20 seconds and is usable immediately
Not per character — Chinese text costs three times Latin text of the same length
No per-language endpoint or premium for non-English speech
fish-s2.1-pro for production; fish-s2.1-pro-free at a sixth of the price, slower and without guarantees
Fish Audio S2.1 Pro es una API de audio y voz de Fish Audio. Fish Audio S2.1 Pro es un modelo de texto a voz que cubre 83 idiomas desde un único identificador, y lo que lo distingue en esta plataforma es que clonar una voz no cuesta nada: envías una muestra limpia de al menos diez segundos, recibes un identificador de voz en menos de veinte segundos y lo pasas como reference_id en cada petición posterior. Creamos tres clones seguidos durante las mediciones y los tres se cobraron a cero; el proveedor no documenta ningún límite de voces por cuenta. La salida llega en mp3, wav, pcm u opus, con velocidad ajustable entre 0.5 y 2.0. Lo único que conviene planificar es la unidad de facturación: este modelo se cobra por cada 1000 bytes UTF-8 de texto de entrada, no por cada 1000 caracteres como el resto de modelos de voz de aquí, y un carácter chino ocupa tres bytes frente a uno de una letra latina. Mil caracteres en inglés cuestan $0.03; mil caracteres en chino son tres mil bytes y cuestan $0.09. Presupuesta por bytes, no por recuento de caracteres. A través de la plataforma APIMODELS puedes acceder a este modelo mediante una API unificada con precios de pago por uso transparentes. Precio actual: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005.
Genera locuciones de nivel profesional para videos, animaciones y anuncios, con voces variadas.
Produce rápidamente el audio de tu pódcast, con soporte para diálogos de varios personajes.
Convierte texto en voz natural y fluida para producir audiolibros.
Doblaje y traducción multilingüe con IA para que tu contenido llegue a audiencias globales.
Fish Audio S2.1 Pro está disponible a través de APIMODELS a: standard, per 1K UTF-8 bytes: $0.03, evaluation tier, per 1K UTF-8 bytes: $0.005. La facturación es de pago por uso: solo pagas por lo que generas.
Regístrate en APIMODELS, obtén tu clave API y llama a nuestro endpoint unificado. Ofrecemos documentación detallada con ejemplos en cURL, Python y Node.js.
APIMODELS ofrece el mismo modelo Fish Audio S2.1 Pro a través de nuestra plataforma de agregación. Proporcionamos una interfaz de API unificada, así que no necesitas cuentas separadas por proveedor: una sola clave para acceder a todos los modelos.
Because that is how the upstream model charges, and passing the same unit through keeps the two sides from drifting. A Latin letter is one UTF-8 byte, a Chinese character is three, and an emoji is four. So 1,000 English characters is 1,000 bytes and costs $0.03, while 1,000 Chinese characters is 3,000 bytes and costs $0.09. Every other speech model on apimodels.app bills per 1,000 characters, so if you are switching from one of those, re-estimate CJK workloads on bytes rather than assuming the character count carries over.
No. Cloning is free and we found no cap on how many voices an account can hold. We created three clone slots back to back while measuring and each one was billed at zero. Send a clean sample of at least ten seconds, get a voice id back in roughly five to twenty seconds, then pass that id as reference_id on any later synthesis request. You only pay for the speech you generate afterwards, at the normal per-byte rate.
Use the free tier (model id fish-s2.1-pro-free) to audition voices and build prototypes, and the standard tier for anything a user waits on. They run the same model, so quality is identical, but the free tier is best-effort: the same 2,000-byte passage took 41 seconds there against 17 seconds on the standard tier in our measurement. The free tier also carries no data agreement, meaning the provider may use those requests to improve their models, and its low price has a published end date that has already moved four times.
En APIMODELS, Fish Audio S2.1 Pro convive con más de 60 modelos bajo una sola clave API y un solo saldo, así que elegir es cuestión de ajuste, no de dependencia. Admite 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0 y puedes valorarlo en precio y capacidad frente a otros modelos de audio y voz, y cambiar modificando una sola cadena con el nombre del modelo: sin nueva cuenta ni integración. Explora todas las opciones de audio y voz con precios en vivo en apimodels.app/models.
Fish Audio S2.1 Pro admite: 83 Languages, Free Voice Cloning, mp3 / wav / pcm / opus, Speed 0.5-2.0. Consulta la documentación de APIMODELS para ver todos los parámetros y ejemplos de llamada.
Sí. APIMODELS expone Fish Audio S2.1 Pro mediante una única API unificada y una sola clave, sin cuentas separadas por proveedor ni necesidad de gestionar tú mismo el acceso de red regional de cada proveedor.
Aceptamos Stripe (Visa, Mastercard y otras tarjetas internacionales) y Alipay. El saldo está disponible al instante tras el pago.