digital-humanDigital Human trabaja con dos URL: en video_url pones un vídeo de la persona (mp4 o mov) y en audio_url la locución (mp3, wav o m4a, hasta 30 minutos), y recibes un mp4 con la boca sincronizada al audio. No es lo mismo que animar una foto fija: la luz, el movimiento, el fondo y el trabajo de cámara salen de tu propio material y el modelo solo reanima la boca, de modo que en el resultado sigue apareciendo la misma persona del mismo rodaje y no un retrato forzado a moverse. La duración siempre sigue al audio: si la locución es más larga que el vídeo, el metraje se extiende automáticamente (comprobado con una locución de 6,2 segundos sobre un clip de 5 segundos), y por eso la factura se calcula directamente sobre los segundos de audio: $0.01 por segundo, es decir $0.60 por una locución de 60 segundos, exactamente la mitad que el lip-sync sobre imagen de ai-lipsync ($0.02/s). Si no tienes vídeo y solo dispones de un retrato, lo que necesitas es precisamente ai-lipsync. La resolución de salida replica la del vídeo de origen, sin reescalado forzado (probado a 1440×2560). La interfaz es asíncrona: un POST a /api/v1/video/generations con model, video_url y audio_url devuelve un task_id y luego se consulta; los clips cortos suelen estar listos en unos 2 minutos. En apimodels.app solo se cobran las tareas que terminan bien y el resultado se conserva 30 días. Úsalo únicamente sobre personas que hayan dado su consentimiento o sobre material cuyos derechos poseas.
$0.01 per second of audio · if the audio outlasts the video, the footage is extended automatically
Your talking video will appear here
$0.01 per second of audio vs $0.02/s for the image-based ai-lipsync — when you already have footage of the person, this is the more affordable path
Lighting, motion, background and camera work come from your footage; only the mouth is re-animated to match the new audio
Audio longer than the video? The footage is extended automatically — verified with a 6.2s voiceover over a 5s clip
Output matches the source video resolution (tested at 1440×2560) — no forced downscale
POST /api/v1/video/generations with model digital-human, video_url and audio_url — poll the task id for the mp4
Digital Human es una API de generación de video de APIMODELS. Digital Human trabaja con dos URL: en video_url pones un vídeo de la persona (mp4 o mov) y en audio_url la locución (mp3, wav o m4a, hasta 30 minutos), y recibes un mp4 con la boca sincronizada al audio. No es lo mismo que animar una foto fija: la luz, el movimiento, el fondo y el trabajo de cámara salen de tu propio material y el modelo solo reanima la boca, de modo que en el resultado sigue apareciendo la misma persona del mismo rodaje y no un retrato forzado a moverse. La duración siempre sigue al audio: si la locución es más larga que el vídeo, el metraje se extiende automáticamente (comprobado con una locución de 6,2 segundos sobre un clip de 5 segundos), y por eso la factura se calcula directamente sobre los segundos de audio: $0.01 por segundo, es decir $0.60 por una locución de 60 segundos, exactamente la mitad que el lip-sync sobre imagen de ai-lipsync ($0.02/s). Si no tienes vídeo y solo dispones de un retrato, lo que necesitas es precisamente ai-lipsync. La resolución de salida replica la del vídeo de origen, sin reescalado forzado (probado a 1440×2560). La interfaz es asíncrona: un POST a /api/v1/video/generations con model, video_url y audio_url devuelve un task_id y luego se consulta; los clips cortos suelen estar listos en unos 2 minutos. En apimodels.app solo se cobran las tareas que terminan bien y el resultado se conserva 30 días. Úsalo únicamente sobre personas que hayan dado su consentimiento o sobre material cuyos derechos poseas. A través de la plataforma APIMODELS puedes acceder a este modelo mediante una API unificada con precios de pago por uso transparentes. Precio actual: per second of audio: $0.01.
Genera rápidamente videos promocionales de marca para campañas y redes sociales.
Crea contenido de video corto atractivo para TikTok, Instagram y YouTube.
Genera demostraciones de funciones y tutoriales para mejorar la conversión.
Produce explicaciones de cursos, divulgación y videos de formación a bajo coste.
Digital Human está disponible a través de APIMODELS a: per second of audio: $0.01. La facturación es de pago por uso: solo pagas por lo que generas.
Regístrate en APIMODELS, obtén tu clave API y llama a nuestro endpoint unificado. Ofrecemos documentación detallada con ejemplos en cURL, Python y Node.js.
APIMODELS ofrece el mismo modelo Digital Human a través de nuestra plataforma de agregación. Proporcionamos una interfaz de API unificada, así que no necesitas cuentas separadas por proveedor: una sola clave para acceder a todos los modelos.
En APIMODELS, Digital Human convive con más de 60 modelos bajo una sola clave API y un solo saldo, así que elegir es cuestión de ajuste, no de dependencia. Admite Video + Audio, Lip-Sync, Keeps Original Motion, Audio up to 30min, Per-Second Pricing y puedes valorarlo en precio y capacidad frente a otros modelos de generación de video, y cambiar modificando una sola cadena con el nombre del modelo: sin nueva cuenta ni integración. Explora todas las opciones de generación de video con precios en vivo en apimodels.app/models.
Digital Human admite: Video + Audio, Lip-Sync, Keeps Original Motion, Audio up to 30min, Per-Second Pricing. Consulta la documentación de APIMODELS para ver todos los parámetros y ejemplos de llamada.
Sí. APIMODELS expone Digital Human mediante una única API unificada y una sola clave, sin cuentas separadas por proveedor ni necesidad de gestionar tú mismo el acceso de red regional de cada proveedor.
Aceptamos Stripe (Visa, Mastercard y otras tarjetas internacionales) y Alipay. El saldo está disponible al instante tras el pago.