digital-humanO Digital Human trabalha com dois endereços: em video_url você envia um vídeo da pessoa (mp4 ou mov) e em audio_url a locução (mp3, wav ou m4a, até 30 minutos), e recebe de volta um mp4 com a boca sincronizada ao áudio. Não é a mesma coisa que animar uma foto parada: luz, movimento, fundo e trabalho de câmera vêm do seu próprio material e o modelo apenas reanima a boca, de modo que no resultado continua aparecendo a mesma pessoa da mesma filmagem, e não um retrato forçado a se mexer. A duração sempre acompanha o áudio: se a locução for mais longa que o vídeo, a imagem é estendida automaticamente (verificado com uma locução de 6,2 segundos sobre um clipe de 5 segundos), e por isso a conta sai direto pelos segundos do áudio — $0.01 por segundo, ou seja $0.60 para uma locução de 60 segundos, exatamente metade do lip-sync sobre imagem do ai-lipsync ($0.02/s). Se você não tem vídeo e só dispõe de um retrato, o caminho é justamente o ai-lipsync. A resolução de saída acompanha a do vídeo de origem, sem redução forçada (testado em 1440×2560). A interface é assíncrona: um POST em /api/v1/video/generations com model, video_url e audio_url devolve um task_id e depois você consulta; clipes curtos costumam ficar prontos em cerca de 2 minutos. Na apimodels.app só as tarefas bem-sucedidas são cobradas e o resultado fica guardado por 30 dias. Use apenas com pessoas que consentiram ou com material cujos direitos você detém.
$0.01 per second of audio · if the audio outlasts the video, the footage is extended automatically
Your talking video will appear here
$0.01 per second of audio vs $0.02/s for the image-based ai-lipsync — when you already have footage of the person, this is the more affordable path
Lighting, motion, background and camera work come from your footage; only the mouth is re-animated to match the new audio
Audio longer than the video? The footage is extended automatically — verified with a 6.2s voiceover over a 5s clip
Output matches the source video resolution (tested at 1440×2560) — no forced downscale
POST /api/v1/video/generations with model digital-human, video_url and audio_url — poll the task id for the mp4
Digital Human é uma API de geração de vídeo da APIMODELS. O Digital Human trabalha com dois endereços: em video_url você envia um vídeo da pessoa (mp4 ou mov) e em audio_url a locução (mp3, wav ou m4a, até 30 minutos), e recebe de volta um mp4 com a boca sincronizada ao áudio. Não é a mesma coisa que animar uma foto parada: luz, movimento, fundo e trabalho de câmera vêm do seu próprio material e o modelo apenas reanima a boca, de modo que no resultado continua aparecendo a mesma pessoa da mesma filmagem, e não um retrato forçado a se mexer. A duração sempre acompanha o áudio: se a locução for mais longa que o vídeo, a imagem é estendida automaticamente (verificado com uma locução de 6,2 segundos sobre um clipe de 5 segundos), e por isso a conta sai direto pelos segundos do áudio — $0.01 por segundo, ou seja $0.60 para uma locução de 60 segundos, exatamente metade do lip-sync sobre imagem do ai-lipsync ($0.02/s). Se você não tem vídeo e só dispõe de um retrato, o caminho é justamente o ai-lipsync. A resolução de saída acompanha a do vídeo de origem, sem redução forçada (testado em 1440×2560). A interface é assíncrona: um POST em /api/v1/video/generations com model, video_url e audio_url devolve um task_id e depois você consulta; clipes curtos costumam ficar prontos em cerca de 2 minutos. Na apimodels.app só as tarefas bem-sucedidas são cobradas e o resultado fica guardado por 30 dias. Use apenas com pessoas que consentiram ou com material cujos direitos você detém. Pela plataforma APIMODELS, você acessa este modelo por uma API unificada com preços transparentes de pagamento por uso. Preço atual: per second of audio: $0.01.
Gere rapidamente vídeos promocionais da marca para campanhas e redes sociais.
Crie vídeos curtos atraentes para TikTok, Instagram e YouTube.
Gere demonstrações de recursos e tutoriais para melhorar a conversão.
Produza explicações de cursos, divulgação e vídeos de treinamento a baixo custo.
O Digital Human está disponível pela APIMODELS a: per second of audio: $0.01. A cobrança é por uso — você paga apenas pelo que gera.
Cadastre-se na APIMODELS, obtenha sua chave de API e chame nosso endpoint unificado. Oferecemos documentação detalhada com exemplos em cURL, Python e Node.js.
A APIMODELS oferece o mesmo modelo Digital Human pela nossa plataforma de agregação. Fornecemos uma interface de API unificada, então você não precisa de contas separadas por provedor: uma única chave para acessar todos os modelos.
Na APIMODELS, o Digital Human roda junto com mais de 60 modelos usando uma única chave de API e um único saldo, então escolher é questão de adequação, não de dependência. Ele suporta Video + Audio, Lip-Sync, Keeps Original Motion, Audio up to 30min, Per-Second Pricing e você pode avaliá-lo em preço e capacidade frente a outros modelos de geração de vídeo, trocando ao alterar uma única string com o nome do modelo — sem nova conta ou integração. Veja todas as opções de geração de vídeo com preços ao vivo em apimodels.app/models.
O Digital Human suporta: Video + Audio, Lip-Sync, Keeps Original Motion, Audio up to 30min, Per-Second Pricing. Consulte a documentação da APIMODELS para todos os parâmetros e exemplos de chamada.
Sim. A APIMODELS expõe o Digital Human por uma única API unificada e uma só chave, sem contas separadas por provedor e sem precisar lidar com o acesso de rede regional de cada provedor.
Aceitamos Stripe (Visa, Mastercard e outros cartões internacionais) e Alipay. O saldo fica disponível imediatamente após o pagamento.