digital-human디지털 휴먼은 주소 두 개만 있으면 됩니다. video_url에 인물이 나오는 영상(mp4 / mov), audio_url에 구동용 오디오(mp3 / wav / m4a, 최대 30분)를 넣으면 입 모양이 오디오에 맞춰진 mp4가 돌아옵니다. 정지 사진 한 장으로 말하는 얼굴을 만드는 것과는 다른 일입니다. 조명, 동작, 배경, 카메라 워크는 모두 원본 소재 그대로이고 모델이 다시 만드는 것은 입 부분뿐이라, 결과물 속 인물은 «억지로 움직여진 사진»이 아니라 원래 그 영상 속 그 사람으로 남습니다. 길이는 언제나 오디오를 따릅니다. 오디오가 영상보다 길면 영상이 자동으로 연장되며(5초 영상에 6.2초 내레이션을 얹어 확인), 그래서 과금도 구동 오디오의 초 수로 바로 계산됩니다. 초당 $0.01이므로 60초 내레이션은 $0.60이고, 이는 사진 기반 립싱크인 ai-lipsync($0.02/초)의 정확히 절반입니다. 반대로 영상 없이 인물 사진만 있다면 그때 써야 할 것이 ai-lipsync입니다. 출력 해상도는 원본 영상을 따르며 강제 다운스케일이 없습니다(1440×2560으로 실측). 인터페이스는 비동기라 /api/v1/video/generations에 model, video_url, audio_url을 POST해 task_id를 받고 폴링으로 결과를 가져오며, 짧은 소재는 보통 2분 정도면 돌아옵니다. apimodels.app에서는 성공한 작업에만 과금되고 결과물은 30일간 보관됩니다. 반드시 동의를 받았거나 권리를 보유한 대상에게만 사용하세요.
$0.01 per second of audio · if the audio outlasts the video, the footage is extended automatically
Your talking video will appear here
$0.01 per second of audio vs $0.02/s for the image-based ai-lipsync — when you already have footage of the person, this is the more affordable path
Lighting, motion, background and camera work come from your footage; only the mouth is re-animated to match the new audio
Audio longer than the video? The footage is extended automatically — verified with a 6.2s voiceover over a 5s clip
Output matches the source video resolution (tested at 1440×2560) — no forced downscale
POST /api/v1/video/generations with model digital-human, video_url and audio_url — poll the task id for the mp4
Digital Human은(는) APIMODELS의 영상 생성 API입니다. 디지털 휴먼은 주소 두 개만 있으면 됩니다. video_url에 인물이 나오는 영상(mp4 / mov), audio_url에 구동용 오디오(mp3 / wav / m4a, 최대 30분)를 넣으면 입 모양이 오디오에 맞춰진 mp4가 돌아옵니다. 정지 사진 한 장으로 말하는 얼굴을 만드는 것과는 다른 일입니다. 조명, 동작, 배경, 카메라 워크는 모두 원본 소재 그대로이고 모델이 다시 만드는 것은 입 부분뿐이라, 결과물 속 인물은 «억지로 움직여진 사진»이 아니라 원래 그 영상 속 그 사람으로 남습니다. 길이는 언제나 오디오를 따릅니다. 오디오가 영상보다 길면 영상이 자동으로 연장되며(5초 영상에 6.2초 내레이션을 얹어 확인), 그래서 과금도 구동 오디오의 초 수로 바로 계산됩니다. 초당 $0.01이므로 60초 내레이션은 $0.60이고, 이는 사진 기반 립싱크인 ai-lipsync($0.02/초)의 정확히 절반입니다. 반대로 영상 없이 인물 사진만 있다면 그때 써야 할 것이 ai-lipsync입니다. 출력 해상도는 원본 영상을 따르며 강제 다운스케일이 없습니다(1440×2560으로 실측). 인터페이스는 비동기라 /api/v1/video/generations에 model, video_url, audio_url을 POST해 task_id를 받고 폴링으로 결과를 가져오며, 짧은 소재는 보통 2분 정도면 돌아옵니다. apimodels.app에서는 성공한 작업에만 과금되고 결과물은 30일간 보관됩니다. 반드시 동의를 받았거나 권리를 보유한 대상에게만 사용하세요. APIMODELS 플랫폼을 거치면 통합 API와 투명한 종량 과금으로 이 모델을 호출할 수 있습니다. 현재 가격: per second of audio: $0.01.
광고 캠페인과 SNS 마케팅에 쓸 브랜드 영상을 빠르게 만듭니다.
TikTok, Instagram, YouTube에 맞는 세로형 짧은 영상을 대량으로 뽑습니다.
기능 소개와 사용법 영상을 만들어 전환율을 끌어올립니다.
강의 해설과 지식 설명, 사내 교육 영상을 낮은 비용으로 꾸준히 제작합니다.
Digital Human은(는) APIMODELS를 통해 per second of audio: $0.01에 이용할 수 있습니다. 과금은 종량제라서 생성한 만큼만 냅니다.
APIMODELS에 가입해 API 키를 받고 통합 엔드포인트를 호출하면 됩니다. cURL / Python / Node.js 예제를 담은 상세 문서를 제공합니다.
APIMODELS는 같은 Digital Human을(를) 집약 플랫폼을 통해 제공합니다. API 인터페이스가 통합되어 있어 공급자마다 계정을 만들 필요가 없고, 키 하나로 모든 모델에 닿습니다.
APIMODELS에서는 Digital Human이(가) 60개가 넘는 모델과 같은 API 키, 같은 잔액 위에 나란히 놓입니다. 그래서 선택은 궁합의 문제이지 종속의 문제가 아닙니다. Video + Audio、Lip-Sync、Keeps Original Motion、Audio up to 30min、Per-Second Pricing을(를) 지원하며 다른 영상 생성 모델과 가격·성능을 나란히 놓고 따져볼 수 있습니다. 갈아타기는 모델 이름 문자열 하나만 바꾸면 되고 새 계정도 추가 작업도 필요 없습니다. 영상 생성 선택지와 실시간 가격은 apimodels.app/models에서 볼 수 있습니다.
Digital Human은(는) 다음을 지원합니다: Video + Audio、Lip-Sync、Keeps Original Motion、Audio up to 30min、Per-Second Pricing. 전체 파라미터와 호출 예제는 APIMODELS 문서를 참고하세요.
네. APIMODELS는 Digital Human을(를) 하나의 통합 API와 키 한 개로 제공합니다. 공급자별 계정도 필요 없고, 각 공급자의 지역별 네트워크 경로를 직접 챙길 필요도 없습니다.
Stripe(Visa, Mastercard 등 해외 카드)와 Alipay를 지원합니다. 결제 후 잔액은 즉시 반영됩니다.