
minimax-h3MiniMax H3 is a general-purpose multimodal video model rather than a stack of single-purpose tools. It reads text, images, video and audio in the same pass, works out what the brief is actually asking for, and returns one coherent clip with picture, motion and sound already in agreement — no separate dubbing, lip-sync or motion-transfer step to stitch together afterwards. Practically, that means one endpoint covers the whole range: send a prompt on its own for text-to-video, or attach up to 9 reference images, 3 reference videos and 3 reference audio clips to pin down character, camera movement and voice at once. Every reference input is optional. Choose any whole-second length from 5 to 15 and an aspect ratio of adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 or 9:16. Billed per second at $0.145/s (5s = $0.725, 15s = $2.175); the first 5 reference images are free and each additional image is $0.03. Only successful generations are charged.
At $0.145/s it costs 29.5% of our own Seedance 2.0 1080p tier ($0.492/s) — and outputs native 2K rather than 1080p. Both figures are published on this site, so you can check the comparison yourself
Text, image, video and audio are understood together rather than by separate specialist tools — visuals, motion and sound arrive already in sync, in a single pass
Every generation renders at 2K with synchronized audio — no upscaling step and no lower-resolution tier to pick between
Prompt alone behaves as text-to-video; add images, videos or audio to steer character, camera motion and voice in the same request
Whole-second control rather than fixed buckets, billed per second at $0.145/s so you pay for exactly the length you asked for
Up to 9 reference images, 3 reference videos and 3 reference audio clips — the first 5 images are free, extras are $0.03 each
Leave the references below empty for pure text-to-video — every reference input is optional.
Steer character, style or composition. The first 5 are free; each image past the 5th adds $0.03.
MP4 / MOV, ≤50MB and 2-15s each. Use these to carry camera movement or motion style into the output.
MP3 / WAV, ≤15MB and 2-15s each. Used to match voice or drive lip movement.
Generated video will appear here
Provide URLs and click Generate
MiniMax Hailuo H3 é uma API de geração de vídeo da Minimax. O MiniMax Hailuo H3 gera vídeo em 2K nativo com áudio sincronizado a partir de uma única requisição multimodal. O diferencial é que um só endpoint cobre todos os usos: imagens, vídeos e áudios de referência são entradas opcionais, então um prompt sozinho já faz text-to-video, e basta anexar material para dirigir o personagem, o movimento de câmera ou a voz, sem trocar de rota. Aceita até 9 imagens, 3 vídeos e 3 áudios de referência, qualquer duração inteira de 5 a 15 segundos (não são faixas fixas) e proporções adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. Na APIMODELS a cobrança é por segundo a $0.145/s: 5 segundos custam $0.725 e 15 segundos, $2.175. As 5 primeiras imagens de referência são gratuitas e cada imagem extra custa $0.03; vídeos e áudios de referência não têm custo adicional. Uma única chave para todos os modelos, acesso a partir da China sem verificação e cobrança apenas das requisições bem-sucedidas. Pela plataforma APIMODELS, você acessa este modelo por uma API unificada com preços transparentes de pagamento por uso. Preço atual: 2K · per second: $0.145, 2K · 5s: $0.725, 2K · 10s: $1.45, 2K · 15s: $2.175, Extra reference image (past 5): $0.03.
Gere rapidamente vídeos promocionais da marca para campanhas e redes sociais.
Crie vídeos curtos atraentes para TikTok, Instagram e YouTube.
Gere demonstrações de recursos e tutoriais para melhorar a conversão.
Produza explicações de cursos, divulgação e vídeos de treinamento a baixo custo.
O MiniMax Hailuo H3 está disponível pela APIMODELS a: 2K · per second: $0.145, 2K · 5s: $0.725, 2K · 10s: $1.45, 2K · 15s: $2.175, Extra reference image (past 5): $0.03. A cobrança é por uso — você paga apenas pelo que gera.
Cadastre-se na APIMODELS, obtenha sua chave de API e chame nosso endpoint unificado. Oferecemos documentação detalhada com exemplos em cURL, Python e Node.js.
A APIMODELS oferece o mesmo modelo MiniMax Hailuo H3 pela nossa plataforma de agregação. Fornecemos uma interface de API unificada, então você não precisa de contas separadas por provedor: uma única chave para acessar todos os modelos.
O MiniMax Hailuo H3 é o modelo multimodal de geração de vídeo da MiniMax: uma única requisição produz imagem em 2K nativo junto com áudio sincronizado, sem etapa de dublagem separada. O que o diferencia da maioria dos modelos de vídeo é que um só endpoint cobre todos os modos: imagens, vídeos e áudios de referência são entradas opcionais, então um prompt sozinho já faz text-to-video e basta anexar material para dirigir o personagem, o movimento de câmera ou a voz.
Na APIMODELS a cobrança é por segundo a $0.145/s: 5 segundos custam $0.725, 10 segundos $1.45 e 15 segundos $2.175. As 5 primeiras imagens de referência são gratuitas e cada imagem adicional custa $0.03 (máximo de 9, ou seja, até +$0.12); vídeos e áudios de referência não têm custo extra. Não há recarga mínima nem assinatura, e apenas requisições bem-sucedidas são cobradas — uma geração que falha não custa nada.
Use o endpoint unificado de vídeo POST /api/v1/video/generations com model igual a minimax-h3 (o alias hailuo-h3 também funciona). prompt e duration (segundos inteiros, de 5 a 15) são obrigatórios. Anexe referências conforme necessário: images (até 9), video_list (até 3) e audio_list (até 3), cada um aceitando URL pública ou base64. Passe ratio para fixar a proporção. A chamada retorna um taskId — consulte GET /api/v1/video/generations?task_id=xxx, ou informe callback_url na criação e enviaremos o resultado por POST ao terminar. Uma única chave cobre todos os modelos do site, com acesso a partir da China continental e sem verificação de organização.
A resolução é fixa em 2K nativo — este canal não oferece um nível inferior. A duração é qualquer segundo inteiro de 5 a 15, e não faixas fixas, e a proporção pode ser adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16. Limites de referência: até 9 imagens (≤30MB cada), até 3 vídeos (MP4/MOV, ≤50MB e 2-15s cada) e até 3 áudios (MP3/WAV, ≤15MB e 2-15s cada). O prompt aceita até 20.480 caracteres. O vídeo pronto é transferido para o nosso próprio armazenamento e o link fica ativo por 7 dias, então baixe ou re-hospede antes de expirar.
É a escolha certa quando você precisa de 2K nativo, áudio sincronizado e referências multimodais ao mesmo tempo: planos contínuos que precisam manter o mesmo personagem, peças publicitárias que têm de reproduzir um movimento de câmera específico, vídeos de apresentador com voz escolhida ou sincronia labial, e briefings complexos que misturam referências de imagem, vídeo e áudio. Em custo-benefício ele se sustenta: $0.145/s é 29,5% do nosso próprio nível Seedance 2.0 1080p ($0.492/s), e ainda entrega 2K nativo em vez de 1080p — os dois preços estão publicados neste site, então a comparação você mesmo pode conferir. Se você precisa principalmente de clipes verticais rápidos com orçamento apertado, o LTX-2.3 (a partir de $0.02/s em 480p) ou o Seedance 2.0 Fast (a partir de $0.11/s) rendem mais por dólar; se precisa de 4K ou edição de vídeo, veja o Omni Flash. Na APIMODELS todos compartilham uma chave e o mesmo endpoint, então trocar de modelo é mudar um único campo.
Na APIMODELS, o MiniMax Hailuo H3 roda junto com mais de 60 modelos usando uma única chave de API e um único saldo, então escolher é questão de adequação, não de dependência. Ele suporta Native 2K, Multimodal Reference, 5-15s, Up to 9 Ref Images, 3 Ref Videos + 3 Audios, Synchronized Audio e você pode avaliá-lo em preço e capacidade frente a outros modelos de geração de vídeo, trocando ao alterar uma única string com o nome do modelo — sem nova conta ou integração. Veja todas as opções de geração de vídeo com preços ao vivo em apimodels.app/models.
O MiniMax Hailuo H3 suporta: Native 2K, Multimodal Reference, 5-15s, Up to 9 Ref Images, 3 Ref Videos + 3 Audios, Synchronized Audio. Consulte a documentação da APIMODELS para todos os parâmetros e exemplos de chamada.
Sim. A APIMODELS expõe o MiniMax Hailuo H3 por uma única API unificada e uma só chave, sem contas separadas por provedor e sem precisar lidar com o acesso de rede regional de cada provedor.
Aceitamos Stripe (Visa, Mastercard e outros cartões internacionais) e Alipay. O saldo fica disponível imediatamente após o pagamento.
Prompts shared by their authors — copy and adapt them. Each one credits its author and links back to the original post.
Condor Heroes characters teach English word dream
神雕侠侣主角趣味讲单词 dream 教程
by @nicekate8888
Pizza night UGC Domino’s vlog
VIDEO PROMPT — "Pizza Night Vlog" (UGC iPhone Style) Duration: 15 seconds | Aspect Ratio: 16:9 | Style: Authentic UGC / iPhone selfie-vlog, handheld, natural light, slight motion blur, TikTok/Reels energy — NOT cinematic, NOT overly polished. Feels like a real creator filmed this on their phone. Product Reference: Use the uploaded Domino's Pepperoni Pizza image as the only product reference. Keep crust thickness, cheese texture, bake color, pepperoni placement, and proportions identical in every cut — no redesigning the pizza. Camera: iPhone 15 Pro front + back camera switching, handheld, natural wobble, autofocus hunting slightly (realistic), vertical-style framing cropped to 16:9, occasional finger near lens edge, natural room lighting + phone flash reflections on the pizza box. Character Description Name (for reference): Mia Awoman in her mid-20s, naturally attractive and beautiful with an approachable, girl-next-door charm — not overly done up. Wavy sandy-blonde hair pulled back loosely, light natural makeup, wearing a cozy oversized cream sweater. Warm, genuine smile, expressive eyes, casual energetic personality like a real lifestyle vlogger. Sits in a softly lit modern kitchen/living room. Shot Breakdown SHOT 1 (0–2s) — The Grab Selfie-angle, she's mid-laugh holding up the Domino's box to camera. Quick jump cut. Dialogue: "Okay so it's officially pizza night—" SHOT 2 (2–4s) — The Open Cut to overhead handheld shot, box flips open, steam rising off the pizza, slight camera shake as she leans in. SHOT 3 (4–6s) — The Zoom Quick zoom-punch into the pizza, phone camera autofocus adjusts naturally, cheese and pepperoni in focus, ambient kitchen sounds. SHOT 4 (6–8s) — The Pull Cut to her hands lifting a slice, natural cheese pull, filmed from a slightly low candid angle like a friend filming across the table. SHOT 5 (8–10s) — The Reaction Cut back to selfie-cam, she takes a bite, eyes widen, quick genuine reaction. Dialogue: "Oh my god, that's so good." SHOT 6 (10–12s) — The Candid Cutaway Jump cut to a close, slightly shaky shot of the pizza box on the counter, her hand grabbing another slice off-frame, casual b-roll energy. SHOT 7 (12–14s) — The Wrap-Up Back to selfie angle, she grins at camera, holding slice up like a toast. Dialogue: "Dominos, y'all know what to do." SHOT 8 (14–15s) — End Tag Quick freeze/cut to the box logo close-up, natural handheld wobble, soft text overlay in casual font: "pizza night = solved 🍕" — cut to black. Look & Feel Warm indoor lighting, slightly grainy natural phone sensor look, imperfect framing, real reactions, minimal dialogue (3 short lines total), authentic pacing with hard jump cuts instead of smooth transitions. Negative Prompt cinematic grade, overly smooth camera moves, studio lighting, professional voiceover, staged acting, CGI look, plastic cheese, distorted pepperoni, extra fingers, warped hands, text glitches, logo distortion, overly polished commercial feel.
by @ShamiWeb3
The World's Unluckiest Superhero
A documentary about a superhero who has extremely bad luck and ends up saving people by accident through the destruction caused by his own misfortune. Dialogue in English. Scene direction with unique composition. Every cut, every camera angle, and every movement is of exceptionally high quality; the composition is guided by an experienced film director. The comedy is genuinely interesting, and throughout the 15 seconds everything unfolds in a perfectly crafted way, with a comedic payoff that can make anyone laugh.
by @NACHOS2D_
We curate copy-ready prompt libraries — every entry shows its full text and a sample result, ready to adapt.
How to get access, regional availability, and how this model compares with its alternatives.