
minimax-h3MiniMax H3 is a general-purpose multimodal video model rather than a stack of single-purpose tools. It reads text, images, video and audio in the same pass, works out what the brief is actually asking for, and returns one coherent clip with picture, motion and sound already in agreement — no separate dubbing, lip-sync or motion-transfer step to stitch together afterwards. Practically, that means one endpoint covers the whole range: send a prompt on its own for text-to-video, or attach up to 9 reference images, 3 reference videos and 3 reference audio clips to pin down character, camera movement and voice at once. Every reference input is optional. Choose any whole-second length from 5 to 15 and an aspect ratio of adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 or 9:16. Billed per second at $0.145/s (5s = $0.725, 15s = $2.175); the first 5 reference images are free and each additional image is $0.03. Only successful generations are charged.
At $0.145/s it costs 29.5% of our own Seedance 2.0 1080p tier ($0.492/s) — and outputs native 2K rather than 1080p. Both figures are published on this site, so you can check the comparison yourself
Text, image, video and audio are understood together rather than by separate specialist tools — visuals, motion and sound arrive already in sync, in a single pass
Every generation renders at 2K with synchronized audio — no upscaling step and no lower-resolution tier to pick between
Prompt alone behaves as text-to-video; add images, videos or audio to steer character, camera motion and voice in the same request
Whole-second control rather than fixed buckets, billed per second at $0.145/s so you pay for exactly the length you asked for
Up to 9 reference images, 3 reference videos and 3 reference audio clips — the first 5 images are free, extras are $0.03 each
Leave the references below empty for pure text-to-video — every reference input is optional.
Steer character, style or composition. The first 5 are free; each image past the 5th adds $0.03.
MP4 / MOV, ≤50MB and 2-15s each. Use these to carry camera movement or motion style into the output.
MP3 / WAV, ≤15MB and 2-15s each. Used to match voice or drive lip movement.
Generated video will appear here
Provide URLs and click Generate
MiniMax Hailuo H3 es una API de generación de video de Minimax. MiniMax Hailuo H3 genera vídeo en 2K nativo con audio sincronizado a partir de una única petición multimodal. Su particularidad es que un solo endpoint cubre todos los usos: las imágenes, los vídeos y los audios de referencia son entradas opcionales, así que basta un prompt para hacer text-to-video, y basta añadir material para dirigir el personaje, el movimiento de cámara o la voz, sin cambiar de ruta. Admite hasta 9 imágenes, 3 vídeos y 3 audios de referencia, cualquier duración entera de 5 a 15 segundos (no son tramos fijos) y relaciones de aspecto adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. En APIMODELS se cobra por segundo a $0.145/s: 5 segundos son $0.725 y 15 segundos, $2.175. Las 5 primeras imágenes de referencia son gratuitas y cada imagen adicional cuesta $0.03; los vídeos y audios de referencia no tienen coste extra. Una sola clave para todos los modelos, acceso desde China sin verificación y cobro únicamente de las peticiones correctas. A través de la plataforma APIMODELS puedes acceder a este modelo mediante una API unificada con precios de pago por uso transparentes. Precio actual: 2K · per second: $0.145, 2K · 5s: $0.725, 2K · 10s: $1.45, 2K · 15s: $2.175, Extra reference image (past 5): $0.03.
Genera rápidamente videos promocionales de marca para campañas y redes sociales.
Crea contenido de video corto atractivo para TikTok, Instagram y YouTube.
Genera demostraciones de funciones y tutoriales para mejorar la conversión.
Produce explicaciones de cursos, divulgación y videos de formación a bajo coste.
MiniMax Hailuo H3 está disponible a través de APIMODELS a: 2K · per second: $0.145, 2K · 5s: $0.725, 2K · 10s: $1.45, 2K · 15s: $2.175, Extra reference image (past 5): $0.03. La facturación es de pago por uso: solo pagas por lo que generas.
Regístrate en APIMODELS, obtén tu clave API y llama a nuestro endpoint unificado. Ofrecemos documentación detallada con ejemplos en cURL, Python y Node.js.
APIMODELS ofrece el mismo modelo MiniMax Hailuo H3 a través de nuestra plataforma de agregación. Proporcionamos una interfaz de API unificada, así que no necesitas cuentas separadas por proveedor: una sola clave para acceder a todos los modelos.
MiniMax Hailuo H3 es el modelo multimodal de generación de vídeo de MiniMax: una sola petición produce imagen en 2K nativo junto con audio sincronizado, sin paso de doblaje aparte. Lo que lo distingue de la mayoría de modelos de vídeo es que un único endpoint cubre todos los modos: las imágenes, los vídeos y los audios de referencia son entradas opcionales, así que un prompt por sí solo hace text-to-video y basta adjuntar material para dirigir el personaje, el movimiento de cámara o la voz.
En APIMODELS se cobra por segundo a $0.145/s: 5 segundos son $0.725, 10 segundos $1.45 y 15 segundos $2.175. Las 5 primeras imágenes de referencia son gratuitas y cada imagen adicional cuesta $0.03 (máximo 9, es decir hasta +$0.12); los vídeos y audios de referencia no cuestan nada extra. No hay recarga mínima ni suscripción, y solo se cobran las peticiones correctas: una generación fallida no cuesta nada.
Usa el endpoint unificado de vídeo POST /api/v1/video/generations con model igual a minimax-h3 (el alias hailuo-h3 también funciona). prompt y duration (segundos enteros, de 5 a 15) son obligatorios. Adjunta referencias según necesites: images (hasta 9), video_list (hasta 3) y audio_list (hasta 3), cada uno admite una URL pública o base64. Pasa ratio para fijar la relación de aspecto. La llamada devuelve un taskId: consulta GET /api/v1/video/generations?task_id=xxx, o indica callback_url al crear la tarea y te enviaremos el resultado por POST al terminar. Una sola clave sirve para todos los modelos del sitio, con acceso desde China continental y sin verificación de organización.
La resolución es fija en 2K nativo: este canal no ofrece un nivel inferior. La duración es cualquier segundo entero entre 5 y 15, no tramos fijos, y la relación de aspecto puede ser adaptive, 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16. Límites de referencia: hasta 9 imágenes (≤30MB cada una), hasta 3 vídeos (MP4/MOV, ≤50MB y 2-15s cada uno) y hasta 3 audios (MP3/WAV, ≤15MB y 2-15s cada uno). El prompt admite hasta 20.480 caracteres. El vídeo terminado se transfiere a nuestro propio almacenamiento y el enlace vive 7 días, así que descárgalo o realójalo antes de que caduque.
Es la elección adecuada cuando necesitas 2K nativo, audio sincronizado y referencias multimodales a la vez: planos continuos que deben mantener al mismo personaje, anuncios que tienen que reproducir un movimiento de cámara concreto, vídeos de presentador con una voz elegida o sincronía labial, y encargos complejos que mezclan referencias de imagen, vídeo y audio. En relación calidad-precio aguanta bien: $0.145/s es el 29,5% de nuestro propio nivel Seedance 2.0 1080p ($0.492/s), y además entrega 2K nativo en vez de 1080p — ambos precios están publicados en este sitio, así que la comparación la puedes verificar tú. Si lo que necesitas son clips verticales rápidos con presupuesto ajustado, LTX-2.3 (desde $0.02/s en 480p) o Seedance 2.0 Fast (desde $0.11/s) rinden más por dólar; si necesitas 4K o edición de vídeo, mira Omni Flash. En APIMODELS todos comparten una clave y el mismo endpoint, así que cambiar de modelo es cambiar un solo campo.
En APIMODELS, MiniMax Hailuo H3 convive con más de 60 modelos bajo una sola clave API y un solo saldo, así que elegir es cuestión de ajuste, no de dependencia. Admite Native 2K, Multimodal Reference, 5-15s, Up to 9 Ref Images, 3 Ref Videos + 3 Audios, Synchronized Audio y puedes valorarlo en precio y capacidad frente a otros modelos de generación de video, y cambiar modificando una sola cadena con el nombre del modelo: sin nueva cuenta ni integración. Explora todas las opciones de generación de video con precios en vivo en apimodels.app/models.
MiniMax Hailuo H3 admite: Native 2K, Multimodal Reference, 5-15s, Up to 9 Ref Images, 3 Ref Videos + 3 Audios, Synchronized Audio. Consulta la documentación de APIMODELS para ver todos los parámetros y ejemplos de llamada.
Sí. APIMODELS expone MiniMax Hailuo H3 mediante una única API unificada y una sola clave, sin cuentas separadas por proveedor ni necesidad de gestionar tú mismo el acceso de red regional de cada proveedor.
Aceptamos Stripe (Visa, Mastercard y otras tarjetas internacionales) y Alipay. El saldo está disponible al instante tras el pago.
Prompts shared by their authors — copy and adapt them. Each one credits its author and links back to the original post.
Condor Heroes characters teach English word dream
神雕侠侣主角趣味讲单词 dream 教程
by @nicekate8888
Pizza night UGC Domino’s vlog
VIDEO PROMPT — "Pizza Night Vlog" (UGC iPhone Style) Duration: 15 seconds | Aspect Ratio: 16:9 | Style: Authentic UGC / iPhone selfie-vlog, handheld, natural light, slight motion blur, TikTok/Reels energy — NOT cinematic, NOT overly polished. Feels like a real creator filmed this on their phone. Product Reference: Use the uploaded Domino's Pepperoni Pizza image as the only product reference. Keep crust thickness, cheese texture, bake color, pepperoni placement, and proportions identical in every cut — no redesigning the pizza. Camera: iPhone 15 Pro front + back camera switching, handheld, natural wobble, autofocus hunting slightly (realistic), vertical-style framing cropped to 16:9, occasional finger near lens edge, natural room lighting + phone flash reflections on the pizza box. Character Description Name (for reference): Mia Awoman in her mid-20s, naturally attractive and beautiful with an approachable, girl-next-door charm — not overly done up. Wavy sandy-blonde hair pulled back loosely, light natural makeup, wearing a cozy oversized cream sweater. Warm, genuine smile, expressive eyes, casual energetic personality like a real lifestyle vlogger. Sits in a softly lit modern kitchen/living room. Shot Breakdown SHOT 1 (0–2s) — The Grab Selfie-angle, she's mid-laugh holding up the Domino's box to camera. Quick jump cut. Dialogue: "Okay so it's officially pizza night—" SHOT 2 (2–4s) — The Open Cut to overhead handheld shot, box flips open, steam rising off the pizza, slight camera shake as she leans in. SHOT 3 (4–6s) — The Zoom Quick zoom-punch into the pizza, phone camera autofocus adjusts naturally, cheese and pepperoni in focus, ambient kitchen sounds. SHOT 4 (6–8s) — The Pull Cut to her hands lifting a slice, natural cheese pull, filmed from a slightly low candid angle like a friend filming across the table. SHOT 5 (8–10s) — The Reaction Cut back to selfie-cam, she takes a bite, eyes widen, quick genuine reaction. Dialogue: "Oh my god, that's so good." SHOT 6 (10–12s) — The Candid Cutaway Jump cut to a close, slightly shaky shot of the pizza box on the counter, her hand grabbing another slice off-frame, casual b-roll energy. SHOT 7 (12–14s) — The Wrap-Up Back to selfie angle, she grins at camera, holding slice up like a toast. Dialogue: "Dominos, y'all know what to do." SHOT 8 (14–15s) — End Tag Quick freeze/cut to the box logo close-up, natural handheld wobble, soft text overlay in casual font: "pizza night = solved 🍕" — cut to black. Look & Feel Warm indoor lighting, slightly grainy natural phone sensor look, imperfect framing, real reactions, minimal dialogue (3 short lines total), authentic pacing with hard jump cuts instead of smooth transitions. Negative Prompt cinematic grade, overly smooth camera moves, studio lighting, professional voiceover, staged acting, CGI look, plastic cheese, distorted pepperoni, extra fingers, warped hands, text glitches, logo distortion, overly polished commercial feel.
by @ShamiWeb3
The World's Unluckiest Superhero
A documentary about a superhero who has extremely bad luck and ends up saving people by accident through the destruction caused by his own misfortune. Dialogue in English. Scene direction with unique composition. Every cut, every camera angle, and every movement is of exceptionally high quality; the composition is guided by an experienced film director. The comedy is genuinely interesting, and throughout the 15 seconds everything unfolds in a perfectly crafted way, with a comedic payoff that can make anyone laugh.
by @NACHOS2D_
We curate copy-ready prompt libraries — every entry shows its full text and a sample result, ready to adapt.
How to get access, regional availability, and how this model compares with its alternatives.