
wan-3.0-videoWan 3.0 es el modelo de vídeo todo en uno de Alibaba: un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o primer+último fotograma, y generación omni-referencia con hasta 10 imágenes, 5 clips de vídeo y 5 de audio — o directamente un documento (PPTX, DOCX, XLSX, PDF, hasta 50 páginas) o una página web pública. Salida nativa de hasta 30 segundos en plano único a 30fps con pista de audio sincronizada que puedes desactivar sin cambio de precio, en 480P / 720P / 1080P y seis relaciones de aspecto. En modo omni-referencia el prompt puede dirigirse a los materiales por posición ("la figura 1 sostiene el objeto de la figura 2"), que es como se mantiene la coherencia de varios personajes y objetos en un plano. La facturación es por segundo: 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s. Las imágenes, el audio, los documentos y las páginas web de referencia no cuestan nada, pero un VÍDEO de referencia (edición, extensión o cambio de rostro) también se cobra por su propia duración: segundos del vídeo de entrada + segundos de salida, igual que en el proveedor, que además limita esas tareas a entrada + salida ≤ 30 segundos.
Prompt only
Document-to-video (PPTX / DOCX / XLSX / PDF) and web-page-to-video are API-only for now — see /docs/wan-3-0-video.
Generated video will appear here
Provide URLs and click Generate
Plano único de hasta 30 s a 30fps — o pasa duration -1 y deja que el modelo elija
Hasta 10 imágenes + 5 vídeos + 5 clips de audio; el prompt se refiere a ellos como «figura 1», «vídeo 1»
Entrega un PPTX / DOCX / PDF o una URL pública y el modelo lo lee y lo lleva al plano
Desde $0.05/s en 480p ($0.10 en 720p, $0.20 en 1080p); imágenes, audio y documentos son gratis, pero un vídeo de referencia suma su propia duración
mode:"prime" devolvió en 58 s lo que el estándar tardó 356 s en la misma tarea — un 36-40% más por segundo
Wan 3.0 Video es una API de generación de video de Alibaba. Wan 3.0 es el modelo de vídeo todo en uno de Alibaba: un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o primer+último fotograma, y generación omni-referencia con hasta 10 imágenes, 5 clips de vídeo y 5 de audio — o directamente un documento (PPTX, DOCX, XLSX, PDF, hasta 50 páginas) o una página web pública. Salida nativa de hasta 30 segundos en plano único a 30fps con pista de audio sincronizada que puedes desactivar sin cambio de precio, en 480P / 720P / 1080P y seis relaciones de aspecto. En modo omni-referencia el prompt puede dirigirse a los materiales por posición ("la figura 1 sostiene el objeto de la figura 2"), que es como se mantiene la coherencia de varios personajes y objetos en un plano. La facturación es por segundo: 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s. Las imágenes, el audio, los documentos y las páginas web de referencia no cuestan nada, pero un VÍDEO de referencia (edición, extensión o cambio de rostro) también se cobra por su propia duración: segundos del vídeo de entrada + segundos de salida, igual que en el proveedor, que además limita esas tareas a entrada + salida ≤ 30 segundos. A través de la plataforma APIMODELS puedes acceder a este modelo mediante una API unificada con precios de pago por uso transparentes. Precio actual: 480p: $0.05, 720p: $0.1, 1080p: $0.2, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28.
Genera rápidamente videos promocionales de marca para campañas y redes sociales.
Crea contenido de video corto atractivo para TikTok, Instagram y YouTube.
Genera demostraciones de funciones y tutoriales para mejorar la conversión.
Produce explicaciones de cursos, divulgación y videos de formación a bajo coste.
Wan 3.0 Video está disponible a través de APIMODELS a: 480p: $0.05, 720p: $0.1, 1080p: $0.2, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28. La facturación es de pago por uso: solo pagas por lo que generas.
Regístrate en APIMODELS, obtén tu clave API y llama a nuestro endpoint unificado. Ofrecemos documentación detallada con ejemplos en cURL, Python y Node.js.
APIMODELS ofrece el mismo modelo Wan 3.0 Video a través de nuestra plataforma de agregación. Proporcionamos una interfaz de API unificada, así que no necesitas cuentas separadas por proveedor: una sola clave para acceder a todos los modelos.
Wan 3.0 (万相 3.0) es el modelo de vídeo todo en uno de Alibaba, lanzado en agosto de 2026. Un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o por primer y último fotograma, y la generación «omni-referencia» guiada por hasta 10 imágenes, 5 clips de vídeo y 5 de audio de referencia (15 segundos en total para vídeo y otros 15 para audio) — o por un documento (PPTX, DOCX, XLSX, PDF, TXT, MD, hasta 50 páginas) o una página web pública. En apimodels.app haces POST a /api/v1/video/generations con model "wan-3.0-video" y luego consultas el mismo endpoint con el task_id devuelto. La forma de la petición es la misma que la de VEO, Kling y Seedance aquí, así que cambiar de modelo es cambiar una cadena y una sola clave las cubre todas.
Porque la mayoría no puede abrir la cuenta. Wan 3.0 hoy solo se sirve desde las regiones de China (Pekín) y Singapur de Alibaba Model Studio — sondeamos la región de EE. UU. (Virginia) y no ofrece el modelo en absoluto (ese espacio de trabajo lista 92 modelos y ninguno es de vídeo). La estación china exige verificación de identidad real de China continental para registrarse, y ahí se quedan los desarrolladores de fuera. Pasar por apimodels.app no requiere cuenta de Alibaba Cloud, ni verificación, ni una relación de facturación aparte: la misma clave y el mismo endpoint que ya usas con el resto de modelos.
Se factura cada segundo DE SALIDA — las imágenes, vídeos, audios y documentos de referencia que envías son gratis. Hasta el 10 de septiembre hay un 20% de descuento: 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s (precio de lista $0.05 / $0.10 / $0.20). Así, un clip de 5 segundos en 720p sale a unos $0.48, uno de 10 segundos en 1080p a unos $1.91 y uno de 30 segundos en 1080p a unos $5.72. Desactivar la pista de audio no cambia el precio. Las tareas fallidas no se cobran. Con mode:"prime" pasas al nivel rápido, un 50% más caro por segundo (desde $0.068/s en 480p durante la promoción): compras latencia, no calidad.
Sí — duration acepta cualquier entero de 2 a 30 y la salida es un plano único nativo a 30fps, no segmentos pegados. Pasar -1 activa la duración inteligente: el modelo elige una longitud entre 2 y 30 segundos según tu prompt y tus materiales. Con -1 reservamos por adelantado el peor caso de 30 segundos y, cuando el proveedor informa la longitud real, cobramos esa y devolvemos la diferencia — un modelo que decide 5 segundos nunca te cuesta 30. Ten en cuenta que, si aportas vídeo de referencia, la longitud del vídeo de entrada más la de salida debe quedar dentro de 30 segundos.
Envía los materiales en orden y el prompt puede referirse a ellos por posición: «figura 1», «figura 2», «vídeo 1», «audio 1» — imágenes, vídeos y audios se numeran por separado. Por ejemplo: «la persona del vídeo 1 sostiene el objeto de la figura 3 y toca la guitarra en la silla de la figura 4». Así mantienes coherentes varios personajes, objetos y entornos dentro de un mismo plano. Una regla estricta: los materiales de referencia (reference_image / video / audio, más documento y página web) son excluyentes con first_frame / last_frame. Mezclarlos hace fallar la tarea en el proveedor, así que la rechazamos antes en local y te decimos qué dos lados chocaron — no gastas una ida y vuelta en ello.
Pasa la URL pública de un archivo PPTX, DOCX, XLSX, PDF, TXT o Markdown (menos de 50 páginas y 100 MB) como file_url y el modelo lee el contenido y genera el vídeo a partir de él — no hace falta aplanarlo antes en un prompt. Presentaciones de lanzamiento, material didáctico e informes entran directamente en el flujo de vídeo. Las páginas web funcionan igual mediante link_url, para páginas públicas que no requieran inicio de sesión. file_url y link_url son excluyentes: envía uno u otro.
Por defecto se genera una pista de audio sincronizada (diálogo, efectos, ambiente); pasa audio: false para quitarla, sin cambio de precio. Las resoluciones son 480P / 720P / 1080P; las relaciones de aspecto, adaptive (por defecto — se infiere de tus entradas y tu intención), 16:9, 4:3, 1:1, 3:4 y 9:16. Una diferencia deliberada respecto al proveedor: si omites resolution, ponemos 720P por defecto en lugar del 1080P de Alibaba, porque 1080P cuesta el doble y nadie debería caer en el nivel más caro por no escribir un parámetro. Pide 1080P explícitamente y lo tendrás.
Medido en el nivel estándar: un clip de 480P y 5 segundos volvió en unos 356 segundos (Alibaba indica 1-5 minutos). Con mode:"prime", el mismo prompt con los mismos parámetros volvió en 58 segundos — unas 6 veces más rápido. Es un endpoint asíncrono de crear y consultar; consulta cada 10-15 segundos o pasa callback_url y te hacemos un POST cuando termina la tarea. Los archivos de resultado se conservan 7 días y luego se borran automáticamente, así que descarga o realoja lo que quieras conservar.
En APIMODELS, Wan 3.0 Video convive con más de 60 modelos bajo una sola clave API y un solo saldo, así que elegir es cuestión de ajuste, no de dependencia. Admite Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio y puedes valorarlo en precio y capacidad frente a otros modelos de generación de video, y cambiar modificando una sola cadena con el nombre del modelo: sin nueva cuenta ni integración. Explora todas las opciones de generación de video con precios en vivo en apimodels.app/models.
Wan 3.0 Video admite: Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio. Consulta la documentación de APIMODELS para ver todos los parámetros y ejemplos de llamada.
Sí. APIMODELS expone Wan 3.0 Video mediante una única API unificada y una sola clave, sin cuentas separadas por proveedor ni necesidad de gestionar tú mismo el acceso de red regional de cada proveedor.
Aceptamos Stripe (Visa, Mastercard y otras tarjetas internacionales) y Alipay. El saldo está disponible al instante tras el pago.