
wan-3.0-videoWan 3.0 es el modelo de vídeo todo en uno de Alibaba: un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o primer+último fotograma, y generación omni-referencia con hasta 10 imágenes, 5 clips de vídeo y 5 de audio — o directamente un documento (PPTX, DOCX, XLSX, PDF, hasta 50 páginas) o una página web pública. Salida nativa de hasta 30 segundos en plano único a 30fps con pista de audio sincronizada que puedes desactivar sin cambio de precio, en 480P / 720P / 1080P y seis relaciones de aspecto. En modo omni-referencia el prompt puede dirigirse a los materiales por posición ("la figura 1 sostiene el objeto de la figura 2"), que es como se mantiene la coherencia de varios personajes y objetos en un plano. La facturación es por segundo: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s. Las imágenes, el audio, los documentos y las páginas web de referencia no cuestan nada, pero un VÍDEO de referencia (edición, extensión o cambio de rostro) también se cobra por su propia duración: segundos del vídeo de entrada + segundos de salida, igual que en el proveedor, que además limita esas tareas a entrada + salida ≤ 30 segundos. No añadimos una capa de moderación propia: los prompts y el material de referencia pasan tal cual se envían. Eso no quiere decir que no haya filtro: los mecanismos de seguridad del propio modelo siguen funcionando y saltan de verdad — se revisan tanto lo que envías como lo que sale, y el material de referencia con rostros de personas reales se rechaza con frecuencia. Revisar lo que generas y cumplir la legislación aplicable y las normas de tu propia plataforma corre de tu cuenta; úsalo solo con personas que hayan dado su consentimiento.
Prompt only
Document-to-video (PPTX / DOCX / XLSX / PDF) and web-page-to-video are API-only for now — see /docs/wan-3-0-video.
Generated video will appear here
Provide URLs and click Generate
Plano único de hasta 30 s a 30fps — o pasa duration -1 y deja que el modelo elija
Hasta 10 imágenes + 5 vídeos + 5 clips de audio; el prompt se refiere a ellos como «figura 1», «vídeo 1»
Entrega un PPTX / DOCX / PDF o una URL pública y el modelo lo lee y lo lleva al plano
Desde $0.045/s en 480p ($0.09 en 720p, $0.18 en 1080p); imágenes, audio y documentos son gratis, pero un vídeo de referencia suma su propia duración
mode:"prime" devolvió en 58 s lo que el estándar tardó 356 s en la misma tarea — un 51–56% más por segundo
Cuando el equipo Tongyi Wanxiang de Alibaba lanzó Wan 3.0 publicó un manual para creadores con 64 parejas de prompt y clip. Volvimos a alojar cada clip, conservamos cada prompt tal cual y medimos los archivos: 64 clips, 1.112 segundos de vídeo en total, todos con pista de audio sincronizada. Diecisiete clips llegan a los 30 segundos que Wan 3.0 permite en una sola toma; quince son piezas de 5 segundos (ediciones y trabajos con vídeo de referencia). Cuarenta y nueve clips pertenecen al nivel 720P (1280×720 o su equivalente vertical) y quince al nivel 1080P (1920×1072 y similares). El conjunto completo, ordenado por tipo de tarea, vive en nuestra biblioteca de prompts de Wan 3.0; la tabla resume para qué se usa el modelo según su propio editor.
El reparto importa porque es la visión del propio editor sobre para qué sirve Wan 3.0. Texto a vídeo y referencia de imagen suman la mitad de los casos, pero la edición de vídeo por sí sola son quince, tantos como la referencia de imagen. Documento a vídeo, la función que ningún otro modelo de este sitio tiene, recibe cinco casos, tres de ellos de 30 segundos. En apimodels.app los ocho tipos de tarea pasan por un único nombre de modelo, wan-3.0-video, en el mismo endpoint de vídeo que VEO, Kling y Seedance.
| Tipo de tarea | Casos | Duración | Nivel de resolución | A qué apunta el prompt | Campos de la API |
|---|---|---|---|---|---|
| Wan 3.0 · Texto a vídeo | 17 | 15–30 s (12 de 30 s) | 9 × 720P, 8 × 1080P | solo el prompt | prompt, duration, resolution, aspect_ratio |
| Wan 3.0 · Referencia de imagen | 15 | 8–30 s | 10 × 720P, 5 × 1080P | 图1 / 图2 … (hasta 10 imágenes) | reference_image_urls |
| Wan 3.0 · Edición de vídeo | 15 | 5–15 s | 14 × 720P, 1 × 1080P | 视频1 = el clip que se edita | reference_video_urls |
| Wan 3.0 · Documento / página web | 5 | 23–30 s | 5 × 720P | un DOCX, PPTX, XLSX o una URL pública | file_url o link_url |
| Wan 3.0 · Referencia de audio | 3 | 15 s | 3 × 720P | 音频1 / 音频2 para la voz o el ritmo | reference_audio_urls (+ imágenes / vídeo) |
| Wan 3.0 · Referencia de vídeo | 3 | 5 s | 3 × 720P | 视频1 para movimiento, cámara o efectos | reference_video_urls (+ imagen) |
| Wan 3.0 · Extensión de vídeo | 3 | 10–20 s | 3 × 720P | 视频1 más la dirección de la extensión | reference_video_urls |
| Wan 3.0 · Primer fotograma | 3 | 15–30 s | 2 × 720P, 1 × 1080P | @Image1 como fotograma uno | first_frame_url |
Un caso por tipo de tarea, elegidos para que cada uno muestre una entrada distinta a la que el prompt debe referirse. Todos los prompts son el texto chino original del editor, sin editar; el clip de al lado es la salida que el manual publicó para ese prompt, no algo regenerado por nosotros. Bajo cada clip están las cifras para presupuestar el mismo trabajo en Wan 3.0 aquí: duración, nivel de resolución, segundos facturados (entrada más salida cuando hay vídeo de referencia) y coste en nuestro nivel estándar. El modo prime, el nivel rápido, cuesta entre un 51 y un 56 % más por segundo y entregó el mismo trabajo en 58 segundos en lugar de 356 en nuestra medición.
Lee los prompts por su estructura, no por su vocabulario. El manual escribe los trabajos largos como una línea de tiempo, se refiere al material por número de ranura, marca el sonido dentro de la frase y cierra cada edición con una oración que dice qué no debe cambiar. Esos cuatro hábitos valen para cualquier trabajo de Wan 3.0 que escribas, en chino o en español.
Un único prompt de 241 caracteres sostiene una toma completa de 30 segundos en Wan 3.0: un pasillo de hospital con filtro verde pálido bajo fluorescentes fríos, baja saturación, alto contraste, la cámara arrancando tras el mostrador de enfermería y siguiendo a una figura de verde oscuro. No se adjunta nada a la petición; el aspecto, el ritmo y el sonido salen solo de la descripción. Fíjate en cuánto texto habla de color y luz y no de trama: la frase del filtro verde decide todo el etalonaje.
Es el tipo de trabajo de Wan 3.0 más económico de reproducir. Envía el prompt con duration 30 y resolution 720P y pagas 30 segundos de salida, 2,70 $ en el nivel estándar.
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。El prompt empieza con 参考 @Image1 的分镜图 (usa el guion gráfico de la imagen 1) y describe tres planos: un general de un pequeño andén bajo la lluvia con una chica bajo un paraguas azul, un plano medio de ella frente a un chico con mochila al otro lado de las vías, y un plano final a través de la lluvia. Wan 3.0 lee la composición y la puesta en escena del guion gráfico y toma la estructura de los tres planos del texto; el clip de 20 segundos los sigue en orden.
En la API es una entrada en reference_image_urls. Las imágenes no tienen coste extra en Wan 3.0, así que la factura es solo la salida: 20 segundos a 720P, 1,80 $.
参考 @Image1 的分镜图,镜头1:雨夜小火车站台全景,长发女孩撑蓝色雨伞独自站在站台上,身后小站房透出暖光,远处青山隐没在雨雾中;镜头2:中景,女孩撑伞与背书包的短发男孩在站台上面对面站立,大雨倾盆,铁轨在两人之间延伸;镜头3:透过雨滴滑落的透明伞面拍摄女孩面部特写,她眼眶泛红,轻声说{到了那边记得发消息};镜头4:从男孩背后越肩拍向女孩方向,远处一列火车亮着车头灯缓缓驶来,雨幕中光晕扩散;镜头5:双手特写,女孩将一张折叠的纸条递到男孩手中,指尖微微颤抖;镜头6:女孩独自站在站台边,目送铁轨延伸向远方,男孩已不在身旁,雨势渐弱。Este caso muestra la gramática de ranuras con total claridad. El prompt define 图片1 como sujeto 1 y 图片2 como sujeto 2, asigna 音频1 como la voz del sujeto 1 y 音频2 como la voz del sujeto 2, los coloca junto a una cinta de correr y escribe el diálogo entre llaves: el sujeto 1 se gira y pregunta qué grupo muscular toca hoy, el sujeto 2 responde mientras se seca con la toalla. Dos clips de audio de 5 y 6 segundos aportan las dos voces; Wan 3.0 clona el timbre y sincroniza los labios.
Imágenes y audio viajan en reference_image_urls y reference_audio_urls, y ninguno suma a la factura. Quince segundos a 720P: 1,35 $.
将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1,主体2台词音色参考音频2,在健身房内,主体1和主体2并排站在跑步机旁,主体1转头微笑对主体2说{今天练哪个部位},主体2一边用毛巾擦汗一边回应{练背吧,昨天腿还酸着呢},主体1笑着点头说{行,我陪你,先热身十分钟},主体2拿起水杯喝一口回应{走吧},背景是器械区和落地镜,写实拍摄,画面明亮通透,冷白色自然饱和度色调Un clip de skate de 5 segundos es la fuente de movimiento; una imagen fija es la fuente de identidad. El prompt pide a Wan 3.0 sustituir al hombre del vídeo 1 por la mujer y su ropa de la imagen 1, y gasta el resto de palabras en el bloqueo: solo cambia la persona, el truco, la trayectoria y el fondo del skatepark siguen exactamente igual. El resultado mantiene el tiempo original fotograma a fotograma.
Como interviene un vídeo de referencia, la facturación cuenta entrada más salida: 5 segundos de entrada, 5 de salida, 10 segundos facturados a 720P, 0,90 $. Los vídeos de referencia en Wan 3.0 pueden durar entre 1 y 15 segundos cada uno y 15 segundos en total entre hasta cinco clips.
参考视频,视频1 @Video 中的滑板男人替换为图片 @Image1 中的女人和衣服,注意:只替换人物,保留原视频中滑板动作、运动轨迹和滑板场背景完全保持不变。La entrada es un archivo XLSX con el GMV mensual de comercio transfronterizo y el prompt es el más largo de los ocho, 2.677 caracteres, porque escribe un montaje de 22 segundos como cuatro segmentos numerados sobre fondo blanco con bloques de color suaves y gráficos de líneas limpios, e insiste en una pista de fondo que empieza en el segundo cero y nunca se corta. Wan 3.0 lee las cifras de la hoja y las anima; el prompt manda sobre el ritmo, la tipografía y el sonido.
Envía el archivo como file_url (se aceptan DOCX, PPTX, XLSX, PDF, TXT y MD, hasta 50 páginas y 100 MB) o una página pública como link_url; los dos son excluyentes. Los documentos no tienen coste extra: 23 segundos a 720P son 2,07 $.
总时长22秒,4个片段顺序拼接。全片纯白底,柔色色块与简洁线条图表,Apple Keynote式极简商务风格,无衬线深灰字体。BGM(必须有,贯穿全片,音量清晰可闻):一段轻快的商务背景音乐,节奏稳定、旋律简洁,从第一秒开始就有音乐,全程不间断,旁白出现时音乐不消失、音量略低于人声。音效层:色块滑入时'嗖'的whoosh声、数字跳动时轻键盘'咔嗒'声、关键数据弹出时清脆的'叮'一声bell。旁白:英文男声或女声,明快自信,语速约2.5词/秒,像在季度会上做presentation的语气——专业但不冰冷,有节奏感,关键数字处微微加重。
H1-2026跨境电商月度GMV.xlsx
片段1:全景,中心构图,纯白底,柔光,极简商务风格,视觉参考参考图1的干净白底+柔和色块。纯白画面从中央展开,无数金色光粒子从画面四周向中心汇聚聚拢,粒子碰撞闪烁后凝结成标题文字'H1 2026 · Wan',文字表面泛着流动的数据流光效,边缘有微光粒子持续环绕飘散,整体炫酷而高级。停留片刻后标题化作粒子流散消失,下方同时滑入两组大号深灰数字——左侧是第7行B7单元格的值$1,580(1月GMV)、右侧是G7单元格的值$3,460(6月GMV),中间一个浅灰色箭头连接,箭头下方浮出浅灰小字'Monthly GMV Growth'。底部弹出一枚珊瑚色圆角标签,显示第8行H8单元格的值+45.7%(H1整体增幅),弹出时伴随清脆的'叮'一声。旁白明快自信地说道:'In the first half of 2026, monthly GMV grew from 15.8 to 34.6 million dollars.' BGM从画面第一秒起就清晰响起,轻快节奏贯穿,色块滑入时带轻微的'嗖'whoosh声。片段末尾色块向两侧平滑滑开,露出下一段画面。
片段2:全景,左侧Y轴+底部X轴构图,纯白底+浅灰点状网格,柔光,极简商务风格,视觉参考参考图2的趋势线图风格。画面底部X轴从左到右依次清晰标注六个月份标签:Jan、Feb、Mar、Apr、May、Jun,等距排列,浅灰色无衬线字体。左侧Y轴标注数值刻度。画面从左向右同时绘制三条趋势线——珊瑚色代表东南亚(数据取自第4行:B4=$580, C4=$640, D4=$750, E4=$880, F4=$1,050, G4=$1,280)、青蓝色代表北美(第5行:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260)、琥珀色代表欧洲(第6行:B6=$580, C6=$610, D6=$680, E6=$750, F6=$830, G6=$920),三条线从Jan同一位置出发,随节奏向右上方延伸至Jun。线条下方各带30%透明度渐变填充。每个月份节点到达时,数据点轻弹一下,正上方浮出该点的精确数值标签——标签只显示美元数值,不显示百分比、不显示其他文字,数值必须与上述单元格完全一致。右上角滑出图例:三个色块配市场英文名。六个点全部到达后画面定格片刻。旁白节奏稳定地说道:'All three markets — Southeast Asia, North America, and Europe — showed consistent month-over-month growth, with no single dip.' BGM持续可闻,数字弹出时伴随细碎的'咔嗒'键盘音。6月终点标签放大填满画面后缩小重组,过渡至下一段。
片段3:全景,左60%柱状图+右40%数据列构图,纯白底,柔光,极简商务风格,视觉参考参考图1的柱状图风格。白底上从左到右依次升起6根青蓝色圆角柱体,分别对应1月至6月——必须完整展示6根柱子,柱体高度严格对应第5行North America各月数值:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260,从低到高递增排列,呈现明显的逐月增长趋势。每根柱体升起时带轻微的'嗖'弹性音效,柱顶浮出对应的精确美元数值标签。柱体全部就位后,右侧纵向排列滑出5个北美逐月环比增长率,分别由相邻两月数值计算得出:Feb +14.3%(C5相对B5)、Mar +16.7%(D5相对C5)、Apr +21.4%(E5相对D5)、May +26.5%(F5相对E5)、Jun +46.5%(G5相对F5)。每个增长率显示为:翠绿色向上箭头图标 + 百分比数值(如↑+14.3%),整体呈阶梯状从上到下依次排列,绿色箭头强调增长态势,字体略大确保清晰可读。每个数字滑入时带一声细碎的'咔嗒'。最后,北美整体增幅用珊瑚色大号字体从中央弹出:+200%(由G5=$1,260相对B5=$420计算),伴随清脆的'叮'一声bell,停留片刻,数字周围散发轻微光晕。旁白在关键数据处微微加重语气:'North America was our growth engine — up two hundred percent in just six months, accelerating every single month.' BGM持续清晰,节奏逐渐推向高点。整体增幅数字居中放大,周围元素柔和淡出,过渡至尾段。
片段4:全景,中心构图偏上,纯白底,柔光,极简商务风格,视觉参考参考图3的环形图风格。白底中央浮现一个简约环形图(甜甜圈图),只有三段弧形,分别用珊瑚色、青蓝色、琥珀色渲染三个市场的H1占比——东南亚占比由H4=5180计算、北美由H5=4260计算、欧洲由H6=4370计算,三者总和H7=13810。三段弧形之间用白色间隙分隔,环形图整体干净简洁,图表上没有任何百分比符号、没有任何数字标注、没有任何散落的标签,只有纯粹的三段色弧。环形图以约10°/s的速度缓缓旋转。环形图正中央显示一个大号深灰数字,该数字从0快速跳动至H7单元格的值$138.1M(即13810万美元),跳动时伴随连续的细碎'咔嗒'声,最终数字落定时一声清脆的'叮'。下方淡入一行浅灰副标题'Three Markets · All Growing · Zero Downturn'。旁白沉稳收尾,说完留1秒静音:'138 million in total — all markets growing, zero downturns.' BGM持续可闻,最后缓缓衰减,1秒静音后全片结束。El mismo metraje de skate que en el caso de referencia de vídeo, pero otro trabajo. El prompt empieza con 编辑视频 (edita el vídeo) y convierte al hombre del vídeo 1 en una mujer de pelo corto con top deportivo y pantalón cargo holgado, conservando la gorra y las protecciones del original, el truco, la trayectoria y el skatepark. Arriba se reproducen el antes y el después uno junto al otro; solo cambió el sujeto. Quince de los 64 casos del manual son ediciones de esta forma: añadir un elemento, sustituirlo, borrarlo, reiluminar, cambiar el estilo, reescribir una línea de diálogo o rehacer la trama.
Las ediciones conservan la duración de entrada, así que una fuente de 5 segundos devuelve un resultado de 5 segundos y factura 10: 0,90 $ a 720P.
编辑视频,视频1中的滑板男人替换为一位短发女人,穿运动背心和宽松工装裤,保留原视频中的棒球帽、护膝护肘等护具,滑板动作、运动轨迹和滑板场背景完全保持不变。El prompt empieza con 将视频1延长15s (extiende el vídeo 1 en 15 segundos) y luego hace lo que casi todos olvidan: nombra a los dos personajes del metraje existente por su ropa y sus objetos (el hombre de túnica china gris oscuro con el rosario de cuentas, el hombre de túnica oscura) y escribe los nuevos compases con su diálogo, hasta la frase sobre cuándo llega la mercancía al puerto. Wan 3.0 continúa la escena desde el último fotograma con las mismas dos personas y la misma sala, y los 15 segundos nuevos llevan el diálogo escrito.
Una fuente de 5 segundos extendida a un resultado de 20 factura 25 segundos (5 de entrada, 20 de salida): 2,25 $ a 720P. El proveedor limita entrada más salida a 30 segundos, por eso el manual extiende clips de 5 segundos y no de 15.
将视频1延长15s。角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人,角色B为穿深色中式长衫的男人。角色B缓缓放下茶碗,目光微沉,用指尖轻叩桌面两下,不紧不慢说"价钱好讲,但货要几时到埠,你要畀个准数我。"角色A笑容不减,端起盖碗刮了刮茶沫。角色A呷一口茶,将茶碗搁回茶托,身体前倾压低声音,佛珠随手势轻晃,语气笃定"最迟月底,码头嗰边我已经打点好晒,一船货齐齐整整运到你仓库门口。"说罢右手掌心朝下往桌面一按,目光直视角色B。角色B沉吟片刻,视线扫向窗外"萬安當"牌匾,竹帘被街上微风轻轻掀起。他转回头,嘴角浮起笑意,拿起盖碗朝角色A微微一举,"好,月底交货,我等你好消息。"两人相视而笑。保持民国商战片的沉稳调性,对话节奏从容,茶馆环境音低沉衬底。Un caso vertical de 720×1280. El prompt está escrito como una lista de planos con códigos de tiempo: 0:00–0:03 plano medio, la silueta del espadachín en el bosque de bambú a tinta de @Image1, la mano sobre la empuñadura, hojas cayendo; después los compases siguientes suben de intensidad. Como la imagen se pasa como primer fotograma y no como referencia, Wan 3.0 la trata como fotograma uno y la anima a partir de ahí; todo lo que describe el prompt es movimiento que se aleja de esa imagen.
En Wan 3.0 first_frame_url no puede combinarse con los campos reference_*, file_url ni link_url; la petición se rechaza antes de ejecutarse. Veinte segundos a 720P: 1,80 $.
(0:00 - 0:03) 运镜:中景。
画面:沿用 @Image1 的水墨竹林场景。头戴斗笠、身着墨色长袍的刀客,其剪影伫立在浓雾环绕、竹影婆娑的中心。
动作:刀客左手轻按刀柄,竹叶随风飘落。
氛围:寂静,压抑,水墨晕染的颗粒感清晰可见。
(0:03 - 0:08) 剧情引入,运镜:特写。
剧情:刀客察觉杀气。
画面:镜头快速推进到刀客斗笠下的特写。
细节:斗笠边缘露出一双凌厉、决绝的眼睛,眼神如刀。水墨晕染的“汗珠”从额头滑落。
动作:刀客右手缓缓握紧刀柄,指关节泛白。竹叶飘落的速度加快。
(0:08 - 0:13) 运镜:快速环绕。
画面:镜头以刀客为中心快速环绕。
剧情:两名同样是水墨剪影的刺客从竹林深处杀出,手持双钩和短刃。
细节:刺客的动作也是水墨笔触构成的,如墨迹流动。镜头快速掠过刺客的身影,强调速度感。
(0:13 - 0:18) 运镜:手持感,高速捕捉。
打斗:刀客猛然拔刀,刀光是一道纯白色的水墨裂痕。刺客双钩攻来。
细节:
一击:刀客回身一斩,刀刃与刺客双钩碰撞,迸发出无数黑白相间、带有书法感的火花和墨点。
二击:刀客虚晃一枪,利用竹竿弹射,从高处劈下。刺客翻滚躲避。竹竿被打断,化作飞散的墨痕。
三击:刀客刀尖直指另一刺客咽喉,刺客以短刃格挡,镜头捕捉刀刃与短刃摩擦时细微的墨迹崩裂细节。
**(0:18 - 0:20) 运镜:慢镜头至定格。**
* **画面:** 刀客的刀停在刺客颈侧,刺客凝固。
* **细节:** 刀客的斗笠在打斗中略微倾斜。竹林归于平静,更多竹叶飞舞。
* **氛围:** 镜头慢慢拉远,回到中景,定格在刀客收刀、刺客倒地的画面。
* **文字(可选):** 画面下方显现水墨风文字:“江湖,不过一笔勾销。”
**风格说明:** 整个过程保持 `image_0.png` 的高度黑白、水墨画风格,动作必须有毛笔触感,速度要快,细节要足(墨滴、火花、墨痕裂口)。Los 64 prompts van de 18 a 3.423 caracteres, y los largos no están rellenados: son líneas de tiempo. Abajo están los ocho hábitos que se repiten en el conjunto, cada uno con un fragmento citado de un caso real para que veas la redacción exacta a la que respondió Wan 3.0. Los fragmentos están en chino porque el manual lo está; la estructura no depende del idioma y funciona en español sobre el mismo modelo.
Dos de estos hábitos pesan más que el resto. Numerar el material (图1, 视频1, 音频1) es la forma en que Wan 3.0 sabe qué archivo cumple qué papel cuando hay varios adjuntos, y el bloqueo final, la frase que dice qué debe quedarse igual, es lo que separa una edición limpia de un fotograma reinventado.
| Hábito | Qué hace en Wan 3.0 | Cita de un caso |
|---|---|---|
| Wan 3.0 · Numerar el material | imágenes, vídeos y audios de referencia se nombran por ranura, contados por separado | 将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1 |
| Wan 3.0 · Escribir una línea de tiempo | todo trabajo de más de 10 s se divide en segmentos con tiempo que el modelo sigue en orden | 镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底 |
| Wan 3.0 · Duración, formato y fps al principio | la primera frase lleva la especificación de entrega y coincide con el parámetro duration | 生成一支10秒、16:9横版、1920×1080、30fps、单镜头连续完成的微缩奇幻高速追逐短片 |
| Wan 3.0 · Marcar el sonido en la frase | efectos entre ángulos, diálogo entre llaves o comillas; Wan 3.0 genera ambos | 用抹布仔细擦拭吧台<抹布摩擦声> |
| Wan 3.0 · Bloquear lo que no cambia | toda edición termina con los elementos que se quedan como están | 女人的动作和画面其余部分保持不变 |
| Wan 3.0 · Nombrar personajes por su ropa | extensiones y ediciones vuelven a identificar a las personas del metraje antes de añadir compases | 角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人 |
| Wan 3.0 · Dar a la referencia un solo papel | un clip se nombra como fuente de movimiento, cámara o efecto, no de todo | 参考视频的运镜方式,场景更改为一杯咖啡放在天台咖啡桌上 |
| Wan 3.0 · Describir movimiento desde una imagen fija | los prompts de primer fotograma escriben lo que se mueve fuera de la imagen, con códigos de tiempo | (0:00 - 0:03) 运镜:中景。 画面:沿用 @Image1 的水墨竹林场景 |
Doce de los diecisiete casos de texto a vídeo llegan a los 30 segundos, y comparten esqueleto. Un resumen de una línea fija género, duración y aspecto. Una frase de paleta y luz fija el etalonaje. Después la línea de tiempo: planos numerados o rangos de segundos, cada uno con cámara, acción y el sonido que suena debajo. Los casos largos añaden un párrafo de continuidad que describe una sola vez la cara, el pelo y el vestuario del personaje para que cada segmento lo reutilice. El orden es constante en todo el manual: especificación y aspecto primero, trama después, de modo que quien lee (o el modelo) recibe las restricciones de entrega antes que la historia.
El mismo esqueleto se reduce sin problema. Una edición de 5 segundos es un resumen, una acción y un bloqueo. Un clip de producto de 15 segundos es un resumen, una frase de luz y tres compases con tiempo. Lo que nunca aparece en el manual es un muro de adjetivos sin estructura temporal: ese es el prompt que sale lento, porque Wan 3.0 reparte la acción de forma uniforme por el clip cuando nadie le dice cuándo pasan las cosas.
| Bloque | Función | Así aparece en los casos |
|---|---|---|
| Wan 3.0 · Resumen | género, duración, formato y aspecto en una línea | 这是一段30秒的真实电影质感海上巨兽登场场景,整体氛围参考好莱坞灾难怪兽大片 |
| Wan 3.0 · Paleta y luz | una frase que decide el etalonaje | 整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围 |
| Wan 3.0 · Hoja de continuidad | cara, pelo y vestuario una sola vez, reutilizados por cada segmento | 严格保持男性角色的黑发高发髻、鬓角碎发被风吹起、锐利深色瞳 |
| Wan 3.0 · Línea de tiempo | planos numerados o rangos de segundos con cámara, acción y sonido | 分段1[0-5秒]:一个连续的、照片级写实的电影镜头 |
| Wan 3.0 · Sonido | ambiente, efectos y diálogo colocados donde ocurren | BGM(必须有,贯穿全片,音量清晰可闻) |
| Wan 3.0 · Bloqueo | en ediciones y extensiones: qué se queda igual | 滑板动作、运动轨迹和滑板场背景完全保持不变 |
Cada caso de arriba se corresponde con una petición a POST /api/v1/video/generations con model wan-3.0-video. El prompt entra tal como está escrito; el material que el prompt numera entra en el array correspondiente en el mismo orden, porque 图1 es la primera entrada de reference_image_urls y 视频1 la primera de reference_video_urls. Wan 3.0 tiene dos modos de entrada que no se mezclan: modo fotograma (first_frame_url, opcionalmente last_frame_url) y modo referencia (reference_image_urls, reference_video_urls, reference_audio_urls, file_url o link_url). Una petición mixta la rechazamos en local y señalamos ambos lados, así que nunca llega al proveedor.
Dos parámetros cambian el resultado sin tocar el prompt. mode: prime pasa al nivel rápido, un 51–56 % más caro por segundo con capacidades idénticas. prompt_extend, activo por defecto, permite a Wan 3.0 reescribir prompts cortos; los del manual son lo bastante largos como para desactivarlo y obtener exactamente lo que escribiste.
| Tipo de caso | Campos a enviar | Límites en Wan 3.0 |
|---|---|---|
| Wan 3.0 · Texto a vídeo | prompt, duration 2–30 (o -1 para que el modelo elija), resolution 480P / 720P / 1080P, aspect_ratio | una sola toma de hasta 30 s, 30 fps, audio activado por defecto |
| Wan 3.0 · Primer fotograma / primero + último | first_frame_url, last_frame_url | excluyente con todos los campos de referencia |
| Wan 3.0 · Referencia de imagen | reference_image_urls | hasta 10 imágenes, sin coste extra |
| Wan 3.0 · Referencia de vídeo, edición, extensión | reference_video_urls | hasta 5 clips, 1–15 s cada uno, 15 s en total; se factura entrada + salida; entrada + salida ≤ 30 s |
| Wan 3.0 · Referencia de audio | reference_audio_urls | hasta 5 clips, 15 s en total, wav o mp3, sin coste extra |
| Wan 3.0 · Documento / página web | file_url o link_url (uno de los dos) | DOCX, PPTX, XLSX, PDF, TXT, MD… ≤ 50 páginas, ≤ 100 MB; solo URL pública |
| Wan 3.0 · Nivel de velocidad | mode: standard (por defecto) o prime | prime cuesta un 51–56 % más por segundo, mismas capacidades |
Wan 3.0 se factura por segundo de salida, según resolución: 0,045 $ a 480P, 0,09 $ a 720P y 0,18 $ a 1080P en el nivel estándar; prime son 0,068 $, 0,14 $ y 0,28 $. Imágenes de referencia, audio, documentos y páginas web son gratis; un vídeo de referencia suma su propia duración a los segundos facturados. Solo se cobran los trabajos completados. La tabla pone precio a cada caso en la resolución en la que su clip se entregó realmente, así que un clip a 720P se cotiza a 720P aunque el autor del manual pudiera haber pedido 1080P.
Para planificar: el conjunto completo de 64 casos son 1.112 segundos de salida más 147 segundos de entrada de los 22 trabajos con vídeo de referencia, 1.258 segundos facturados en total, unos 113 $ a la tarifa estándar de 720P. Es lo que cuesta reproducir todo un manual de lanzamiento en Wan 3.0.
| Caso | Salida | Segundos facturados | Nivel estándar | Nivel prime |
|---|---|---|---|---|
| Wan 3.0 · Pasillo de hospital, texto a vídeo | 30 s · 720P | 30 | 2,70 $ | 4,20 $ |
| Wan 3.0 · Despedida con guion gráfico, referencia de imagen | 20 s · 720P | 20 | 1,80 $ | 2,80 $ |
| Wan 3.0 · Conversación en el gimnasio, referencia de audio | 15 s · 720P | 15 | 1,35 $ | 2,10 $ |
| Wan 3.0 · Cambio de patinador, referencia de vídeo | 5 s · 720P (5 s de entrada) | 10 | 0,90 $ | 1,40 $ |
| Wan 3.0 · Hoja de GMV, documento a vídeo | 23 s · 720P | 23 | 2,07 $ | 3,22 $ |
| Wan 3.0 · Patinador a mujer, edición de vídeo | 5 s · 720P (5 s de entrada) | 10 | 0,90 $ | 1,40 $ |
| Wan 3.0 · Negociación en la mesa de té, extensión | 20 s · 720P (5 s de entrada) | 25 | 2,25 $ | 3,50 $ |
| Wan 3.0 · Espadachín a tinta, primer fotograma | 20 s · 720P | 20 | 1,80 $ | 2,80 $ |
Treinta segundos es un techo duro por trabajo, y con vídeo de referencia es un techo compartido: entrada más salida no pueden superar los 30 segundos, por eso cada extensión del manual parte de un clip de 5 segundos. El vídeo de referencia está limitado a 15 segundos en total entre como máximo cinco clips, el audio de referencia a 15 segundos en total, las imágenes a diez y los documentos a 50 páginas. El modo fotograma y el modo referencia no se combinan, y file_url y link_url no pueden enviarse a la vez. Ninguno de estos límites es nuestro; son de Wan 3.0, y los aplicamos antes de que la petición salga, así que un trabajo rechazado nunca cuesta un viaje de ida y vuelta.
Lo que el manual no muestra dice tanto como lo que muestra. Ningún caso usa la fotografía de una persona real identificable como referencia, y ninguno depende de renderizar texto dentro del cuadro más allá de un logo o un rótulo ya presentes en la entrada. Trata ambas cosas como no verificadas en Wan 3.0, no como soportadas. Las imágenes y documentos de referencia de los casos de referencia no se publicaron con el manual, así que esas tarjetas llevan solo el prompt y el resultado.
Tres modelos de apimodels.app aceptan vídeo y audio de referencia y generan 15 segundos o más en una sola toma. Las cifras son las que declara cada página de modelo; los precios son nuestras tarifas por segundo en el nivel indicado.
| Wan 3.0 | Seedance 2.5 | MiniMax H3 | |
|---|---|---|---|
| Duración por toma | 2–30 s | 4–30 s | 5–15 s |
| Referencias por trabajo | 10 imágenes + 5 vídeos + 5 audios, o un documento / página web | 30 imágenes + 10 vídeos + 10 audios | 9 imágenes + 3 vídeos + 3 audios |
| Resoluciones | 480P / 720P / 1080P | 480p / 720p | 768P / 2K |
| Precio por segundo aquí | 0,045 $ / 0,09 $ / 0,18 $ | 0,120 $ / 0,270 $ | 0,097 $ / 0,145 $ |
| Edición y extensión de vídeo | sí, mediante vídeo de referencia | sí, tipos de tarea dedicados | edición generativa |
| Documento o página web como entrada | sí | no | no |
| Audio nativo sincronizado | sí | sí | sí |
Wan 3.0 Video es una API de generación de video de Alibaba. Wan 3.0 es el modelo de vídeo todo en uno de Alibaba: un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o primer+último fotograma, y generación omni-referencia con hasta 10 imágenes, 5 clips de vídeo y 5 de audio — o directamente un documento (PPTX, DOCX, XLSX, PDF, hasta 50 páginas) o una página web pública. Salida nativa de hasta 30 segundos en plano único a 30fps con pista de audio sincronizada que puedes desactivar sin cambio de precio, en 480P / 720P / 1080P y seis relaciones de aspecto. En modo omni-referencia el prompt puede dirigirse a los materiales por posición ("la figura 1 sostiene el objeto de la figura 2"), que es como se mantiene la coherencia de varios personajes y objetos en un plano. La facturación es por segundo: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s. Las imágenes, el audio, los documentos y las páginas web de referencia no cuestan nada, pero un VÍDEO de referencia (edición, extensión o cambio de rostro) también se cobra por su propia duración: segundos del vídeo de entrada + segundos de salida, igual que en el proveedor, que además limita esas tareas a entrada + salida ≤ 30 segundos. No añadimos una capa de moderación propia: los prompts y el material de referencia pasan tal cual se envían. Eso no quiere decir que no haya filtro: los mecanismos de seguridad del propio modelo siguen funcionando y saltan de verdad — se revisan tanto lo que envías como lo que sale, y el material de referencia con rostros de personas reales se rechaza con frecuencia. Revisar lo que generas y cumplir la legislación aplicable y las normas de tu propia plataforma corre de tu cuenta; úsalo solo con personas que hayan dado su consentimiento. A través de la plataforma APIMODELS puedes acceder a este modelo mediante una API unificada con precios de pago por uso transparentes. Precio actual: 480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28.
Genera rápidamente videos promocionales de marca para campañas y redes sociales.
Crea contenido de video corto atractivo para TikTok, Instagram y YouTube.
Genera demostraciones de funciones y tutoriales para mejorar la conversión.
Produce explicaciones de cursos, divulgación y videos de formación a bajo coste.
Wan 3.0 Video está disponible a través de APIMODELS a: 480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28. La facturación es de pago por uso: solo pagas por lo que generas.
Regístrate en APIMODELS, obtén tu clave API y llama a nuestro endpoint unificado. Ofrecemos documentación detallada con ejemplos en cURL, Python y Node.js.
APIMODELS ofrece el mismo modelo Wan 3.0 Video a través de nuestra plataforma de agregación. Proporcionamos una interfaz de API unificada, así que no necesitas cuentas separadas por proveedor: una sola clave para acceder a todos los modelos.
Wan 3.0 (万相 3.0) es el modelo de vídeo todo en uno de Alibaba, lanzado en agosto de 2026. Un solo nombre de modelo cubre texto a vídeo, imagen a vídeo por primer fotograma o por primer y último fotograma, y la generación «omni-referencia» guiada por hasta 10 imágenes, 5 clips de vídeo y 5 de audio de referencia (15 segundos en total para vídeo y otros 15 para audio) — o por un documento (PPTX, DOCX, XLSX, PDF, TXT, MD, hasta 50 páginas) o una página web pública. En apimodels.app haces POST a /api/v1/video/generations con model "wan-3.0-video" y luego consultas el mismo endpoint con el task_id devuelto. La forma de la petición es la misma que la de VEO, Kling y Seedance aquí, así que cambiar de modelo es cambiar una cadena y una sola clave las cubre todas.
Porque la mayoría no puede abrir la cuenta. Wan 3.0 hoy solo se sirve desde las regiones de China (Pekín) y Singapur de Alibaba Model Studio — sondeamos la región de EE. UU. (Virginia) y no ofrece el modelo en absoluto (ese espacio de trabajo lista 92 modelos y ninguno es de vídeo). La estación china exige verificación de identidad real de China continental para registrarse, y ahí se quedan los desarrolladores de fuera. Pasar por apimodels.app no requiere cuenta de Alibaba Cloud, ni verificación, ni una relación de facturación aparte: la misma clave y el mismo endpoint que ya usas con el resto de modelos.
Se factura por segundo. El nivel estándar está un 10% por debajo del precio oficial en dólares de Alibaba: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s — un clip de 5 segundos en 720p sale a unos $0.45, uno de 10 segundos en 1080p a unos $1.80 y uno de 30 segundos en 1080p a unos $5.40. El nivel mode:"prime" va a precio de lista ($0.068 / $0.14 / $0.28), es decir, un 51–56% más por segundo que el estándar. Las imágenes, audios, documentos y páginas web de referencia son gratis; si envías un VÍDEO de referencia (edición, extensión, cambio de personaje), los segundos del vídeo de entrada también se facturan, igual que en el proveedor. Las tareas fallidas no se cobran.
Sí — duration acepta cualquier entero de 2 a 30 y la salida es un plano único nativo a 30fps, no segmentos pegados. Pasar -1 activa la duración inteligente: el modelo elige una longitud entre 2 y 30 segundos según tu prompt y tus materiales. Con -1 reservamos por adelantado el peor caso de 30 segundos y, cuando el proveedor informa la longitud real, cobramos esa y devolvemos la diferencia — un modelo que decide 5 segundos nunca te cuesta 30. Ten en cuenta que, si aportas vídeo de referencia, la longitud del vídeo de entrada más la de salida debe quedar dentro de 30 segundos.
Envía los materiales en orden y el prompt puede referirse a ellos por posición: «figura 1», «figura 2», «vídeo 1», «audio 1» — imágenes, vídeos y audios se numeran por separado. Por ejemplo: «la persona del vídeo 1 sostiene el objeto de la figura 3 y toca la guitarra en la silla de la figura 4». Así mantienes coherentes varios personajes, objetos y entornos dentro de un mismo plano. Una regla estricta: los materiales de referencia (reference_image / video / audio, más documento y página web) son excluyentes con first_frame / last_frame. Mezclarlos hace fallar la tarea en el proveedor, así que la rechazamos antes en local y te decimos qué dos lados chocaron — no gastas una ida y vuelta en ello.
Pasa la URL pública de un archivo PPTX, DOCX, XLSX, PDF, TXT o Markdown (menos de 50 páginas y 100 MB) como file_url y el modelo lee el contenido y genera el vídeo a partir de él — no hace falta aplanarlo antes en un prompt. Presentaciones de lanzamiento, material didáctico e informes entran directamente en el flujo de vídeo. Las páginas web funcionan igual mediante link_url, para páginas públicas que no requieran inicio de sesión. file_url y link_url son excluyentes: envía uno u otro.
Por defecto se genera una pista de audio sincronizada (diálogo, efectos, ambiente); pasa audio: false para quitarla, sin cambio de precio. Las resoluciones son 480P / 720P / 1080P; las relaciones de aspecto, adaptive (por defecto — se infiere de tus entradas y tu intención), 16:9, 4:3, 1:1, 3:4 y 9:16. Una diferencia deliberada respecto al proveedor: si omites resolution, ponemos 720P por defecto en lugar del 1080P de Alibaba, porque 1080P cuesta el doble y nadie debería caer en el nivel más caro por no escribir un parámetro. Pide 1080P explícitamente y lo tendrás.
Medido en el nivel estándar: un clip de 480P y 5 segundos volvió en unos 356 segundos (Alibaba indica 1-5 minutos). Con mode:"prime", el mismo prompt con los mismos parámetros volvió en 58 segundos — unas 6 veces más rápido. Es un endpoint asíncrono de crear y consultar; consulta cada 10-15 segundos o pasa callback_url y te hacemos un POST cuando termina la tarea. Los archivos de resultado se conservan 30 días y luego se borran automáticamente, así que descarga o realoja lo que quieras conservar.
En APIMODELS, Wan 3.0 Video convive con más de 60 modelos bajo una sola clave API y un solo saldo, así que elegir es cuestión de ajuste, no de dependencia. Admite Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio y puedes valorarlo en precio y capacidad frente a otros modelos de generación de video, y cambiar modificando una sola cadena con el nombre del modelo: sin nueva cuenta ni integración. Explora todas las opciones de generación de video con precios en vivo en apimodels.app/models.
Wan 3.0 Video admite: Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio. Consulta la documentación de APIMODELS para ver todos los parámetros y ejemplos de llamada.
Sí. APIMODELS expone Wan 3.0 Video mediante una única API unificada y una sola clave, sin cuentas separadas por proveedor ni necesidad de gestionar tú mismo el acceso de red regional de cada proveedor.
Aceptamos Stripe (Visa, Mastercard y otras tarjetas internacionales) y Alipay. El saldo está disponible al instante tras el pago.
Prompts shared by their authors — copy and adapt them. Each one credits its author and links back to the original post.

Graduation-gown close-up: a worried monologue to camera
这是一个正面的近景镜头,画面主要呈现一位年轻黑人女孩的头部和上半身,她穿着一件蓝色的毕业袍。镜头稍微偏一点点,可以看到左边还有一个人,但背景被虚化处理了,看起来很模糊。女孩正对着镜头说话,嘴巴在动,眉头稍微皱着,表情看起来有点严肃和忧虑。光线从上方照下来,把她脸上的轮廓衬托得很自然,甚至能看到皮肤真实的质感。镜头虽然固定,但带着一点点人手持拍摄时的轻微呼吸感和晃动,视线从看着前面慢慢变成了低头看手里。
by Wan 3.0 视频创作者手册 · 通义万相

Suspense long take down an empty hospital corridor
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。
by Wan 3.0 视频创作者手册 · 通义万相

One-take comedy: director versus leading lady on set
镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底(单镜头连续无缝运镜): 画面左侧是身穿黑色潮流导演马甲、戴着高档专业工作耳麦的导演,其左下方放置着一台巨大的专业电影摄像机。右侧是妆容精致、留着时尚韩式逗号刘海、身穿高定制西装的关系户小鲜肉。背景是宽敞的专业影棚拍摄现场,可见巨大的绿色幕布、数个高耸的影视级C型灯架、缠绕的电线,以及在背景中穿梭忙碌的灯光师和化妆师等工作人员。 专业影棚人工光。柔和的LED柔光箱光源从右侧洒入,将三位主角的面部均匀照亮,场景色彩饱满。背景的摄影器材与绿幕在充足的影棚灯光下投射出淡淡的阴影,呈现出真实而忙碌的现代化大制作片场质感。 镜头手持拍摄一镜到底,近景,镜头一开始,拍摄导演,导演无所谓的表情,瞥了一眼画面右侧斜前方画外的一眼关系户小鲜肉,对他下达指令,说道:“媒体故意黑你,做个表情看看”。说完后镜头快速右摇到关系户面部近景,镜头不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,神色自若,眼神真挚而自信。他嘴唇微动,神情专业地向对方阐述到““就这种事情来说,情绪可以有好几种”,说话时,头部伴有极其轻微的自然晃动,说完后镜头快速左摇到导演面部近景,镜头不要切镜,导演思索了一下,一边挑衅似地歪了歪头,向关系户小鲜肉说到““狗仔爆料你深夜幽会”,导演说完台词后,镜头迅速右摇到小鲜肉面部近景,不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,并快速进入表演状态,他眉头紧锁,眼神慌乱、焦急地快速游移,随后他狠狠地咬紧下唇,闭上双眼,整张脸(虽带着精致妆容)因极度的焦虑而紧绷,完美呈现出面对偶像生涯毁灭时,内心惊恐、紧张交织的挣扎状态。表演完后, 镜头再次迅速左摇到导演近景,不要切镜,导演面部表情微变,语速加快,说到““媒体又帮你洗白了,说那是你亲姐!”导演说完后,镜头再次迅速右摇到小鲜肉近景,镜头不要切镜,镜头中,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,他的表情在千分之一秒内完成神级转换。他先是面部一滞,随后双眼猛地眯起,嘴角极大程度地咧开,露出一排白皙的牙齿,展露出一个极其夸张、甚至有些变形的狂喜笑容。这种“星途尽毁的绝望”与“彻底摆脱束缚”交织的疯魔情绪在他脸上扭曲呈现。角色表演完后,镜头再次迅速左摇到导演近景,镜头不要切镜,导演说到“你亲姐向媒体透露,你是领养的”,导演说完后,镜头再次迅速右摇到小鲜肉近景。镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他双眼暴睁,眼球凸出,精心修剪的眉毛高高扬起,嘴巴震惊地张成“O”形。紧接着,他的嘴角再次无法克制地向上拉扯,露出一副不可思议、惊魂未定却的复杂神态。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,紧接着导演露出有点惊讶的表情说到“其实你是千亿豪门真少爷”。导演说完,镜头再次随即迅速右摇到小鲜肉近景,镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,他瞬间爆发出极度魔性的狂喜。他整个人激动得微微颤抖,双眼笑得眯成了一条缝,双手甚至抬起至胸前,双手小幅度快速连续鼓掌,身体前倾摇晃,将一夜暴富、无法自持的癫狂喜悦演绎得淋漓尽致。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,导演说到“你姐卷款跑路”导演说完,镜头再次迅速右摇到小鲜肉近景。小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他的双眼再次瞪大,瞳孔颤抖,嘴角向下耷拉,神情在一秒钟之内从天堂坠入地狱,写满了惊愕、痛苦与不知所措。画面最后定格在这个表情上。
by Wan 3.0 视频创作者手册 · 通义万相
We curate copy-ready prompt libraries — every entry shows its full text and a sample result, ready to adapt.
How to get access, regional availability, and how this model compares with its alternatives.