
wan-3.0-videoO Wan 3.0 é o modelo de vídeo tudo-em-um da Alibaba: um único nome de modelo cobre texto para vídeo, imagem para vídeo por primeiro quadro ou primeiro+último quadro, e geração omni-referência com até 10 imagens, 5 clipes de vídeo e 5 de áudio — ou diretamente um documento (PPTX, DOCX, XLSX, PDF, até 50 páginas) ou uma página web pública. Saída nativa de até 30 segundos em plano único a 30fps com trilha de áudio sincronizada que pode ser desligada sem mudança de preço, em 480P / 720P / 1080P e seis proporções. No modo omni-referência o prompt pode se dirigir aos materiais por posição ("a figura 1 segura o objeto da figura 2"), que é como se mantém a consistência de vários personagens e objetos numa cena. A cobrança é por segundo: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s. Imagens, áudio, documentos e páginas web de referência não custam nada, mas um VÍDEO de referência (edição, extensão ou troca de rosto) também é cobrado pela própria duração: segundos do vídeo de entrada + segundos de saída, igual ao fornecedor, que ainda limita essas tarefas a entrada + saída ≤ 30 segundos. Não colocamos uma camada de moderação nossa: os prompts e o material de referência passam exatamente como foram enviados. Isso não quer dizer que não haja filtro: os mecanismos de segurança do próprio modelo continuam valendo e realmente disparam — tanto o que você envia quanto o que sai passam por análise, e material de referência com rostos de pessoas reais é recusado com frequência. Revisar o que você gera e atender à legislação aplicável e às regras da sua própria plataforma é responsabilidade sua; use apenas com pessoas que tenham dado consentimento.
Prompt only
Document-to-video (PPTX / DOCX / XLSX / PDF) and web-page-to-video are API-only for now — see /docs/wan-3-0-video.
Generated video will appear here
Provide URLs and click Generate
Plano único de até 30 s a 30fps — ou passe duration -1 e deixe o modelo escolher
Até 10 imagens + 5 vídeos + 5 clipes de áudio; o prompt se refere a eles como «figura 1», «vídeo 1»
Entregue um PPTX / DOCX / PDF ou uma URL pública e o modelo o lê e leva para o plano
A partir de $0.045/s em 480p ($0.09 em 720p, $0.18 em 1080p); imagens, áudio e documentos são gratuitos, mas um vídeo de referência soma a própria duração
mode:"prime" devolveu em 58 s o que o padrão levou 356 s na mesma tarefa — 51–56% a mais por segundo
Quando a equipa Tongyi Wanxiang da Alibaba lançou o Wan 3.0, publicou um manual para criadores com 64 pares de prompt e clipe. Voltámos a alojar cada clipe, mantivemos cada prompt tal como estava e medimos os ficheiros: 64 clipes, 1.112 segundos de vídeo no total, todos com faixa de áudio sincronizada. Dezassete clipes chegam aos 30 segundos que o Wan 3.0 permite num único plano; quinze são peças de 5 segundos (edições e trabalhos com vídeo de referência). Quarenta e nove clipes pertencem ao nível 720P (1280×720 ou o equivalente vertical) e quinze ao nível 1080P (1920×1072 e semelhantes). O conjunto completo, ordenado por tipo de tarefa, vive na nossa biblioteca de prompts do Wan 3.0; a tabela abaixo resume para que o modelo é usado segundo o próprio editor.
A divisão importa porque é a visão do próprio editor sobre para que serve o Wan 3.0. Texto para vídeo e referência de imagem somam metade dos casos, mas a edição de vídeo sozinha são quinze, tantos quanto a referência de imagem. Documento para vídeo, a função que nenhum outro modelo deste site tem, recebe cinco casos, três deles com 30 segundos. Na apimodels.app os oito tipos de tarefa passam por um único nome de modelo, wan-3.0-video, no mesmo endpoint de vídeo que VEO, Kling e Seedance.
| Tipo de tarefa | Casos | Duração | Nível de resolução | Para onde o prompt aponta | Campos da API |
|---|---|---|---|---|---|
| Wan 3.0 · Texto para vídeo | 17 | 15–30 s (12 com 30 s) | 9 × 720P, 8 × 1080P | apenas o prompt | prompt, duration, resolution, aspect_ratio |
| Wan 3.0 · Referência de imagem | 15 | 8–30 s | 10 × 720P, 5 × 1080P | 图1 / 图2 … (até 10 imagens) | reference_image_urls |
| Wan 3.0 · Edição de vídeo | 15 | 5–15 s | 14 × 720P, 1 × 1080P | 视频1 = o clipe a editar | reference_video_urls |
| Wan 3.0 · Documento / página web | 5 | 23–30 s | 5 × 720P | um DOCX, PPTX, XLSX ou um URL público | file_url ou link_url |
| Wan 3.0 · Referência de áudio | 3 | 15 s | 3 × 720P | 音频1 / 音频2 para a voz ou o ritmo | reference_audio_urls (+ imagens / vídeo) |
| Wan 3.0 · Referência de vídeo | 3 | 5 s | 3 × 720P | 视频1 para movimento, câmara ou efeitos | reference_video_urls (+ imagem) |
| Wan 3.0 · Extensão de vídeo | 3 | 10–20 s | 3 × 720P | 视频1 mais a direção da extensão | reference_video_urls |
| Wan 3.0 · Primeiro quadro | 3 | 15–30 s | 2 × 720P, 1 × 1080P | @Image1 como quadro um | first_frame_url |
Um caso por tipo de tarefa, escolhidos para que cada um mostre uma entrada diferente a que o prompt tem de se referir. Todos os prompts abaixo são o texto chinês original do editor, sem edição; o clipe ao lado é a saída que o manual publicou para esse prompt, não algo que regenerámos. Debaixo de cada clipe estão os números para orçamentar o mesmo trabalho no Wan 3.0 aqui: duração, nível de resolução, segundos cobrados (entrada mais saída quando há vídeo de referência) e custo no nosso nível standard. O modo prime, o nível rápido, custa 51–56 % mais por segundo e entregou o mesmo trabalho em 58 segundos em vez de 356 na nossa medição.
Leia os prompts pela estrutura e não pelo vocabulário. O manual escreve trabalhos longos como uma linha do tempo, refere-se ao material pelo número da posição, marca o som dentro da frase e fecha cada edição com uma frase a dizer o que não pode mudar. Esses quatro hábitos servem para qualquer trabalho de Wan 3.0 que escreva, em chinês ou em português.
Um único prompt de 241 caracteres sustenta um plano completo de 30 segundos no Wan 3.0: um corredor de hospital com filtro verde-pálido sob luz fluorescente fria, baixa saturação, alto contraste, a câmara a arrancar atrás do balcão de enfermagem e a seguir uma figura de verde-escuro. Nada é anexado ao pedido; o aspeto, o ritmo e o som vêm inteiramente da descrição. Repare em quanto do texto fala de cor e luz em vez de enredo: aquela única frase sobre o filtro verde decide toda a correção de cor.
É o tipo de trabalho do Wan 3.0 mais econômico de reproduzir. Envie o prompt com duration 30 e resolution 720P e paga 30 segundos de saída, 2,70 $ no nível standard.
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。O prompt abre com 参考 @Image1 的分镜图 (usa o storyboard da imagem 1) e descreve depois três planos: um geral de uma pequena plataforma à chuva com uma rapariga sob um guarda-chuva azul, um plano médio dela frente a um rapaz de mochila do outro lado dos carris, e um plano final através da chuva. O Wan 3.0 lê o storyboard para a composição e a marcação e tira a estrutura dos três planos do texto; o clipe de 20 segundos segue-os por ordem.
Na API isto é uma entrada em reference_image_urls. As imagens não têm custo extra no Wan 3.0, por isso a conta é só a saída: 20 segundos a 720P, 1,80 $.
参考 @Image1 的分镜图,镜头1:雨夜小火车站台全景,长发女孩撑蓝色雨伞独自站在站台上,身后小站房透出暖光,远处青山隐没在雨雾中;镜头2:中景,女孩撑伞与背书包的短发男孩在站台上面对面站立,大雨倾盆,铁轨在两人之间延伸;镜头3:透过雨滴滑落的透明伞面拍摄女孩面部特写,她眼眶泛红,轻声说{到了那边记得发消息};镜头4:从男孩背后越肩拍向女孩方向,远处一列火车亮着车头灯缓缓驶来,雨幕中光晕扩散;镜头5:双手特写,女孩将一张折叠的纸条递到男孩手中,指尖微微颤抖;镜头6:女孩独自站在站台边,目送铁轨延伸向远方,男孩已不在身旁,雨势渐弱。Este caso mostra a gramática das posições da forma mais clara. O prompt define 图片1 como sujeito 1 e 图片2 como sujeito 2, atribui 音频1 como a voz do sujeito 1 e 音频2 como a voz do sujeito 2, coloca os dois junto a uma passadeira e escreve o diálogo entre chavetas: o sujeito 1 vira-se e pergunta que grupo muscular é hoje, o sujeito 2 responde enquanto se limpa com a toalha. Dois clipes de áudio curtos, de 5 e 6 segundos, trazem as duas vozes; o Wan 3.0 clona o timbre e sincroniza os lábios.
Imagens e áudio seguem em reference_image_urls e reference_audio_urls, e nenhum deles soma à conta. Quinze segundos a 720P: 1,35 $.
将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1,主体2台词音色参考音频2,在健身房内,主体1和主体2并排站在跑步机旁,主体1转头微笑对主体2说{今天练哪个部位},主体2一边用毛巾擦汗一边回应{练背吧,昨天腿还酸着呢},主体1笑着点头说{行,我陪你,先热身十分钟},主体2拿起水杯喝一口回应{走吧},背景是器械区和落地镜,写实拍摄,画面明亮通透,冷白色自然饱和度色调Um clipe de skate de 5 segundos é a fonte de movimento; uma imagem fixa é a fonte de identidade. O prompt diz ao Wan 3.0 para substituir o homem do vídeo 1 pela mulher e pela roupa dela da imagem 1, e gasta as palavras restantes no bloqueio: só a pessoa muda, a manobra, a trajetória e o fundo do skatepark ficam exatamente como estão. O resultado mantém o tempo original quadro a quadro.
Como há um vídeo de referência, a cobrança conta entrada mais saída: 5 segundos de entrada, 5 de saída, 10 segundos cobrados a 720P, 0,90 $. Os vídeos de referência no Wan 3.0 podem ter 1–15 segundos cada e 15 segundos no total, em até cinco clipes.
参考视频,视频1 @Video 中的滑板男人替换为图片 @Image1 中的女人和衣服,注意:只替换人物,保留原视频中滑板动作、运动轨迹和滑板场背景完全保持不变。A entrada é um ficheiro XLSX com o GMV mensal de comércio transfronteiriço e o prompt é o mais longo dos oito, 2.677 caracteres, porque escreve uma montagem de 22 segundos como quatro segmentos numerados sobre fundo branco com blocos de cor suaves e gráficos de linhas limpos, e insiste numa faixa de fundo que começa no segundo zero e nunca cai. O Wan 3.0 lê os números da folha e anima-os; o prompt manda no ritmo, na tipografia e no som.
Envie o ficheiro como file_url (aceitam-se DOCX, PPTX, XLSX, PDF, TXT e MD, até 50 páginas e 100 MB) ou uma página pública como link_url; os dois são mutuamente exclusivos. Os documentos não têm custo extra: 23 segundos a 720P são 2,07 $.
总时长22秒,4个片段顺序拼接。全片纯白底,柔色色块与简洁线条图表,Apple Keynote式极简商务风格,无衬线深灰字体。BGM(必须有,贯穿全片,音量清晰可闻):一段轻快的商务背景音乐,节奏稳定、旋律简洁,从第一秒开始就有音乐,全程不间断,旁白出现时音乐不消失、音量略低于人声。音效层:色块滑入时'嗖'的whoosh声、数字跳动时轻键盘'咔嗒'声、关键数据弹出时清脆的'叮'一声bell。旁白:英文男声或女声,明快自信,语速约2.5词/秒,像在季度会上做presentation的语气——专业但不冰冷,有节奏感,关键数字处微微加重。
H1-2026跨境电商月度GMV.xlsx
片段1:全景,中心构图,纯白底,柔光,极简商务风格,视觉参考参考图1的干净白底+柔和色块。纯白画面从中央展开,无数金色光粒子从画面四周向中心汇聚聚拢,粒子碰撞闪烁后凝结成标题文字'H1 2026 · Wan',文字表面泛着流动的数据流光效,边缘有微光粒子持续环绕飘散,整体炫酷而高级。停留片刻后标题化作粒子流散消失,下方同时滑入两组大号深灰数字——左侧是第7行B7单元格的值$1,580(1月GMV)、右侧是G7单元格的值$3,460(6月GMV),中间一个浅灰色箭头连接,箭头下方浮出浅灰小字'Monthly GMV Growth'。底部弹出一枚珊瑚色圆角标签,显示第8行H8单元格的值+45.7%(H1整体增幅),弹出时伴随清脆的'叮'一声。旁白明快自信地说道:'In the first half of 2026, monthly GMV grew from 15.8 to 34.6 million dollars.' BGM从画面第一秒起就清晰响起,轻快节奏贯穿,色块滑入时带轻微的'嗖'whoosh声。片段末尾色块向两侧平滑滑开,露出下一段画面。
片段2:全景,左侧Y轴+底部X轴构图,纯白底+浅灰点状网格,柔光,极简商务风格,视觉参考参考图2的趋势线图风格。画面底部X轴从左到右依次清晰标注六个月份标签:Jan、Feb、Mar、Apr、May、Jun,等距排列,浅灰色无衬线字体。左侧Y轴标注数值刻度。画面从左向右同时绘制三条趋势线——珊瑚色代表东南亚(数据取自第4行:B4=$580, C4=$640, D4=$750, E4=$880, F4=$1,050, G4=$1,280)、青蓝色代表北美(第5行:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260)、琥珀色代表欧洲(第6行:B6=$580, C6=$610, D6=$680, E6=$750, F6=$830, G6=$920),三条线从Jan同一位置出发,随节奏向右上方延伸至Jun。线条下方各带30%透明度渐变填充。每个月份节点到达时,数据点轻弹一下,正上方浮出该点的精确数值标签——标签只显示美元数值,不显示百分比、不显示其他文字,数值必须与上述单元格完全一致。右上角滑出图例:三个色块配市场英文名。六个点全部到达后画面定格片刻。旁白节奏稳定地说道:'All three markets — Southeast Asia, North America, and Europe — showed consistent month-over-month growth, with no single dip.' BGM持续可闻,数字弹出时伴随细碎的'咔嗒'键盘音。6月终点标签放大填满画面后缩小重组,过渡至下一段。
片段3:全景,左60%柱状图+右40%数据列构图,纯白底,柔光,极简商务风格,视觉参考参考图1的柱状图风格。白底上从左到右依次升起6根青蓝色圆角柱体,分别对应1月至6月——必须完整展示6根柱子,柱体高度严格对应第5行North America各月数值:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260,从低到高递增排列,呈现明显的逐月增长趋势。每根柱体升起时带轻微的'嗖'弹性音效,柱顶浮出对应的精确美元数值标签。柱体全部就位后,右侧纵向排列滑出5个北美逐月环比增长率,分别由相邻两月数值计算得出:Feb +14.3%(C5相对B5)、Mar +16.7%(D5相对C5)、Apr +21.4%(E5相对D5)、May +26.5%(F5相对E5)、Jun +46.5%(G5相对F5)。每个增长率显示为:翠绿色向上箭头图标 + 百分比数值(如↑+14.3%),整体呈阶梯状从上到下依次排列,绿色箭头强调增长态势,字体略大确保清晰可读。每个数字滑入时带一声细碎的'咔嗒'。最后,北美整体增幅用珊瑚色大号字体从中央弹出:+200%(由G5=$1,260相对B5=$420计算),伴随清脆的'叮'一声bell,停留片刻,数字周围散发轻微光晕。旁白在关键数据处微微加重语气:'North America was our growth engine — up two hundred percent in just six months, accelerating every single month.' BGM持续清晰,节奏逐渐推向高点。整体增幅数字居中放大,周围元素柔和淡出,过渡至尾段。
片段4:全景,中心构图偏上,纯白底,柔光,极简商务风格,视觉参考参考图3的环形图风格。白底中央浮现一个简约环形图(甜甜圈图),只有三段弧形,分别用珊瑚色、青蓝色、琥珀色渲染三个市场的H1占比——东南亚占比由H4=5180计算、北美由H5=4260计算、欧洲由H6=4370计算,三者总和H7=13810。三段弧形之间用白色间隙分隔,环形图整体干净简洁,图表上没有任何百分比符号、没有任何数字标注、没有任何散落的标签,只有纯粹的三段色弧。环形图以约10°/s的速度缓缓旋转。环形图正中央显示一个大号深灰数字,该数字从0快速跳动至H7单元格的值$138.1M(即13810万美元),跳动时伴随连续的细碎'咔嗒'声,最终数字落定时一声清脆的'叮'。下方淡入一行浅灰副标题'Three Markets · All Growing · Zero Downturn'。旁白沉稳收尾,说完留1秒静音:'138 million in total — all markets growing, zero downturns.' BGM持续可闻,最后缓缓衰减,1秒静音后全片结束。As mesmas imagens de skate do caso de referência de vídeo, mas outro trabalho. O prompt começa com 编辑视频 (edita o vídeo) e transforma o homem do vídeo 1 numa mulher de cabelo curto com top desportivo e calças cargo largas, mantendo o boné e as proteções do original, a manobra, a trajetória e o skatepark. O antes e o depois reproduzem-se lado a lado acima; só o sujeito mudou. Quinze dos 64 casos do manual são edições desta forma: acrescentar um elemento, substituir um, apagar um, reiluminar, mudar o estilo, reescrever uma fala ou refazer o enredo.
As edições mantêm a duração de entrada, por isso uma fonte de 5 segundos devolve um resultado de 5 segundos e cobra 10: 0,90 $ a 720P.
编辑视频,视频1中的滑板男人替换为一位短发女人,穿运动背心和宽松工装裤,保留原视频中的棒球帽、护膝护肘等护具,滑板动作、运动轨迹和滑板场背景完全保持不变。O prompt começa com 将视频1延长15s (prolonga o vídeo 1 em 15 segundos) e faz depois o que a maioria esquece: nomeia as duas personagens das imagens existentes pela roupa e pelos adereços (o homem de túnica chinesa cinzento-escura com o terço de contas, o homem de túnica escura) e escreve os novos compassos com o diálogo, até à fala sobre quando a mercadoria chega ao porto. O Wan 3.0 continua a cena a partir do último quadro com as mesmas duas pessoas e a mesma sala, e os 15 segundos novos trazem o diálogo escrito.
Uma fonte de 5 segundos prolongada para um resultado de 20 cobra 25 segundos (5 de entrada, 20 de saída): 2,25 $ a 720P. O fornecedor limita entrada mais saída a 30 segundos, e é por isso que o manual prolonga clipes de 5 segundos e não de 15.
将视频1延长15s。角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人,角色B为穿深色中式长衫的男人。角色B缓缓放下茶碗,目光微沉,用指尖轻叩桌面两下,不紧不慢说"价钱好讲,但货要几时到埠,你要畀个准数我。"角色A笑容不减,端起盖碗刮了刮茶沫。角色A呷一口茶,将茶碗搁回茶托,身体前倾压低声音,佛珠随手势轻晃,语气笃定"最迟月底,码头嗰边我已经打点好晒,一船货齐齐整整运到你仓库门口。"说罢右手掌心朝下往桌面一按,目光直视角色B。角色B沉吟片刻,视线扫向窗外"萬安當"牌匾,竹帘被街上微风轻轻掀起。他转回头,嘴角浮起笑意,拿起盖碗朝角色A微微一举,"好,月底交货,我等你好消息。"两人相视而笑。保持民国商战片的沉稳调性,对话节奏从容,茶馆环境音低沉衬底。Um caso vertical de 720×1280. O prompt está escrito como uma lista de planos com códigos de tempo: 0:00–0:03 plano médio, a silhueta do espadachim no bambual a tinta de @Image1, a mão pousada no punho, folhas a cair; depois os compassos seguintes sobem de intensidade. Como a imagem é passada como primeiro quadro e não como referência, o Wan 3.0 trata-a como quadro um e anima a partir dela; tudo o que o prompt descreve é movimento a afastar-se dessa imagem.
No Wan 3.0 o first_frame_url não pode combinar-se com os campos reference_*, file_url ou link_url; o pedido é rejeitado antes de correr. Vinte segundos a 720P: 1,80 $.
(0:00 - 0:03) 运镜:中景。
画面:沿用 @Image1 的水墨竹林场景。头戴斗笠、身着墨色长袍的刀客,其剪影伫立在浓雾环绕、竹影婆娑的中心。
动作:刀客左手轻按刀柄,竹叶随风飘落。
氛围:寂静,压抑,水墨晕染的颗粒感清晰可见。
(0:03 - 0:08) 剧情引入,运镜:特写。
剧情:刀客察觉杀气。
画面:镜头快速推进到刀客斗笠下的特写。
细节:斗笠边缘露出一双凌厉、决绝的眼睛,眼神如刀。水墨晕染的“汗珠”从额头滑落。
动作:刀客右手缓缓握紧刀柄,指关节泛白。竹叶飘落的速度加快。
(0:08 - 0:13) 运镜:快速环绕。
画面:镜头以刀客为中心快速环绕。
剧情:两名同样是水墨剪影的刺客从竹林深处杀出,手持双钩和短刃。
细节:刺客的动作也是水墨笔触构成的,如墨迹流动。镜头快速掠过刺客的身影,强调速度感。
(0:13 - 0:18) 运镜:手持感,高速捕捉。
打斗:刀客猛然拔刀,刀光是一道纯白色的水墨裂痕。刺客双钩攻来。
细节:
一击:刀客回身一斩,刀刃与刺客双钩碰撞,迸发出无数黑白相间、带有书法感的火花和墨点。
二击:刀客虚晃一枪,利用竹竿弹射,从高处劈下。刺客翻滚躲避。竹竿被打断,化作飞散的墨痕。
三击:刀客刀尖直指另一刺客咽喉,刺客以短刃格挡,镜头捕捉刀刃与短刃摩擦时细微的墨迹崩裂细节。
**(0:18 - 0:20) 运镜:慢镜头至定格。**
* **画面:** 刀客的刀停在刺客颈侧,刺客凝固。
* **细节:** 刀客的斗笠在打斗中略微倾斜。竹林归于平静,更多竹叶飞舞。
* **氛围:** 镜头慢慢拉远,回到中景,定格在刀客收刀、刺客倒地的画面。
* **文字(可选):** 画面下方显现水墨风文字:“江湖,不过一笔勾销。”
**风格说明:** 整个过程保持 `image_0.png` 的高度黑白、水墨画风格,动作必须有毛笔触感,速度要快,细节要足(墨滴、火花、墨痕裂口)。Os 64 prompts vão de 18 a 3.423 caracteres, e os longos não são enchimento: são linhas do tempo. Abaixo estão os oito hábitos que se repetem no conjunto, cada um com um excerto citado de um caso real para que veja a redação exata a que o Wan 3.0 respondeu. Os excertos estão em chinês porque o manual está; a estrutura é independente da língua e funciona em português no mesmo modelo.
Dois destes hábitos pesam mais do que os outros. Numerar o material (图1, 视频1, 音频1) é a forma como o Wan 3.0 sabe que ficheiro faz que papel quando há vários anexos, e o bloqueio final, a frase que diz o que tem de ficar igual, é o que separa uma edição limpa de um quadro reinventado.
| Hábito | O que faz no Wan 3.0 | Citação de um caso |
|---|---|---|
| Wan 3.0 · Numerar o material | imagens, vídeos e áudios de referência são referidos por posição, contados separadamente | 将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1 |
| Wan 3.0 · Escrever uma linha do tempo | qualquer trabalho acima de 10 s é dividido em segmentos com tempo que o modelo segue por ordem | 镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底 |
| Wan 3.0 · Duração, proporção e fps logo no início | a primeira frase traz a especificação de entrega e coincide com o parâmetro duration | 生成一支10秒、16:9横版、1920×1080、30fps、单镜头连续完成的微缩奇幻高速追逐短片 |
| Wan 3.0 · Marcar o som dentro da frase | efeitos entre sinais de menor e maior, diálogo entre chavetas ou aspas; o Wan 3.0 gera ambos | 用抹布仔细擦拭吧台<抹布摩擦声> |
| Wan 3.0 · Bloquear o que não muda | toda a edição termina com os elementos que ficam como estão | 女人的动作和画面其余部分保持不变 |
| Wan 3.0 · Nomear personagens pela roupa | extensões e edições voltam a identificar as pessoas das imagens antes de acrescentar compassos | 角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人 |
| Wan 3.0 · Dar à referência uma única função | um clipe é nomeado como fonte de movimento, câmara ou efeito, não de tudo | 参考视频的运镜方式,场景更改为一杯咖啡放在天台咖啡桌上 |
| Wan 3.0 · Descrever movimento a partir de uma imagem fixa | os prompts de primeiro quadro escrevem o que se move para fora da imagem, com códigos de tempo | (0:00 - 0:03) 运镜:中景。 画面:沿用 @Image1 的水墨竹林场景 |
Doze dos dezassete casos de texto para vídeo chegam aos 30 segundos, e partilham um esqueleto. Um resumo de uma linha fixa género, duração e aspeto. Uma frase de paleta e luz fixa a correção de cor. Depois a linha do tempo: planos numerados ou intervalos de segundos, cada um com câmara, ação e o som que toca por baixo. Os casos longos acrescentam um parágrafo de continuidade que descreve uma só vez a cara, o cabelo e o guarda-roupa da personagem para que cada segmento o reutilize. A ordem é constante em todo o manual: especificação e aspeto primeiro, enredo depois, para que quem lê (ou o modelo) receba as restrições de entrega antes da história.
O mesmo esqueleto reduz-se sem problema. Uma edição de 5 segundos é um resumo, uma ação e um bloqueio. Um clipe de produto de 15 segundos é um resumo, uma frase de luz e três compassos com tempo. O que nunca aparece no manual é um muro de adjetivos sem estrutura temporal: é esse o prompt que sai arrastado, porque o Wan 3.0 distribui a ação uniformemente pelo clipe quando ninguém lhe diz quando as coisas acontecem.
| Bloco | Função | Assim aparece nos casos |
|---|---|---|
| Wan 3.0 · Resumo | género, duração, proporção e aspeto numa linha | 这是一段30秒的真实电影质感海上巨兽登场场景,整体氛围参考好莱坞灾难怪兽大片 |
| Wan 3.0 · Paleta e luz | uma frase que decide a correção de cor | 整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围 |
| Wan 3.0 · Folha de continuidade | cara, cabelo e guarda-roupa uma só vez, reutilizados por cada segmento | 严格保持男性角色的黑发高发髻、鬓角碎发被风吹起、锐利深色瞳 |
| Wan 3.0 · Linha do tempo | planos numerados ou intervalos de segundos com câmara, ação e som | 分段1[0-5秒]:一个连续的、照片级写实的电影镜头 |
| Wan 3.0 · Som | ambiente, efeitos e diálogo colocados onde acontecem | BGM(必须有,贯穿全片,音量清晰可闻) |
| Wan 3.0 · Bloqueio | em edições e extensões: o que fica igual | 滑板动作、运动轨迹和滑板场背景完全保持不变 |
Cada caso acima corresponde a um pedido POST /api/v1/video/generations com model wan-3.0-video. O prompt entra tal como está escrito; o material que o prompt numera entra no array correspondente pela mesma ordem, porque 图1 é a primeira entrada de reference_image_urls e 视频1 a primeira de reference_video_urls. O Wan 3.0 tem dois modos de entrada que não se misturam: modo quadro (first_frame_url, opcionalmente last_frame_url) e modo referência (reference_image_urls, reference_video_urls, reference_audio_urls, file_url ou link_url). Um pedido misto é rejeitado localmente e indicamos os dois lados, por isso nunca chega ao fornecedor.
Dois parâmetros mudam o resultado sem tocar no prompt. mode: prime passa ao nível rápido, 51–56 % mais caro por segundo com capacidades idênticas. prompt_extend, ligado por defeito, deixa o Wan 3.0 reescrever prompts curtos; os do manual são longos o suficiente para o desligar e obter exatamente o que escreveu.
| Tipo de caso | Campos a enviar | Limites no Wan 3.0 |
|---|---|---|
| Wan 3.0 · Texto para vídeo | prompt, duration 2–30 (ou -1 para o modelo escolher), resolution 480P / 720P / 1080P, aspect_ratio | um único plano até 30 s, 30 fps, áudio ligado por defeito |
| Wan 3.0 · Primeiro quadro / primeiro + último | first_frame_url, last_frame_url | exclusivo com todos os campos de referência |
| Wan 3.0 · Referência de imagem | reference_image_urls | até 10 imagens, sem custo extra |
| Wan 3.0 · Referência de vídeo, edição, extensão | reference_video_urls | até 5 clipes, 1–15 s cada, 15 s no total; cobra-se entrada + saída; entrada + saída ≤ 30 s |
| Wan 3.0 · Referência de áudio | reference_audio_urls | até 5 clipes, 15 s no total, wav ou mp3, sem custo extra |
| Wan 3.0 · Documento / página web | file_url ou link_url (um dos dois) | DOCX, PPTX, XLSX, PDF, TXT, MD… ≤ 50 páginas, ≤ 100 MB; apenas URL público |
| Wan 3.0 · Nível de velocidade | mode: standard (por defeito) ou prime | prime custa 51–56 % mais por segundo, mesmas capacidades |
O Wan 3.0 é cobrado por segundo de saída, por resolução: 0,045 $ a 480P, 0,09 $ a 720P e 0,18 $ a 1080P no nível standard; prime são 0,068 $, 0,14 $ e 0,28 $. Imagens de referência, áudio, documentos e páginas web são gratuitos; um vídeo de referência soma a própria duração aos segundos cobrados. Só os trabalhos concluídos são cobrados. A tabela dá o preço de cada caso na resolução em que o clipe foi realmente entregue, por isso um clipe a 720P é cotado a 720P mesmo onde o autor do manual poderia ter pedido 1080P.
Para planear: o conjunto completo de 64 casos são 1.112 segundos de saída mais 147 segundos de entrada dos 22 trabalhos com vídeo de referência, 1.258 segundos cobrados no total, cerca de 113 $ à tarifa standard de 720P. É o custo de reproduzir um manual de lançamento inteiro no Wan 3.0.
| Caso | Saída | Segundos cobrados | Nível standard | Nível prime |
|---|---|---|---|---|
| Wan 3.0 · Corredor de hospital, texto para vídeo | 30 s · 720P | 30 | 2,70 $ | 4,20 $ |
| Wan 3.0 · Despedida com storyboard, referência de imagem | 20 s · 720P | 20 | 1,80 $ | 2,80 $ |
| Wan 3.0 · Conversa no ginásio, referência de áudio | 15 s · 720P | 15 | 1,35 $ | 2,10 $ |
| Wan 3.0 · Troca de skater, referência de vídeo | 5 s · 720P (5 s de entrada) | 10 | 0,90 $ | 1,40 $ |
| Wan 3.0 · Folha de GMV, documento para vídeo | 23 s · 720P | 23 | 2,07 $ | 3,22 $ |
| Wan 3.0 · Skater para mulher, edição de vídeo | 5 s · 720P (5 s de entrada) | 10 | 0,90 $ | 1,40 $ |
| Wan 3.0 · Negociação à mesa de chá, extensão | 20 s · 720P (5 s de entrada) | 25 | 2,25 $ | 3,50 $ |
| Wan 3.0 · Espadachim a tinta, primeiro quadro | 20 s · 720P | 20 | 1,80 $ | 2,80 $ |
Trinta segundos é um teto rígido por trabalho, e com vídeo de referência é um teto partilhado: entrada mais saída não podem passar de 30 segundos, e é por isso que cada extensão do manual parte de um clipe de 5 segundos. O vídeo de referência está limitado a 15 segundos no total em no máximo cinco clipes, o áudio de referência a 15 segundos no total, as imagens a dez, os documentos a 50 páginas. O modo quadro e o modo referência não se combinam, e file_url e link_url não podem ser enviados juntos. Nenhum destes limites é nosso; são do Wan 3.0, e aplicamo-los antes de o pedido sair, por isso um trabalho rejeitado nunca custa uma ida e volta.
O que o manual não mostra diz tanto como o que mostra. Nenhum caso usa a fotografia de uma pessoa real identificável como referência, e nenhum depende de renderizar texto dentro do quadro para além de um logótipo ou legenda já presentes na entrada. Trate ambos como não verificados no Wan 3.0, não como suportados. As imagens e documentos de referência por trás dos casos de referência não foram publicados com o manual, por isso esses cartões trazem apenas o prompt e o resultado.
Três modelos na apimodels.app aceitam vídeo e áudio de referência e geram 15 segundos ou mais num único plano. Os números são os que cada página de modelo declara; os preços são as nossas tarifas por segundo no nível indicado.
| Wan 3.0 | Seedance 2.5 | MiniMax H3 | |
|---|---|---|---|
| Duração por plano | 2–30 s | 4–30 s | 5–15 s |
| Referências por trabalho | 10 imagens + 5 vídeos + 5 áudios, ou um documento / página web | 30 imagens + 10 vídeos + 10 áudios | 9 imagens + 3 vídeos + 3 áudios |
| Resoluções | 480P / 720P / 1080P | 480p / 720p | 768P / 2K |
| Preço por segundo aqui | 0,045 $ / 0,09 $ / 0,18 $ | 0,120 $ / 0,270 $ | 0,097 $ / 0,145 $ |
| Edição e extensão de vídeo | sim, via vídeo de referência | sim, tipos de tarefa dedicados | edição generativa |
| Documento ou página web como entrada | sim | não | não |
| Áudio nativo sincronizado | sim | sim | sim |
Wan 3.0 Video é uma API de geração de vídeo da Alibaba. O Wan 3.0 é o modelo de vídeo tudo-em-um da Alibaba: um único nome de modelo cobre texto para vídeo, imagem para vídeo por primeiro quadro ou primeiro+último quadro, e geração omni-referência com até 10 imagens, 5 clipes de vídeo e 5 de áudio — ou diretamente um documento (PPTX, DOCX, XLSX, PDF, até 50 páginas) ou uma página web pública. Saída nativa de até 30 segundos em plano único a 30fps com trilha de áudio sincronizada que pode ser desligada sem mudança de preço, em 480P / 720P / 1080P e seis proporções. No modo omni-referência o prompt pode se dirigir aos materiais por posição ("a figura 1 segura o objeto da figura 2"), que é como se mantém a consistência de vários personagens e objetos numa cena. A cobrança é por segundo: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s. Imagens, áudio, documentos e páginas web de referência não custam nada, mas um VÍDEO de referência (edição, extensão ou troca de rosto) também é cobrado pela própria duração: segundos do vídeo de entrada + segundos de saída, igual ao fornecedor, que ainda limita essas tarefas a entrada + saída ≤ 30 segundos. Não colocamos uma camada de moderação nossa: os prompts e o material de referência passam exatamente como foram enviados. Isso não quer dizer que não haja filtro: os mecanismos de segurança do próprio modelo continuam valendo e realmente disparam — tanto o que você envia quanto o que sai passam por análise, e material de referência com rostos de pessoas reais é recusado com frequência. Revisar o que você gera e atender à legislação aplicável e às regras da sua própria plataforma é responsabilidade sua; use apenas com pessoas que tenham dado consentimento. Pela plataforma APIMODELS, você acessa este modelo por uma API unificada com preços transparentes de pagamento por uso. Preço atual: 480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28.
Gere rapidamente vídeos promocionais da marca para campanhas e redes sociais.
Crie vídeos curtos atraentes para TikTok, Instagram e YouTube.
Gere demonstrações de recursos e tutoriais para melhorar a conversão.
Produza explicações de cursos, divulgação e vídeos de treinamento a baixo custo.
O Wan 3.0 Video está disponível pela APIMODELS a: 480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28. A cobrança é por uso — você paga apenas pelo que gera.
Cadastre-se na APIMODELS, obtenha sua chave de API e chame nosso endpoint unificado. Oferecemos documentação detalhada com exemplos em cURL, Python e Node.js.
A APIMODELS oferece o mesmo modelo Wan 3.0 Video pela nossa plataforma de agregação. Fornecemos uma interface de API unificada, então você não precisa de contas separadas por provedor: uma única chave para acessar todos os modelos.
O Wan 3.0 (万相 3.0) é o modelo de vídeo tudo-em-um da Alibaba, lançado em agosto de 2026. Um único nome de modelo cobre texto para vídeo, imagem para vídeo por primeiro quadro ou por primeiro e último quadro, e a geração «omni-referência» guiada por até 10 imagens, 5 clipes de vídeo e 5 de áudio de referência (15 segundos no total para vídeo e outros 15 para áudio) — ou por um documento (PPTX, DOCX, XLSX, PDF, TXT, MD, até 50 páginas) ou uma página web pública. No apimodels.app você faz POST em /api/v1/video/generations com model "wan-3.0-video" e depois consulta o mesmo endpoint com o task_id devolvido. O formato da requisição é o mesmo do VEO, Kling e Seedance aqui, então trocar de modelo é trocar uma string, e uma única chave cobre todos.
Porque a maioria não consegue abrir a conta. Hoje o Wan 3.0 é servido apenas pelas regiões China (Pequim) e Singapura da Alibaba Model Studio — sondamos a região dos EUA (Virgínia) e ela não oferece o modelo (aquele workspace lista 92 modelos e nenhum é de vídeo). A estação chinesa exige verificação de identidade real da China continental para o cadastro, e é aí que os desenvolvedores de fora param. Passar pelo apimodels.app dispensa conta na Alibaba Cloud, verificação e uma relação de cobrança separada: a mesma chave e o mesmo endpoint que você já usa com os outros modelos.
Cobra-se por segundo. O nível padrão fica 10% abaixo do preço oficial em dólares da Alibaba: 480p $0.045/s, 720p $0.09/s, 1080p $0.18/s — um clipe de 5 segundos em 720p sai por cerca de $0.45, um de 10 segundos em 1080p por cerca de $1.80 e um de 30 segundos em 1080p por cerca de $5.40. O nível mode:"prime" vai a preço de lista ($0.068 / $0.14 / $0.28), ou seja, 51–56% a mais por segundo que o padrão. Imagens, áudios, documentos e páginas web de referência são gratuitos; se você enviar um VÍDEO de referência (edição, extensão, troca de personagem), os segundos do vídeo de entrada também são cobrados, como no provedor. Tarefas com falha não são cobradas.
Sim — duration aceita qualquer inteiro de 2 a 30 e a saída é um plano único nativo a 30fps, não segmentos emendados. Passar -1 ativa a duração inteligente: o modelo escolhe um comprimento entre 2 e 30 segundos a partir do seu prompt e dos materiais. Com -1 reservamos antecipadamente o pior caso de 30 segundos e, quando o provedor informa o comprimento real, cobramos esse valor e devolvemos a diferença — um modelo que decide por 5 segundos nunca custa como 30. Note que, com vídeo de referência, o comprimento do vídeo de entrada mais o da saída deve ficar dentro de 30 segundos.
Envie os materiais em ordem e o prompt pode se referir a eles por posição: «figura 1», «figura 2», «vídeo 1», «áudio 1» — imagens, vídeos e áudios são numerados separadamente. Por exemplo: «a pessoa do vídeo 1 segura o objeto da figura 3 e toca violão na cadeira da figura 4». É assim que vários personagens, objetos e cenários ficam consistentes dentro de um mesmo plano. Uma regra rígida: os materiais de referência (reference_image / video / audio, mais documento e página web) são mutuamente exclusivos com first_frame / last_frame. Misturá-los faz a tarefa falhar no provedor, então rejeitamos antes, localmente, e dizemos quais dois lados colidiram — você não gasta uma ida e volta com isso.
Passe a URL pública de um arquivo PPTX, DOCX, XLSX, PDF, TXT ou Markdown (menos de 50 páginas e 100 MB) em file_url e o modelo lê o conteúdo e gera o vídeo a partir dele — não é preciso achatá-lo antes em um prompt. Apresentações de lançamento, material didático e relatórios entram direto no fluxo de vídeo. Páginas web funcionam do mesmo jeito via link_url, para páginas públicas sem login. file_url e link_url são exclusivos entre si: envie um ou outro.
Por padrão é gerada uma trilha de áudio sincronizada (diálogo, efeitos, ambiente); passe audio: false para removê-la, sem diferença de preço. As resoluções são 480P / 720P / 1080P; as proporções, adaptive (padrão — inferida das suas entradas e da intenção), 16:9, 4:3, 1:1, 3:4 e 9:16. Uma diferença deliberada em relação ao provedor: se você omitir resolution, usamos 720P como padrão em vez do 1080P da Alibaba, porque 1080P custa o dobro e ninguém deveria cair no nível mais caro por não digitar um parâmetro. Peça 1080P explicitamente e você o terá.
Medido no nível padrão: um clipe de 480P e 5 segundos voltou em cerca de 356 segundos (a Alibaba indica 1-5 minutos). Com mode:"prime", o mesmo prompt com os mesmos parâmetros voltou em 58 segundos — cerca de 6 vezes mais rápido. É um endpoint assíncrono de criar e consultar; consulte a cada 10-15 segundos ou passe callback_url e fazemos um POST quando a tarefa termina. Os arquivos de resultado ficam guardados por 30 dias e depois são apagados automaticamente, então baixe ou re-hospede o que quiser manter.
Na APIMODELS, o Wan 3.0 Video roda junto com mais de 60 modelos usando uma única chave de API e um único saldo, então escolher é questão de adequação, não de dependência. Ele suporta Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio e você pode avaliá-lo em preço e capacidade frente a outros modelos de geração de vídeo, trocando ao alterar uma única string com o nome do modelo — sem nova conta ou integração. Veja todas as opções de geração de vídeo com preços ao vivo em apimodels.app/models.
O Wan 3.0 Video suporta: Text to Video, First / Last Frame, Omni Reference, Doc & Web to Video, Up to 30s @ 30fps, Native Audio. Consulte a documentação da APIMODELS para todos os parâmetros e exemplos de chamada.
Sim. A APIMODELS expõe o Wan 3.0 Video por uma única API unificada e uma só chave, sem contas separadas por provedor e sem precisar lidar com o acesso de rede regional de cada provedor.
Aceitamos Stripe (Visa, Mastercard e outros cartões internacionais) e Alipay. O saldo fica disponível imediatamente após o pagamento.
Prompts shared by their authors — copy and adapt them. Each one credits its author and links back to the original post.

Graduation-gown close-up: a worried monologue to camera
这是一个正面的近景镜头,画面主要呈现一位年轻黑人女孩的头部和上半身,她穿着一件蓝色的毕业袍。镜头稍微偏一点点,可以看到左边还有一个人,但背景被虚化处理了,看起来很模糊。女孩正对着镜头说话,嘴巴在动,眉头稍微皱着,表情看起来有点严肃和忧虑。光线从上方照下来,把她脸上的轮廓衬托得很自然,甚至能看到皮肤真实的质感。镜头虽然固定,但带着一点点人手持拍摄时的轻微呼吸感和晃动,视线从看着前面慢慢变成了低头看手里。
by Wan 3.0 视频创作者手册 · 通义万相

Suspense long take down an empty hospital corridor
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。
by Wan 3.0 视频创作者手册 · 通义万相

One-take comedy: director versus leading lady on set
镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底(单镜头连续无缝运镜): 画面左侧是身穿黑色潮流导演马甲、戴着高档专业工作耳麦的导演,其左下方放置着一台巨大的专业电影摄像机。右侧是妆容精致、留着时尚韩式逗号刘海、身穿高定制西装的关系户小鲜肉。背景是宽敞的专业影棚拍摄现场,可见巨大的绿色幕布、数个高耸的影视级C型灯架、缠绕的电线,以及在背景中穿梭忙碌的灯光师和化妆师等工作人员。 专业影棚人工光。柔和的LED柔光箱光源从右侧洒入,将三位主角的面部均匀照亮,场景色彩饱满。背景的摄影器材与绿幕在充足的影棚灯光下投射出淡淡的阴影,呈现出真实而忙碌的现代化大制作片场质感。 镜头手持拍摄一镜到底,近景,镜头一开始,拍摄导演,导演无所谓的表情,瞥了一眼画面右侧斜前方画外的一眼关系户小鲜肉,对他下达指令,说道:“媒体故意黑你,做个表情看看”。说完后镜头快速右摇到关系户面部近景,镜头不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,神色自若,眼神真挚而自信。他嘴唇微动,神情专业地向对方阐述到““就这种事情来说,情绪可以有好几种”,说话时,头部伴有极其轻微的自然晃动,说完后镜头快速左摇到导演面部近景,镜头不要切镜,导演思索了一下,一边挑衅似地歪了歪头,向关系户小鲜肉说到““狗仔爆料你深夜幽会”,导演说完台词后,镜头迅速右摇到小鲜肉面部近景,不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,并快速进入表演状态,他眉头紧锁,眼神慌乱、焦急地快速游移,随后他狠狠地咬紧下唇,闭上双眼,整张脸(虽带着精致妆容)因极度的焦虑而紧绷,完美呈现出面对偶像生涯毁灭时,内心惊恐、紧张交织的挣扎状态。表演完后, 镜头再次迅速左摇到导演近景,不要切镜,导演面部表情微变,语速加快,说到““媒体又帮你洗白了,说那是你亲姐!”导演说完后,镜头再次迅速右摇到小鲜肉近景,镜头不要切镜,镜头中,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,他的表情在千分之一秒内完成神级转换。他先是面部一滞,随后双眼猛地眯起,嘴角极大程度地咧开,露出一排白皙的牙齿,展露出一个极其夸张、甚至有些变形的狂喜笑容。这种“星途尽毁的绝望”与“彻底摆脱束缚”交织的疯魔情绪在他脸上扭曲呈现。角色表演完后,镜头再次迅速左摇到导演近景,镜头不要切镜,导演说到“你亲姐向媒体透露,你是领养的”,导演说完后,镜头再次迅速右摇到小鲜肉近景。镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他双眼暴睁,眼球凸出,精心修剪的眉毛高高扬起,嘴巴震惊地张成“O”形。紧接着,他的嘴角再次无法克制地向上拉扯,露出一副不可思议、惊魂未定却的复杂神态。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,紧接着导演露出有点惊讶的表情说到“其实你是千亿豪门真少爷”。导演说完,镜头再次随即迅速右摇到小鲜肉近景,镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,他瞬间爆发出极度魔性的狂喜。他整个人激动得微微颤抖,双眼笑得眯成了一条缝,双手甚至抬起至胸前,双手小幅度快速连续鼓掌,身体前倾摇晃,将一夜暴富、无法自持的癫狂喜悦演绎得淋漓尽致。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,导演说到“你姐卷款跑路”导演说完,镜头再次迅速右摇到小鲜肉近景。小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他的双眼再次瞪大,瞳孔颤抖,嘴角向下耷拉,神情在一秒钟之内从天堂坠入地狱,写满了惊愕、痛苦与不知所措。画面最后定格在这个表情上。
by Wan 3.0 视频创作者手册 · 通义万相
We curate copy-ready prompt libraries — every entry shows its full text and a sample result, ready to adapt.
How to get access, regional availability, and how this model compares with its alternatives.