
wan-3.0-video万相 3.0 是阿里的全能视频模型:一个模型名同时覆盖文生视频、首帧 / 首尾帧图生视频,以及「全能参考」—— 最多 10 张参考图 + 5 段参考视频 + 5 段参考音频(视频、音频各自总时长 15 秒以内),或者直接喂一份文档(PPTX / DOCX / XLSX / PDF / TXT / MD,50 页、100MB 以内)、一个无需登录的公开网页。输出原生单镜最长 30 秒、30fps,自带同步音轨(传 audio: false 可以关掉,关掉不降价)。分辨率 480P / 720P / 1080P,画幅支持 adaptive(默认,按素材和意图自动挑)、16:9、4:3、1:1、3:4、9:16 —— 注意一处我们和上游故意不一样:省略 resolution 时我们默认走 720P 而不是官方的 1080P,因为 1080P 是双倍价,不该让没写这个参数的人默认落在最贵那档,要 1080P 显式传就行。全能参考的用法是这个模型的关键:素材按顺序放进请求里,提示词就能用「图1」「视频1」「音频1」指代它们(图、视频、音频各自独立编号),比如「视频1 里的人抱着 图3,坐在 图4 的椅子上弹吉他」—— 这是让多个角色、道具、场景在同一条镜头里保持一致的办法。有一条硬规则别踩:参考类素材(参考图 / 参考视频 / 参考音频 / 文档 / 网页)与首帧、尾帧是互斥的,同一个请求里混用上游会直接判失败,我们在本地就先拦下并告诉你是哪两边撞了,不让你白跑一趟;file_url 与 link_url 同样是二选一。计费按秒:480p $0.045/秒、720p $0.09/秒、1080p $0.18/秒,参考图、参考音频、文档、网页一分不收;但传了参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计 —— 与上游一致,官方对这类任务同样限制「输入总时长 + 输出时长 ≤ 30 秒」。所以不带输入视频时,5 秒 720p 约 $0.45、10 秒 1080p 约 $1.80、30 秒 1080p 约 $5.40;而如果另外喂了一段 10 秒的参考视频,那条 10 秒 1080p 会按 20 秒计、约 $3.60。duration 传 -1 是智能时长,模型自己在 2 到 30 秒之间挑一个长度,这种情况我们先按 30 秒的最坏情况冻结额度,等上游回报真实秒数后按实际扣费、差额退回,不会因为「模型决定只生成 5 秒」就按 30 秒收你钱。速度要有心理准备:标准档实测 480P 5 秒的片子约 356 秒才出结果;传 mode:"prime" 切到高速档,同一条任务实测 58 秒,单价高 51–56%(480p $0.068/秒、720p $0.14/秒、1080p $0.28/秒)—— 买的是速度,不是画质。异步创建后轮询(建议 10-15 秒一次),或者传 callback_url 让我们回调;失败不扣费,成片保留 30 天。我们不在这个模型之外再加一层内容审核:提示词和参考素材原样透传。但模型自带的安全检查仍然生效,而且实测确实会拒 —— 输入和输出都会被筛查,参考素材里含真人面孔的情形经常被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责;请仅对已获授权 / 已同意的对象使用。
只用提示词
文档生视频(PPT / Word / Excel / PDF)和网页生视频目前只在 API 上开放,见文档页 /docs/wan-3-0-video。
Generated video will appear here
Provide URLs and click Generate
单镜最长 30 秒、30fps —— 或者 duration 传 -1,让模型自己定长度
最多 10 张图 + 5 段视频 + 5 段音频;提示词里直接用「图1」「视频1」指代它们
丢一份 PPTX / DOCX / PDF 或一个公开网址进去,模型读完就把内容放进镜头里
480p 从 $0.045/秒起。参考图、音频、文档、网页都不额外收费 —— 但传了参考视频(视频编辑、延长、换脸)会按【输入视频秒数 + 输出秒数】计费,与上游口径一致
同一条任务标准档跑了 356 秒,mode:"prime" 58 秒就返回 —— 每秒单价 480p 贵 51%,720p 和 1080p 贵 56%
通义万相团队发布 Wan 3.0 时,配套发了一份创作者手册,里面是 64 组「提示词 + 成片」。我们把每条成片转存、每条提示词逐字保留,并逐个量了文件:64 条成片,合计 1,112 秒,每一条都带同步音轨。其中 17 条跑满了 Wan 3.0 单镜允许的 30 秒,15 条是 5 秒的短片(编辑和视频参考任务);49 条属于 720P 档(1280×720 或竖版对应尺寸),15 条属于 1080P 档(1920×1072 一类)。全部案例按任务类型整理在本站的 Wan 3.0 提示词库里,下表是这批案例告诉你的「模型被拿来干什么」。
这个分布之所以重要,是因为它代表发布方自己对 Wan 3.0 用途的理解。文生视频和图片参考占了一半,但视频编辑一类就有 15 条,和图片参考一样多。文档生视频这个本站其他模型都没有的能力拿到 5 条案例,其中 3 条是 30 秒长片。在 apimodels.app 上,这八类任务都走同一个模型名 wan-3.0-video,和 VEO、Kling、Seedance 共用同一个视频端点。
| 任务类型 | 案例数 | 成片时长 | 分辨率档 | 提示词指向的素材 | API 字段 |
|---|---|---|---|---|---|
| Wan 3.0 · 文生视频 | 17 | 15–30 秒(12 条满 30 秒) | 9 × 720P,8 × 1080P | 只有提示词 | prompt、duration、resolution、aspect_ratio |
| Wan 3.0 · 图片参考 | 15 | 8–30 秒 | 10 × 720P,5 × 1080P | 图1 / 图2 …(最多 10 张) | reference_image_urls |
| Wan 3.0 · 视频编辑 | 15 | 5–15 秒 | 14 × 720P,1 × 1080P | 视频1 = 被编辑的原片 | reference_video_urls |
| Wan 3.0 · 文档 / 网页生视频 | 5 | 23–30 秒 | 5 × 720P | 一份 DOCX / PPTX / XLSX 或一个公开网页 | file_url 或 link_url |
| Wan 3.0 · 音频参考 | 3 | 15 秒 | 3 × 720P | 音频1 / 音频2 给音色或节拍 | reference_audio_urls(+ 图片 / 视频) |
| Wan 3.0 · 视频参考 | 3 | 5 秒 | 3 × 720P | 视频1 给动作、运镜或特效 | reference_video_urls(+ 图片) |
| Wan 3.0 · 视频延长 | 3 | 10–20 秒 | 3 × 720P | 视频1 + 往前或往后续写的方向 | reference_video_urls |
| Wan 3.0 · 首帧生视频 | 3 | 15–30 秒 | 2 × 720P,1 × 1080P | @Image1 作为第一帧 | first_frame_url |
每类任务挑一条,让每个案例都对应一种不同的输入。下面的提示词全是发布方的中文原文,一字未改;旁边的成片是手册为这条提示词公布的结果,不是我们重新生成的。每条成片下面给出在本站跑同一个任务需要的数字:成片时长、分辨率档、计费秒数(带参考视频时 = 输入 + 输出)以及标准档费用。prime 高速档单价高 51–56%,同一个任务我们实测 58 秒出片,标准档要 356 秒。
看这些提示词要看结构而不是词汇。手册把长任务写成时间线,用槽位编号指代参考素材,把声音标注在句子里,编辑类的结尾一定有一句「其余不变」。这四个习惯放到你自己写的任何 Wan 3.0 任务里都成立,中文英文都一样。
一条 241 字的提示词撑起完整的 30 秒 Wan 3.0 镜头:淡绿滤镜的医院走廊、冰冷的荧光灯、低饱和高对比,镜头从护士台后方起步,跟着一个墨绿色衣服的人物。请求里什么素材都没有,画面、节奏和声音全部来自描述。注意文字里有多大比例在讲颜色和光,而不是情节:关于淡绿滤镜的那一句就决定了整条片的调色。
这是最容易复现的一类 Wan 3.0 任务:提示词原样发,duration 传 30、resolution 传 720P,按 30 秒输出计费,标准档 $2.70。
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。提示词开头就是「参考 @Image1 的分镜图」,接着写三个镜头:雨夜小站台全景、撑蓝伞的女孩,中景里她和背书包的男孩隔着铁轨对望,最后一个镜头透过雨幕。Wan 3.0 从分镜图里读构图和站位,从文字里读节拍,20 秒成片按这三个镜头的顺序走。
在 API 上这就是 reference_image_urls 里的一张图。Wan 3.0 不对参考图额外收费,账单只有输出:20 秒 720P,$1.80。
参考 @Image1 的分镜图,镜头1:雨夜小火车站台全景,长发女孩撑蓝色雨伞独自站在站台上,身后小站房透出暖光,远处青山隐没在雨雾中;镜头2:中景,女孩撑伞与背书包的短发男孩在站台上面对面站立,大雨倾盆,铁轨在两人之间延伸;镜头3:透过雨滴滑落的透明伞面拍摄女孩面部特写,她眼眶泛红,轻声说{到了那边记得发消息};镜头4:从男孩背后越肩拍向女孩方向,远处一列火车亮着车头灯缓缓驶来,雨幕中光晕扩散;镜头5:双手特写,女孩将一张折叠的纸条递到男孩手中,指尖微微颤抖;镜头6:女孩独自站在站台边,目送铁轨延伸向远方,男孩已不在身旁,雨势渐弱。这条案例把槽位语法展示得最清楚:提示词先把图片1定义为主体1、图片2定义为主体2,再把音频1指定为主体1的音色、音频2指定为主体2的音色,把两人放在跑步机旁,台词写在大括号里 —— 主体1转头问今天练哪个部位,主体2一边擦汗一边回答。两段各 5、6 秒的音频提供两个人的声音,Wan 3.0 克隆音色并对上口型。
图片和音频分别走 reference_image_urls 和 reference_audio_urls,都不额外计费。15 秒 720P:$1.35。
将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1,主体2台词音色参考音频2,在健身房内,主体1和主体2并排站在跑步机旁,主体1转头微笑对主体2说{今天练哪个部位},主体2一边用毛巾擦汗一边回应{练背吧,昨天腿还酸着呢},主体1笑着点头说{行,我陪你,先热身十分钟},主体2拿起水杯喝一口回应{走吧},背景是器械区和落地镜,写实拍摄,画面明亮通透,冷白色自然饱和度色调一段 5 秒的滑板视频是动作来源,一张静态图是身份来源。提示词让 Wan 3.0 把视频1里的男人换成图片1里的女人和她的衣服,然后把剩下的字数全部用在加锁上:只换人物,滑板动作、运动轨迹、滑板场背景完全不变。结果逐帧保留了原片的时间。
因为带参考视频,计费按输入 + 输出:进 5 秒、出 5 秒,10 个计费秒,720P 下 $0.90。Wan 3.0 的参考视频单段 1–15 秒,最多 5 段、总长 15 秒。
参考视频,视频1 @Video 中的滑板男人替换为图片 @Image1 中的女人和衣服,注意:只替换人物,保留原视频中滑板动作、运动轨迹和滑板场背景完全保持不变。输入是一份跨境电商月度 GMV 的 XLSX 表格,提示词是八条里最长的,2,677 字,因为它把一条 22 秒的片子写成了四个编号段落 —— 纯白底、柔色色块、简洁线条图表,并且坚持背景音乐从第 0 秒开始、全程不断。Wan 3.0 从表格里读数字并把它们动起来,节奏、字体和声音由提示词说了算。
文件走 file_url(接受 DOCX、PPTX、XLSX、PDF、TXT、MD,50 页、100 MB 以内),公开网页走 link_url,两者二选一。文档不额外收费:23 秒 720P,$2.07。
总时长22秒,4个片段顺序拼接。全片纯白底,柔色色块与简洁线条图表,Apple Keynote式极简商务风格,无衬线深灰字体。BGM(必须有,贯穿全片,音量清晰可闻):一段轻快的商务背景音乐,节奏稳定、旋律简洁,从第一秒开始就有音乐,全程不间断,旁白出现时音乐不消失、音量略低于人声。音效层:色块滑入时'嗖'的whoosh声、数字跳动时轻键盘'咔嗒'声、关键数据弹出时清脆的'叮'一声bell。旁白:英文男声或女声,明快自信,语速约2.5词/秒,像在季度会上做presentation的语气——专业但不冰冷,有节奏感,关键数字处微微加重。
H1-2026跨境电商月度GMV.xlsx
片段1:全景,中心构图,纯白底,柔光,极简商务风格,视觉参考参考图1的干净白底+柔和色块。纯白画面从中央展开,无数金色光粒子从画面四周向中心汇聚聚拢,粒子碰撞闪烁后凝结成标题文字'H1 2026 · Wan',文字表面泛着流动的数据流光效,边缘有微光粒子持续环绕飘散,整体炫酷而高级。停留片刻后标题化作粒子流散消失,下方同时滑入两组大号深灰数字——左侧是第7行B7单元格的值$1,580(1月GMV)、右侧是G7单元格的值$3,460(6月GMV),中间一个浅灰色箭头连接,箭头下方浮出浅灰小字'Monthly GMV Growth'。底部弹出一枚珊瑚色圆角标签,显示第8行H8单元格的值+45.7%(H1整体增幅),弹出时伴随清脆的'叮'一声。旁白明快自信地说道:'In the first half of 2026, monthly GMV grew from 15.8 to 34.6 million dollars.' BGM从画面第一秒起就清晰响起,轻快节奏贯穿,色块滑入时带轻微的'嗖'whoosh声。片段末尾色块向两侧平滑滑开,露出下一段画面。
片段2:全景,左侧Y轴+底部X轴构图,纯白底+浅灰点状网格,柔光,极简商务风格,视觉参考参考图2的趋势线图风格。画面底部X轴从左到右依次清晰标注六个月份标签:Jan、Feb、Mar、Apr、May、Jun,等距排列,浅灰色无衬线字体。左侧Y轴标注数值刻度。画面从左向右同时绘制三条趋势线——珊瑚色代表东南亚(数据取自第4行:B4=$580, C4=$640, D4=$750, E4=$880, F4=$1,050, G4=$1,280)、青蓝色代表北美(第5行:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260)、琥珀色代表欧洲(第6行:B6=$580, C6=$610, D6=$680, E6=$750, F6=$830, G6=$920),三条线从Jan同一位置出发,随节奏向右上方延伸至Jun。线条下方各带30%透明度渐变填充。每个月份节点到达时,数据点轻弹一下,正上方浮出该点的精确数值标签——标签只显示美元数值,不显示百分比、不显示其他文字,数值必须与上述单元格完全一致。右上角滑出图例:三个色块配市场英文名。六个点全部到达后画面定格片刻。旁白节奏稳定地说道:'All three markets — Southeast Asia, North America, and Europe — showed consistent month-over-month growth, with no single dip.' BGM持续可闻,数字弹出时伴随细碎的'咔嗒'键盘音。6月终点标签放大填满画面后缩小重组,过渡至下一段。
片段3:全景,左60%柱状图+右40%数据列构图,纯白底,柔光,极简商务风格,视觉参考参考图1的柱状图风格。白底上从左到右依次升起6根青蓝色圆角柱体,分别对应1月至6月——必须完整展示6根柱子,柱体高度严格对应第5行North America各月数值:B5=$420, C5=$480, D5=$560, E5=$680, F5=$860, G5=$1,260,从低到高递增排列,呈现明显的逐月增长趋势。每根柱体升起时带轻微的'嗖'弹性音效,柱顶浮出对应的精确美元数值标签。柱体全部就位后,右侧纵向排列滑出5个北美逐月环比增长率,分别由相邻两月数值计算得出:Feb +14.3%(C5相对B5)、Mar +16.7%(D5相对C5)、Apr +21.4%(E5相对D5)、May +26.5%(F5相对E5)、Jun +46.5%(G5相对F5)。每个增长率显示为:翠绿色向上箭头图标 + 百分比数值(如↑+14.3%),整体呈阶梯状从上到下依次排列,绿色箭头强调增长态势,字体略大确保清晰可读。每个数字滑入时带一声细碎的'咔嗒'。最后,北美整体增幅用珊瑚色大号字体从中央弹出:+200%(由G5=$1,260相对B5=$420计算),伴随清脆的'叮'一声bell,停留片刻,数字周围散发轻微光晕。旁白在关键数据处微微加重语气:'North America was our growth engine — up two hundred percent in just six months, accelerating every single month.' BGM持续清晰,节奏逐渐推向高点。整体增幅数字居中放大,周围元素柔和淡出,过渡至尾段。
片段4:全景,中心构图偏上,纯白底,柔光,极简商务风格,视觉参考参考图3的环形图风格。白底中央浮现一个简约环形图(甜甜圈图),只有三段弧形,分别用珊瑚色、青蓝色、琥珀色渲染三个市场的H1占比——东南亚占比由H4=5180计算、北美由H5=4260计算、欧洲由H6=4370计算,三者总和H7=13810。三段弧形之间用白色间隙分隔,环形图整体干净简洁,图表上没有任何百分比符号、没有任何数字标注、没有任何散落的标签,只有纯粹的三段色弧。环形图以约10°/s的速度缓缓旋转。环形图正中央显示一个大号深灰数字,该数字从0快速跳动至H7单元格的值$138.1M(即13810万美元),跳动时伴随连续的细碎'咔嗒'声,最终数字落定时一声清脆的'叮'。下方淡入一行浅灰副标题'Three Markets · All Growing · Zero Downturn'。旁白沉稳收尾,说完留1秒静音:'138 million in total — all markets growing, zero downturns.' BGM持续可闻,最后缓缓衰减,1秒静音后全片结束。和视频参考案例是同一段滑板素材,任务却不同。提示词以「编辑视频」开头,把视频1里的男人改成穿运动背心和宽松工装裤的短发女人,同时保留原片的棒球帽和护具,滑板动作、轨迹、滑板场不动。上面并排放着编辑前后,只有人物变了。手册 64 条里有 15 条是这类编辑:加一个元素、换一个、删一个、重打光、换风格、改一句台词、重塑剧情。
编辑保持输入长度,5 秒原片出 5 秒结果,计 10 秒:720P 下 $0.90。
编辑视频,视频1中的滑板男人替换为一位短发女人,穿运动背心和宽松工装裤,保留原视频中的棒球帽、护膝护肘等护具,滑板动作、运动轨迹和滑板场背景完全保持不变。提示词以「将视频1延长15s」开头,然后做了多数人会漏的事:用衣着和道具点名原片里的两个角色(穿深灰中式长衫、戴佛珠手串的男人,穿深色长衫的男人),把新增段落连同台词一起写出来,细到「货要几时到埠」那一句。Wan 3.0 从最后一帧接着演,人和房间都没变,新出的 15 秒里说的就是写好的台词。
5 秒原片延长成 20 秒成片,计 25 秒(进 5、出 20):720P 下 $2.25。上游限制输入 + 输出不超过 30 秒,所以手册延长的是 5 秒片而不是 15 秒片。
将视频1延长15s。角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人,角色B为穿深色中式长衫的男人。角色B缓缓放下茶碗,目光微沉,用指尖轻叩桌面两下,不紧不慢说"价钱好讲,但货要几时到埠,你要畀个准数我。"角色A笑容不减,端起盖碗刮了刮茶沫。角色A呷一口茶,将茶碗搁回茶托,身体前倾压低声音,佛珠随手势轻晃,语气笃定"最迟月底,码头嗰边我已经打点好晒,一船货齐齐整整运到你仓库门口。"说罢右手掌心朝下往桌面一按,目光直视角色B。角色B沉吟片刻,视线扫向窗外"萬安當"牌匾,竹帘被街上微风轻轻掀起。他转回头,嘴角浮起笑意,拿起盖碗朝角色A微微一举,"好,月底交货,我等你好消息。"两人相视而笑。保持民国商战片的沉稳调性,对话节奏从容,茶馆环境音低沉衬底。一条竖版 720×1280 的案例。提示词写成了带时间码的镜头表:0:00–0:03 中景,沿用 @Image1 的水墨竹林,刀客的剪影立在雾里,左手按刀柄,竹叶飘落;后面的段落逐级加强。因为图片是作为首帧而不是参考传入的,Wan 3.0 把它当作第一帧往外动,提示词描述的一切都是从这张画出发的运动。
在 Wan 3.0 上 first_frame_url 不能和 reference_* 字段、file_url、link_url 同时出现,混用的请求在运行前就会被拒。20 秒 720P:$1.80。
(0:00 - 0:03) 运镜:中景。
画面:沿用 @Image1 的水墨竹林场景。头戴斗笠、身着墨色长袍的刀客,其剪影伫立在浓雾环绕、竹影婆娑的中心。
动作:刀客左手轻按刀柄,竹叶随风飘落。
氛围:寂静,压抑,水墨晕染的颗粒感清晰可见。
(0:03 - 0:08) 剧情引入,运镜:特写。
剧情:刀客察觉杀气。
画面:镜头快速推进到刀客斗笠下的特写。
细节:斗笠边缘露出一双凌厉、决绝的眼睛,眼神如刀。水墨晕染的“汗珠”从额头滑落。
动作:刀客右手缓缓握紧刀柄,指关节泛白。竹叶飘落的速度加快。
(0:08 - 0:13) 运镜:快速环绕。
画面:镜头以刀客为中心快速环绕。
剧情:两名同样是水墨剪影的刺客从竹林深处杀出,手持双钩和短刃。
细节:刺客的动作也是水墨笔触构成的,如墨迹流动。镜头快速掠过刺客的身影,强调速度感。
(0:13 - 0:18) 运镜:手持感,高速捕捉。
打斗:刀客猛然拔刀,刀光是一道纯白色的水墨裂痕。刺客双钩攻来。
细节:
一击:刀客回身一斩,刀刃与刺客双钩碰撞,迸发出无数黑白相间、带有书法感的火花和墨点。
二击:刀客虚晃一枪,利用竹竿弹射,从高处劈下。刺客翻滚躲避。竹竿被打断,化作飞散的墨痕。
三击:刀客刀尖直指另一刺客咽喉,刺客以短刃格挡,镜头捕捉刀刃与短刃摩擦时细微的墨迹崩裂细节。
**(0:18 - 0:20) 运镜:慢镜头至定格。**
* **画面:** 刀客的刀停在刺客颈侧,刺客凝固。
* **细节:** 刀客的斗笠在打斗中略微倾斜。竹林归于平静,更多竹叶飞舞。
* **氛围:** 镜头慢慢拉远,回到中景,定格在刀客收刀、刺客倒地的画面。
* **文字(可选):** 画面下方显现水墨风文字:“江湖,不过一笔勾销。”
**风格说明:** 整个过程保持 `image_0.png` 的高度黑白、水墨画风格,动作必须有毛笔触感,速度要快,细节要足(墨滴、火花、墨痕裂口)。64 条提示词从 18 字到 3,423 字不等,长的那些不是灌水,而是时间线。下面是整批案例里反复出现的八个习惯,每条都引一段真实案例里的原句,让你看到 Wan 3.0 实际响应的措辞。原句是中文,因为手册是中文;结构本身不挑语言,英文写在同一个模型上照样成立。
其中两个习惯比其他更要紧。给素材编号 —— 图1、视频1、音频1 —— 是挂多个文件时 Wan 3.0 分清谁扮演什么角色的唯一办法;结尾的加锁句 —— 说清什么必须不变 —— 决定了你拿到的是一次干净的编辑还是一整帧被重新想象的画面。
| 习惯 | 对 Wan 3.0 的作用 | 案例原句 |
|---|---|---|
| Wan 3.0 · 给素材编号 | 参考图、视频、音频按槽位指代,各自单独计数 | 将图片1中的女人定义为主体1,将图片2中的女人定义为主体2,主体1台词音色参考音频1 |
| Wan 3.0 · 写时间线 | 超过 10 秒的任务拆成带时间的分段,模型按顺序执行 | 镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底 |
| Wan 3.0 · 开头写明时长、画幅、帧率 | 第一句就是交付规格,并与 duration 参数对上 | 生成一支10秒、16:9横版、1920×1080、30fps、单镜头连续完成的微缩奇幻高速追逐短片 |
| Wan 3.0 · 把声音标注在句子里 | 音效用尖括号、台词用大括号或引号,Wan 3.0 两种都会生成 | 用抹布仔细擦拭吧台<抹布摩擦声> |
| Wan 3.0 · 锁定不能变的东西 | 每条编辑提示词都以「保持不变」的元素收尾 | 女人的动作和画面其余部分保持不变 |
| Wan 3.0 · 用衣着点名角色 | 延长和编辑先从原片里把人认出来,再写新段落 | 角色A为梳背头、穿深灰色中式长衫、左手腕佩戴棕色佛珠手串的男人 |
| Wan 3.0 · 给参考素材单一职责 | 一段视频只当动作、运镜或特效的来源,不是全部 | 参考视频的运镜方式,场景更改为一杯咖啡放在天台咖啡桌上 |
| Wan 3.0 · 描述从静帧出发的运动 | 首帧提示词写的是离开那张画的动作,带时间码 | (0:00 - 0:03) 运镜:中景。 画面:沿用 @Image1 的水墨竹林场景 |
17 条文生视频里有 12 条跑满 30 秒,它们共用一副骨架:一行简报写类型、长度和整体质感;一句配色和光线定调;然后是时间线 —— 编号镜头或秒数区间,每段写镜头、动作和底下的声音。长案例还会加一段连贯性说明,把角色的脸、发型、服装写一次,后面每段都复用。这个顺序在整本手册里都一致:规格和质感在前,情节在后,读者(和模型)先拿到交付约束,再看故事。
同一副骨架可以缩小:5 秒编辑就是简报、一个动作、一句加锁;15 秒产品片就是简报、一句光线、三个带时间的节拍。手册里从不出现的,是一整墙没有时间结构的形容词 —— 那种提示词出来的片子会显得拖沓,因为没人告诉 Wan 3.0 事情什么时候发生,它只能把动作均匀摊在整条片上。
| 模块 | 作用 | 案例里的样子 |
|---|---|---|
| Wan 3.0 · 简报 | 一行写清类型、长度、画幅、质感 | 这是一段30秒的真实电影质感海上巨兽登场场景,整体氛围参考好莱坞灾难怪兽大片 |
| Wan 3.0 · 配色与光线 | 一句话决定调色 | 整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围 |
| Wan 3.0 · 连贯性说明 | 脸、发型、服装写一次,每段复用 | 严格保持男性角色的黑发高发髻、鬓角碎发被风吹起、锐利深色瞳 |
| Wan 3.0 · 时间线 | 编号镜头或秒数区间,带镜头、动作、声音 | 分段1[0-5秒]:一个连续的、照片级写实的电影镜头 |
| Wan 3.0 · 声音 | 环境音、音效、台词放在发生的位置 | BGM(必须有,贯穿全片,音量清晰可闻) |
| Wan 3.0 · 加锁 | 编辑和延长类:什么保持不变 | 滑板动作、运动轨迹和滑板场背景完全保持不变 |
上面每个案例都对应向 POST /api/v1/video/generations 发一个请求,model 传 wan-3.0-video。提示词原样放进去;提示词里编号的素材按同样的顺序放进对应数组,因为图1就是 reference_image_urls 的第一项,视频1就是 reference_video_urls 的第一项。Wan 3.0 有两种不能混用的输入模式:首帧模式(first_frame_url,可加 last_frame_url)和参考模式(reference_image_urls、reference_video_urls、reference_audio_urls、file_url 或 link_url)。混用的请求我们在本地就拦下并指出冲突的两边,不会白跑一趟。
有两个参数不改提示词也会改结果。mode 传 prime 切到高速档,单价高 51–56%,能力一致。prompt_extend 默认打开,允许 Wan 3.0 改写过短的提示词;手册的提示词足够长,关掉它就能拿到你写的原样。
| 案例类型 | 要传的字段 | Wan 3.0 上的限制 |
|---|---|---|
| Wan 3.0 · 文生视频 | prompt、duration 2–30(或 -1 让模型定)、resolution 480P / 720P / 1080P、aspect_ratio | 单镜最长 30 秒、30fps,默认带音轨 |
| Wan 3.0 · 首帧 / 首尾帧 | first_frame_url、last_frame_url | 与所有参考类字段互斥 |
| Wan 3.0 · 图片参考 | reference_image_urls | 最多 10 张,不额外收费 |
| Wan 3.0 · 视频参考、编辑、延长 | reference_video_urls | 最多 5 段,单段 1–15 秒、总长 15 秒;按输入 + 输出计费;输入 + 输出 ≤ 30 秒 |
| Wan 3.0 · 音频参考 | reference_audio_urls | 最多 5 段、总长 15 秒,wav 或 mp3,不额外收费 |
| Wan 3.0 · 文档 / 网页 | file_url 或 link_url(二选一) | DOCX、PPTX、XLSX、PDF、TXT、MD 等,≤ 50 页、≤ 100 MB;网页须公开可访问 |
| Wan 3.0 · 速度档 | mode:standard(默认)或 prime | prime 单价高 51–56%,能力相同 |
Wan 3.0 按输出秒数、分分辨率计费:标准档 480P $0.045、720P $0.09、1080P $0.18 每秒;prime 档 $0.068、$0.14、$0.28。参考图、参考音频、文档、网页免费;参考视频把自己的长度加进计费秒数。只对成功的任务收费。下表按每条成片实际交付的分辨率报价,所以 720P 的成片按 720P 报,哪怕手册作者本可以要 1080P。
做预算参考:整套 64 条案例是 1,112 秒输出,加上 22 条带参考视频任务的 147 秒输入,共 1,258 个计费秒,按标准档 720P 单价约 $113。这是在 Wan 3.0 上复现一整本发布手册的成本。
| 案例 | 输出 | 计费秒数 | 标准档 | prime 档 |
|---|---|---|---|---|
| Wan 3.0 · 医院走廊,文生视频 | 30 秒 · 720P | 30 | $2.70 | $4.20 |
| Wan 3.0 · 分镜图告别,图片参考 | 20 秒 · 720P | 20 | $1.80 | $2.80 |
| Wan 3.0 · 健身房对话,音频参考 | 15 秒 · 720P | 15 | $1.35 | $2.10 |
| Wan 3.0 · 换滑手,视频参考 | 5 秒 · 720P(输入 5 秒) | 10 | $0.90 | $1.40 |
| Wan 3.0 · GMV 表格,文档生视频 | 23 秒 · 720P | 23 | $2.07 | $3.22 |
| Wan 3.0 · 滑手换成女人,视频编辑 | 5 秒 · 720P(输入 5 秒) | 10 | $0.90 | $1.40 |
| Wan 3.0 · 茶桌谈判,视频延长 | 20 秒 · 720P(输入 5 秒) | 25 | $2.25 | $3.50 |
| Wan 3.0 · 水墨刀客,首帧生视频 | 20 秒 · 720P | 20 | $1.80 | $2.80 |
30 秒是每个任务的硬上限,带参考视频时还是共享的上限:输入 + 输出不能超过 30 秒,所以手册里每条延长都从 5 秒的片子开始。参考视频总长不超过 15 秒、最多 5 段,参考音频总长 15 秒,参考图最多 10 张,文档最多 50 页。首帧模式和参考模式不能合并,file_url 和 link_url 不能同时传。这些都不是我们的限制,是 Wan 3.0 的;我们在请求发出前就按这些规则拦截,被拒的任务不会浪费一次往返。
手册没展示的东西和展示的一样有信息量。没有一条案例用可辨认的真人照片当参考,也没有一条依赖画面内的文字渲染(输入里本来就有的 logo 或字幕除外)。这两项在 Wan 3.0 上按「未验证」看待,别当作「支持」。参考类案例背后的参考图和文档本体手册没有公开,所以那些卡片只有提示词和结果。
apimodels.app 上有三个模型能接参考视频和音频、单次生成 15 秒以上。数字取自各自模型页,价格是本站对应档位的每秒挂牌价。
| Wan 3.0 | Seedance 2.5 | MiniMax H3 | |
|---|---|---|---|
| 单镜时长 | 2–30 秒 | 4–30 秒 | 5–15 秒 |
| 单次参考素材 | 10 图 + 5 视频 + 5 音频,或一份文档 / 网页 | 30 图 + 10 视频 + 10 音频 | 9 图 + 3 视频 + 3 音频 |
| 分辨率 | 480P / 720P / 1080P | 480p / 720p | 768P / 2K |
| 本站每秒价格 | $0.045 / $0.09 / $0.18 | $0.120 / $0.270 | $0.097 / $0.145 |
| 视频编辑与延长 | 有,走参考视频 | 有,独立任务类型 | 生成式编辑 |
| 文档 / 网页作为输入 | 有 | 无 | 无 |
| 原生同步音频 | 有 | 有 | 有 |
Wan 3.0 Video 是由 Alibaba 提供的视频生成 API。万相 3.0 是阿里的全能视频模型:一个模型名同时覆盖文生视频、首帧 / 首尾帧图生视频,以及「全能参考」—— 最多 10 张参考图 + 5 段参考视频 + 5 段参考音频(视频、音频各自总时长 15 秒以内),或者直接喂一份文档(PPTX / DOCX / XLSX / PDF / TXT / MD,50 页、100MB 以内)、一个无需登录的公开网页。输出原生单镜最长 30 秒、30fps,自带同步音轨(传 audio: false 可以关掉,关掉不降价)。分辨率 480P / 720P / 1080P,画幅支持 adaptive(默认,按素材和意图自动挑)、16:9、4:3、1:1、3:4、9:16 —— 注意一处我们和上游故意不一样:省略 resolution 时我们默认走 720P 而不是官方的 1080P,因为 1080P 是双倍价,不该让没写这个参数的人默认落在最贵那档,要 1080P 显式传就行。全能参考的用法是这个模型的关键:素材按顺序放进请求里,提示词就能用「图1」「视频1」「音频1」指代它们(图、视频、音频各自独立编号),比如「视频1 里的人抱着 图3,坐在 图4 的椅子上弹吉他」—— 这是让多个角色、道具、场景在同一条镜头里保持一致的办法。有一条硬规则别踩:参考类素材(参考图 / 参考视频 / 参考音频 / 文档 / 网页)与首帧、尾帧是互斥的,同一个请求里混用上游会直接判失败,我们在本地就先拦下并告诉你是哪两边撞了,不让你白跑一趟;file_url 与 link_url 同样是二选一。计费按秒:480p $0.045/秒、720p $0.09/秒、1080p $0.18/秒,参考图、参考音频、文档、网页一分不收;但传了参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计 —— 与上游一致,官方对这类任务同样限制「输入总时长 + 输出时长 ≤ 30 秒」。所以不带输入视频时,5 秒 720p 约 $0.45、10 秒 1080p 约 $1.80、30 秒 1080p 约 $5.40;而如果另外喂了一段 10 秒的参考视频,那条 10 秒 1080p 会按 20 秒计、约 $3.60。duration 传 -1 是智能时长,模型自己在 2 到 30 秒之间挑一个长度,这种情况我们先按 30 秒的最坏情况冻结额度,等上游回报真实秒数后按实际扣费、差额退回,不会因为「模型决定只生成 5 秒」就按 30 秒收你钱。速度要有心理准备:标准档实测 480P 5 秒的片子约 356 秒才出结果;传 mode:"prime" 切到高速档,同一条任务实测 58 秒,单价高 51–56%(480p $0.068/秒、720p $0.14/秒、1080p $0.28/秒)—— 买的是速度,不是画质。异步创建后轮询(建议 10-15 秒一次),或者传 callback_url 让我们回调;失败不扣费,成片保留 30 天。我们不在这个模型之外再加一层内容审核:提示词和参考素材原样透传。但模型自带的安全检查仍然生效,而且实测确实会拒 —— 输入和输出都会被筛查,参考素材里含真人面孔的情形经常被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责;请仅对已获授权 / 已同意的对象使用。 通过 APIMODELS 平台,您可以使用统一的 API 接口调用该模型,按量计费、价格透明。当前定价:480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28。
快速生成品牌宣传视频,适用于广告投放和社交媒体推广。
为抖音、小红书等平台创建引人注目的短视频内容。
生成产品功能演示和使用教程视频,提升用户转化率。
制作课程讲解、知识科普等教育类视频,降低视频制作门槛。
Wan 3.0 Video 通过 APIMODELS 平台调用,当前定价:480p: $0.045, 720p: $0.09, 1080p: $0.18, 480p-prime: $0.068, 720p-prime: $0.14, 1080p-prime: $0.28。按量计费,用多少付多少。
在 APIMODELS 注册账号并获取 API Key,然后通过我们的统一 API 端点调用即可。我们提供详细的 API 文档和 cURL、Python、Node.js 代码示例。
APIMODELS 通过聚合平台提供与官方相同的 Wan 3.0 Video 模型。我们提供统一的 API 接口,无需分别注册各平台账号,一个 API Key 即可调用所有模型。
万相 3.0(Wan 3.0)是阿里 2026 年 8 月推出的全能视频生成模型:一个模型名同时覆盖文生视频、首帧/首尾帧图生视频,以及「全能参考」——最多 10 张参考图 + 5 段参考视频 + 5 段参考音频(视频、音频各自总时长 15 秒内),或者直接喂一份文档(PPTX/DOCX/XLSX/PDF/TXT/MD,50 页内)、一个公开网页。在 apimodels.app 上向 /api/v1/video/generations 发 POST,model 传 "wan-3.0-video",拿返回的 task_id 轮询同一端点即可,请求格式与站内 VEO、Kling、Seedance 完全一致,一把 key 全都能调。
因为多数人开不了户。万相 3.0 目前只在阿里百炼的【中国站】和新加坡区域有货 —— 我们实测过美东弗吉尼亚区域根本不供这个模型(那个业务空间列出的 92 个模型里一个视频模型都没有),而中国站要中国大陆实名认证才能注册,海外开发者卡在这一步。走 apimodels.app 就不需要阿里云账号、不需要实名、不需要单独对账,和你已经在用的其它模型同一把 key、同一个端点。
按秒计价:480p $0.045/秒、720p $0.09/秒、1080p $0.18/秒。参考图 / 参考音频 / 文档 / 网页一分不收;但传了参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计费 —— 与上游一致,官方对这类任务同样限制「输入总时长 + 输出时长 ≤ 30 秒」。所以不带输入视频时,5 秒 720p 约 $0.45,10 秒 1080p 约 $1.80,30 秒 1080p 约 $5.40;若另外喂了一段 10 秒的参考视频,10 秒 1080p 会按 20 秒计、约 $3.60。音轨开关不影响价格。失败不扣费。传 mode:"prime" 切到高速档,单价高 51–56%(480p $0.068/秒、720p $0.14/秒、1080p $0.28/秒),买的是速度。
能。duration 取 2-30 的整数,原生单镜输出、30fps,不是几段拼接。传 -1 是智能时长模式:模型根据提示词和素材自己挑一个 2-30 秒之间的长度。用 -1 时我们按 30 秒的最坏情况冻结额度,等上游回报真实输出秒数后按实际扣费、差额退回,所以你不会因为「模型决定只生成 5 秒」而被按 30 秒收钱。注意有参考视频时,输入视频总时长 + 输出时长不能超过 30 秒。
把素材按顺序放进请求里,提示词里就能用「图1」「图2」「视频1」「音频1」指代它们 —— 图、视频、音频各自独立编号。比如「视频1 里的人抱着 图3,坐在 图4 的椅子上弹吉他」。这是让多个角色、道具、场景在一条镜头里保持一致的关键。注意一个硬规则:参考类素材(reference_image/video/audio、文档、网页)与首帧/尾帧【互斥】,不能在同一个请求里混用,混了上游会直接判失败 —— 我们在本地就会先拦下来并告诉你原因,不会白跑一趟。
直接把一份 PPT、Word、Excel、PDF、TXT 或 Markdown 的公网地址传给 file_url(50 页以内、100MB 以内),模型会读懂里面的内容再生成视频,不需要你先把它拆成提示词。产品发布会 deck、课件、报告这类已经写好的材料可以直接进视频工作流。网页同理,传 link_url 即可(只支持无需登录的公开页面)。注意 file_url 和 link_url 二选一,不能同时传。
默认带同步音轨(对话、音效、环境音),传 audio: false 可以关掉,开关不影响价格。分辨率 480P / 720P / 1080P;画幅支持 adaptive(默认,按输入素材和意图自动挑)、16:9、4:3、1:1、3:4、9:16。⚠️ 我们这边省略 resolution 时默认走 720P,而不是官方的 1080P —— 1080P 是双倍价,不该让没写这个参数的人默认落在最贵档。要 1080P 显式传就行。
标准版实测:480P 5 秒的片子约 356 秒出结果(官方口径是 1-5 分钟)。同一条提示词、同样参数下传 mode:"prime" 实测 58 秒,快约 6 倍。异步接口,建议 10-15 秒轮询一次;不想轮询就传 callback_url,任务结束我们主动 POST 通知你。成片保留 30 天后自动删除,记得及时下载或转存。
在 APIMODELS,Wan 3.0 Video 与 60+ 个模型共用一个 API Key、一个余额,所以选型只看合不合适,不存在锁定。它支持 Text to Video、First / Last Frame、Omni Reference、Doc & Web to Video、Up to 30s @ 30fps、Native Audio,你可以在价格和能力上把它和其它视频生成模型对比,换模型只需改一个模型名字符串——无需新账号、无需重新对接。所有视频生成模型与实时价格见 apimodels.app/models。
Wan 3.0 Video 支持:Text to Video、First / Last Frame、Omni Reference、Doc & Web to Video、Up to 30s @ 30fps、Native Audio。完整参数与调用方式见 APIMODELS 的 API 文档。
可以。APIMODELS 提供可直接访问的统一 API,一个 API Key 即可调用 Wan 3.0 Video,无需分别注册官方账号、也无需自行处理官方接口的网络访问。
我们支持 Stripe(Visa、Mastercard 等国际信用卡)和支付宝付款。充值后积分即时到账。
社区作者公开的提示词,可直接复制修改。每条都标注作者并回链原帖。

情绪写实:毕业袍女孩对镜头倾诉
这是一个正面的近景镜头,画面主要呈现一位年轻黑人女孩的头部和上半身,她穿着一件蓝色的毕业袍。镜头稍微偏一点点,可以看到左边还有一个人,但背景被虚化处理了,看起来很模糊。女孩正对着镜头说话,嘴巴在动,眉头稍微皱着,表情看起来有点严肃和忧虑。光线从上方照下来,把她脸上的轮廓衬托得很自然,甚至能看到皮肤真实的质感。镜头虽然固定,但带着一点点人手持拍摄时的轻微呼吸感和晃动,视线从看着前面慢慢变成了低头看手里。
作者 Wan 3.0 视频创作者手册 · 通义万相

悬疑电影:淡绿滤镜的空医院走廊
一段现代悬疑风格的电影感长镜头,整个画面呈现出强烈的淡绿色滤镜风格,营造出一种基于淡绿色系的清冷氛围。在散发着冰冷白光的荧光灯下,空无一人的医院走廊呈现出低饱和的色彩与极高对比的光影关系,锐利且非人情化。镜头从护士台后方开始,一名身穿墨绿色夹克的女子猛地从走廊尽头的门后冲入,沿着对称的中心线向镜头快速跑来,摄影机流畅地向后移动。她的脚步声急促而响亮,口中焦急地呼喊。最终,她冲到台前,双手用力拍在台面上,绝望地环顾四周,发出几近崩溃的求助呐喊,声音在只有微弱设备嗡鸣的寂静中回荡。
作者 Wan 3.0 视频创作者手册 · 通义万相

喜剧短片:片场导演与女主的一镜到底
镜头1 [0秒-30秒] 近景,平视视角,连续快速摇镜,一镜到底(单镜头连续无缝运镜): 画面左侧是身穿黑色潮流导演马甲、戴着高档专业工作耳麦的导演,其左下方放置着一台巨大的专业电影摄像机。右侧是妆容精致、留着时尚韩式逗号刘海、身穿高定制西装的关系户小鲜肉。背景是宽敞的专业影棚拍摄现场,可见巨大的绿色幕布、数个高耸的影视级C型灯架、缠绕的电线,以及在背景中穿梭忙碌的灯光师和化妆师等工作人员。 专业影棚人工光。柔和的LED柔光箱光源从右侧洒入,将三位主角的面部均匀照亮,场景色彩饱满。背景的摄影器材与绿幕在充足的影棚灯光下投射出淡淡的阴影,呈现出真实而忙碌的现代化大制作片场质感。 镜头手持拍摄一镜到底,近景,镜头一开始,拍摄导演,导演无所谓的表情,瞥了一眼画面右侧斜前方画外的一眼关系户小鲜肉,对他下达指令,说道:“媒体故意黑你,做个表情看看”。说完后镜头快速右摇到关系户面部近景,镜头不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,神色自若,眼神真挚而自信。他嘴唇微动,神情专业地向对方阐述到““就这种事情来说,情绪可以有好几种”,说话时,头部伴有极其轻微的自然晃动,说完后镜头快速左摇到导演面部近景,镜头不要切镜,导演思索了一下,一边挑衅似地歪了歪头,向关系户小鲜肉说到““狗仔爆料你深夜幽会”,导演说完台词后,镜头迅速右摇到小鲜肉面部近景,不要切镜,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,并快速进入表演状态,他眉头紧锁,眼神慌乱、焦急地快速游移,随后他狠狠地咬紧下唇,闭上双眼,整张脸(虽带着精致妆容)因极度的焦虑而紧绷,完美呈现出面对偶像生涯毁灭时,内心惊恐、紧张交织的挣扎状态。表演完后, 镜头再次迅速左摇到导演近景,不要切镜,导演面部表情微变,语速加快,说到““媒体又帮你洗白了,说那是你亲姐!”导演说完后,镜头再次迅速右摇到小鲜肉近景,镜头不要切镜,镜头中,关系户小鲜肉,面部朝向画面左侧斜前方画外导演方向,他的表情在千分之一秒内完成神级转换。他先是面部一滞,随后双眼猛地眯起,嘴角极大程度地咧开,露出一排白皙的牙齿,展露出一个极其夸张、甚至有些变形的狂喜笑容。这种“星途尽毁的绝望”与“彻底摆脱束缚”交织的疯魔情绪在他脸上扭曲呈现。角色表演完后,镜头再次迅速左摇到导演近景,镜头不要切镜,导演说到“你亲姐向媒体透露,你是领养的”,导演说完后,镜头再次迅速右摇到小鲜肉近景。镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他双眼暴睁,眼球凸出,精心修剪的眉毛高高扬起,嘴巴震惊地张成“O”形。紧接着,他的嘴角再次无法克制地向上拉扯,露出一副不可思议、惊魂未定却的复杂神态。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,紧接着导演露出有点惊讶的表情说到“其实你是千亿豪门真少爷”。导演说完,镜头再次随即迅速右摇到小鲜肉近景,镜头不要切镜,镜头内,关系户小鲜肉面部朝向画面左侧斜前方画外导演方向,他瞬间爆发出极度魔性的狂喜。他整个人激动得微微颤抖,双眼笑得眯成了一条缝,双手甚至抬起至胸前,双手小幅度快速连续鼓掌,身体前倾摇晃,将一夜暴富、无法自持的癫狂喜悦演绎得淋漓尽致。 角色表演完后,镜头再次快速左摇到导演近景,镜头不要切镜,导演说到“你姐卷款跑路”导演说完,镜头再次迅速右摇到小鲜肉近景。小鲜肉面部朝向画面左侧斜前方画外导演方向,只见他的双眼再次瞪大,瞳孔颤抖,嘴角向下耷拉,神情在一秒钟之内从天堂坠入地狱,写满了惊愕、痛苦与不知所措。画面最后定格在这个表情上。
作者 Wan 3.0 视频创作者手册 · 通义万相
接入方式、地区可用性,以及和同类模型的横向对比。