阿里万相 3.0(Wan 3.0)全能视频模型:一个模型名同时覆盖文生视频、首帧/首尾帧图生视频,以及「全能参考」——最多 10 张参考图 + 5 段参考视频 + 5 段参考音频,或者直接喂一份 PPT / Word / Excel / PDF、一个公开网页。原生单镜最长 30 秒、30fps,自带同步音轨。计费按秒:**只传参考图 / 参考音频 / 文档 / 网页时,按输出秒数计费,这些素材不额外收费;传了参考视频(视频编辑、视频延长、换脸等)时,按【输入视频时长 + 输出时长】计费** —— 这与上游一致,官方对带视频输入的任务也是限制「输入总时长 + 输出时长 ≤ 30 秒」。走 apimodels.app 统一视频端点,与 VEO、Kling、Seedance 调用方式完全一致,换模型只改 model 字段,一把 key 全平台通用 —— 也不需要阿里云账号和大陆实名认证。
按秒计费。不带参考视频时按输出秒数计;带参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计 —— 与上游一致,官方对这类任务也限制「输入总时长 + 输出时长 ≤ 30 秒」。参考图 / 参考音频 / 文档 / 网页不额外收费。
| 档位 / 分辨率 | 单价 | 5 秒 | 10 秒 | 30 秒 |
|---|---|---|---|---|
| standard · 480P | $0.045/s | $0.225 | $0.45 | $1.35 |
| standard · 720P | $0.09/s | $0.45 | $0.90 | $2.70 |
| standard · 1080P | $0.18/s | $0.90 | $1.80 | $5.40 |
| prime · 480P | $0.068/s | $0.34 | $0.68 | $2.04 |
| prime · 720P | $0.14/s | $0.70 | $1.40 | $4.20 |
| prime · 1080P | $0.28/s | $1.40 | $2.80 | $8.40 |
POST /api/v1/video/generations —— 异步:创建后轮询同一个端点取结果。
# Step 1: Create task (text-to-video)
curl -X POST https://api.apimodels.app/v1/video/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "wan-3.0-video",
"mode": "prime",
"prompt": "A paper airplane gliding over a calm lake at sunrise, camera drifting alongside",
"resolution": "720P",
"ratio": "16:9",
"duration": 5
}'
# Omni-reference: address materials positionally in the prompt
curl -X POST https://api.apimodels.app/v1/video/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "wan-3.0-video",
"prompt": "The person in video 1 picks up the object from figure 2 and places it on the table",
"reference_image_urls": ["https://example.com/object.png"],
"reference_video_urls": ["https://example.com/person.mp4"],
"resolution": "720P",
"duration": 8
}'
# Document to video: feed a deck straight in
curl -X POST https://api.apimodels.app/v1/video/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "wan-3.0-video",
"prompt": "A polished product launch film based on this deck",
"file_url": "https://example.com/launch-deck.pptx",
"resolution": "1080P",
"duration": 10
}'
# Step 2: Poll status
curl "https://api.apimodels.app/v1/video/generations?task_id=TASK_ID" \
-H "Authorization: Bearer YOUR_API_KEY"| 用法 | 传什么 |
|---|---|
| 文生视频 | 只传 prompt |
| 首帧 / 首尾帧 | first_frame_url [+ last_frame_url] |
| 全能参考 | reference_image_urls / reference_video_urls / reference_audio_urls |
| 文档 / 网页生视频 | file_url 或 link_url |
⚠️ 首帧/尾帧 与 参考类素材(reference_* / file_url / link_url)【互斥】,不能在同一个请求里混用 —— 混了上游会判失败,我们在本地就先拦下来并告诉你是哪两边冲突,不会白跑一趟。file_url 与 link_url 也是二选一。
在全能参考模式下,提示词里可以用「图1」「图2」「视频1」「音频1」按顺序指代素材(图、视频、音频各自独立编号),例如:「视频1 里的人抱着 图3,坐在 图4 的椅子上弹吉他」。这是让多个角色、道具、场景在一条镜头里保持一致的关键。
| 字段 | 必填 | 类型 | 说明 |
|---|---|---|---|
| model | 是 | string | "wan-3.0-video" |
| mode | 否 | string | "standard"(默认)或 "prime"。prime = 高速档,同一条任务实测 58 秒出片(标准档 356 秒),单价按分辨率高 51~56%(480P +51%,720P / 1080P +56%)。两档能力一致(官方口径),差别只在速度与价格 |
| prompt | 否 | string | 视频描述。prompt 与素材至少传一个;最长 20000 字符 |
| first_frame_url | 否 | string | 首帧图,严格作为第一帧。与参考类素材互斥 |
| last_frame_url | 否 | string | 尾帧图,严格作为最后一帧 |
| reference_image_urls | 否 | string[] | 参考图,最多 10 张。提示词里按顺序称「图1」「图2」 |
| reference_video_urls | 否 | string[] | 参考视频,最多 5 段,单段 1-15 秒、总时长 ≤15 秒 |
| reference_audio_urls | 否 | string[] | 参考音频,最多 5 段,总时长 ≤15 秒(wav / mp3) |
| file_url | 否 | string | 文档:docx/doc/xlsx/xls/pptx/ppt/pdf/txt/key/pages/numbers/md,≤50 页、≤100MB。与 link_url 二选一 |
| link_url | 否 | string | 公开网页 URL(无需登录即可访问的页面) |
| resolution | 否 | string | "480P" / "720P" / "1080P"。⚠️ 省略时我们默认 720P(官方默认是 1080P,双倍价) |
| ratio | 否 | string | "adaptive"(默认,按输入素材自动挑)、"16:9"、"4:3"、"1:1"、"3:4"、"9:16" |
| duration | 否 | number | 2-30 秒,默认 5;传 -1 为智能时长(模型自己挑)。有参考视频时:输入视频总时长 + 输出时长 ≤ 30 秒 |
| audio | 否 | boolean | 输出是否含音轨,默认 true。关掉不降价 |
| prompt_extend | 否 | boolean | 提示词智能改写,默认 true。短提示词效果提升明显,但会增加耗时 |
| seed | 否 | number | 随机种子,0-2147483647,用于复现结果 |
| watermark | 否 | boolean | 是否加水印标识,默认 false |
| callback_url | 否 | string | 任务完成后的回调 URL |
创建接口立即返回 data.taskId,视频在后台生成。带上这个 task_id 向同一个端点发 GET,读 data.state:pending 表示还在跑,completed 时 data.resultUrls[0] 就是 MP4 地址,failed 时 data.failMsg 是原因。不想轮询就传 callback_url,任务结束后我们主动 POST 通知你。
有。在 apimodels.app 向 /api/v1/video/generations 发 POST,传 model "wan-3.0-video"(高速版是 "mode:"prime"")、prompt 和/或参考素材,然后拿返回的 task_id 轮询同一个端点,直到 data.state 变成 "completed",data.resultUrls[0] 就是 MP4 地址。请求格式与站内的 VEO、Kling、Seedance 完全一致,换模型只改 model 一个字段,一把 key 全都能调。
因为中国大陆以外的开发者多半开不了那个户。万相 3.0 目前只在阿里百炼的中国站(北京)和新加坡区域有货 —— 我们实测美东弗吉尼亚区域根本不供这个模型(返回 AccessDenied.Unpurchased,而那个业务空间列出的 92 个模型里一个视频模型都没有),而中国站要中国大陆实名认证才能注册。走 apimodels.app 不需要阿里云账号、不需要实名、不需要单独对账,和你已经在用的其它模型同一把 key、同一个端点。
按秒计费。标准版比阿里云万相 3.0 官方美元价低 10%:480P $0.045/秒、720P $0.09/秒、1080P $0.18/秒 —— 5 秒 720P 约 $0.45,30 秒 1080P 约 $5.40。高速版 Prime 按官方价计,比标准版每秒高 51~56%($0.068 / $0.14 / $0.28)。计费秒数看你传了什么:只传参考图 / 参考音频 / 文档 / 网页时按输出秒数计,这些素材不额外收费;传了参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计 —— 与上游一致,官方对这类任务也限制「输入总时长 + 输出时长 ≤ 30 秒」。音轨开关不影响价格。传 duration -1 时按 30 秒最坏情况冻结,再按真实时长结算、差额退回。失败不扣费。
区别在速度和价格,不在画质。官方说 Prime 能力与标准版对齐 —— 同样的全能参考、同样的 30 秒 30fps 上限、同样的原生音轨、同样的画幅选项。同一条提示词、同样参数(480P、9:16、5 秒、关音轨)实测:Prime 58 秒返回,标准版 356 秒,快约 6 倍。Prime 单价按分辨率高 36~40%(480P +36%,720P / 1080P +40%)。人在等结果的交互场景用 Prime,批量跑用标准版 —— 后者多等六分钟不花钱。
能。duration 取 2-30 的整数,输出是原生单镜连续画面、30fps,不是几段拼接 —— 这是它与多数只能出 5-10 秒的模型最大的差别。传 -1 是智能时长模式,模型根据提示词和素材自己挑一个 2-30 秒之间的长度。一个限制:传了参考视频时,输入视频总时长 + 输出时长不能超过 30 秒。
一个模型名下四种用法。纯文生视频(只传 prompt)。首帧、或首尾帧图生视频。全能参考:最多 10 张参考图 + 5 段参考视频(总长 15 秒内)+ 5 段参考音频(总长 15 秒内),提示词里用「图1」「视频1」「音频1」按顺序指代。以及文档/网页生视频:PPTX、DOCX、XLSX、PDF、TXT、MD(50 页内),或一个无需登录的公开网页。一条硬规则:首尾帧 与 参考类素材【互斥】,混用上游会判失败 —— 我们在本地就先拦下并告诉你是哪两边冲突,不会让你白跑一趟。