xAI 的 Grok Imagine 视频模型:文生视频和图生视频同一个模型名,自带同步音轨(对话 / 音效 / 环境音),1-15 秒任意时长,480p / 720p / 1080p 三档按秒计价,成片无水印。实测出片很快:4 秒的片子约 30-70 秒返回。走 apimodels.app 统一视频端点,与 VEO、Kling、Seedance 的调用方式完全一样,换模型只改 model 字段,一把 key 全平台通用。
| 分辨率 | 单价 | 4 秒 | 8 秒 | 15 秒 |
|---|---|---|---|---|
| 480p | $0.0294/s | $0.12 | $0.24 | $0.44 |
| 720p | $0.0529/s | $0.21 | $0.42 | $0.79 |
| 1080p | $0.0882/s | $0.35 | $0.71 | $1.32 |
费用 = 单价 × 时长(秒),文生视频与图生视频同价,参考图不额外收费。失败不扣费。
POST /api/v1/video/generations —— 异步:创建后轮询同一个端点取结果。
# Step 1: Create task (text-to-video; add "images" for image-to-video)
curl -X POST https://api.apimodels.app/v1/video/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-imagine-video-1.5",
"prompt": "A calm coastal shoreline at sunset, camera slowly pushing forward",
"resolution": "720p",
"duration": 10,
"aspect_ratio": "16:9"
}'
# Step 2: Poll status
curl "https://api.apimodels.app/v1/video/generations?task_id=TASK_ID" \
-H "Authorization: Bearer YOUR_API_KEY"| 字段 | 必填 | 类型 | 说明 |
|---|---|---|---|
| model | 是 | string | grok-imagine-video-1.5 |
| prompt | 否 | string | 视频描述(纯图生视频时可省略,prompt 与参考图至少传一个)。最长 4096 字符;1080p 的 10-15 秒片子建议控制在 2048 字符内,超过会改走另一条通道、出片更慢 |
| images | 否 | string[] | 参考图,最多 7 张;http(s) URL 或 base64 / data URL 都可以。1080p 只能带 1 张(作为首帧);2 张及以上请用 720p 或 480p |
| resolution | 否 | string | "480p"、"720p"(默认)、"1080p"。1080p 仅支持文生视频和单图图生视频,多参考图被模型封顶在 720p |
| duration | 否 | number | 1-15 秒,默认 10 |
| aspect_ratio | 否 | string | "16:9"(默认)、"9:16"、"1:1"、"3:2"、"2:3" |
| callback_url | 否 | string | 任务完成后的回调 URL |
创建接口立即返回 data.taskId,视频在后台生成。带上这个 task_id 向同一个端点发 GET,读 data.state:pending 表示还在跑,completed 时 data.resultUrls[0] 就是 MP4 地址(H.264 视频 + AAC 音轨),failed 时 data.failMsg 是原因。不想轮询就传 callback_url,任务结束后我们主动 POST 通知你。
下面每一条都是模型或上游的硬限制,不是平台加的;超出的请求在创建时就会被 400 拒掉(不建任务、不扣费),而不是跑到一半失败。
| 项目 | 限制 | 说明 |
|---|---|---|
| prompt 长度 | 最长 4096 字符 | 按字符数计,中英文都算一个字符。1080p 且 10-15 秒的请求优先走按次计价的通道,那条通道只收 2048 字符以内;超过 2048 仍能出片,但会改走按秒计价的通道,出片更慢。超过 4096 直接 400。 |
| prompt 内容 | 只写模型需要的东西 | 分镜动作、镜头、对白、风格、角色外观有效;「不要读出以下备注」「输出规范」「语言策略」这类给人看的说明模型不理解,只会挤占字符预算、稀释真正的指令。想要特定时长请设 duration 参数,不要在文字里写「必须正好 15 秒」。 |
| 参考图张数 | 最多 7 张;1080p 时恰好 1 张 | 480p / 720p 是参考图模式(保主体与构图)。1080p 只有单图首帧模式:视频从这张图开始;传 2 张以上返回 400,改 720p 即可。 |
| 参考图可访问性 | 提交时必须可下载 | 我们在创建任务时立刻把图转存到自己的存储,之后你的链接失效不影响生成。带短时效签名的 URL(几分钟)可以用,前提是调用那一刻还没过期;不确定就直接传 base64。 |
| 时长 | 1-15 秒整数,默认 10 | 实际成片时长等于请求时长。1080p 且 10-15 秒是最省钱的组合(按次计价,固定价低于按秒);1080p 短于 10 秒按秒计价。 |
| 分辨率 | 480p / 720p / 1080p | 只认这三个小写值。1080p 的图生视频规则见上;多参考图封顶 720p 是模型限制,任何渠道都绕不开。 |
| 画幅 | 16:9 / 9:16 / 1:1 / 3:2 / 2:3 | 1080p 单图模式下不传 aspect_ratio 则跟随参考图;其余情况默认 16:9。 |
| 参考视频 | 暂不支持 | 传 video / video_url 等字段会收到明确 400。 |
| 音频 | 随画面原生生成 | 对白语言、角色台词写在 prompt 里即可;不支持上传音频或指定音色,不能保证逐句口型时间轴精确对齐。 |
| 出片时间 | 4 秒片约 30-70 秒;1080p 10-15 秒片约 2.5-3 分钟 | 实测中位数,高峰期会更长。结果保存 7 天。 |
参数问题在创建时就同步返回 400({"code": 400, "msg": "..."}),不会建任务、不扣费。msg 原文如下,可以直接按字符串匹配。
| msg | 原因 / 怎么改 |
|---|---|
prompt or a reference image is required | prompt 和 images 都没传;至少给一个。 |
prompt is N characters; at most 4096 are accepted on this model — shorten it | 提示词超过 4096 字符。分镜、对白、制作备注一起塞进 prompt 很容易超,精简到 2048 以内最稳。 |
resolution must be one of 480p / 720p / 1080p (got "...") | resolution 拼写不对;只认这三个小写值。 |
duration must be 1-15 seconds (got ...) | 时长超出 1-15 秒。 |
at most 7 reference images are supported (got N) | 参考图超过 7 张。 |
1080p supports text-to-video and single-image image-to-video only; multi-image reference-to-video is capped at 720p by the model (got N images) — set "resolution": "720p" or send a single image | 1080p 配了 2 张以上的图。改 resolution 为 720p,或只保留 1 张图。 |
reference-video editing is not enabled on this model yet — pass reference images instead | 传了参考视频(video / video_url 等字段);本模型暂不开放视频编辑。 |
生成阶段才失败的任务(上游报错、超时等)状态为 failed,原因在 data.failMsg,费用自动退回。
有。在 apimodels.app 向 /api/v1/video/generations 发 POST,传 model "grok-imagine-video-1.5"、prompt 和/或参考图,然后拿返回的 task_id 轮询同一个端点,直到 data.state 变成 "completed",data.resultUrls[0] 就是 MP4(H.264 画面 + AAC 音轨)。请求格式与站内的 VEO、Kling、Seedance 完全一致,换模型只改 model 一个字段,一把 key 全都能调。
按秒 × 分辨率计价:480p $0.0294/秒、720p $0.0529/秒、1080p $0.0882/秒——4 秒 480p 约 $0.12,15 秒 1080p 约 $1.32。注意默认值:不传 resolution 和 duration 时按 720p、10 秒算(约 $0.53)——这是我们两条渠道都能服务的形态;要 480p 或更短的片子显式指定即可,只是那些形态只有单渠道能跑。文生与图生同价,参考图不额外收费,失败不扣费。
会。模型在生成画面的同时产出同步音轨(对话、音效、环境音),拿到的 MP4 直接就是 H.264 画面 + AAC 音频,不需要额外配音。成片无水印——上架前我们对文生和图生两类结果都做过逐帧抽查。