Gemini Omni 1.1 Flash 是 Google Omni 视频模型里开发者真正等的那一版:可以钉住首帧和尾帧,可以喂最多七张参考图,可以丢一段短片让它改 —— 全部走同一个模型 ID gemini-omni-1.1-flash。这一页回答动手写代码之前大家会搜的三件事:每秒多少钱、和 Google 官方价比怎么样;哪个字段决定走哪种模式;哪些写法会直接 400,免得花钱试出来。
官方 Gemini API 按 token 计费:视频输出 $17.50 / 百万 token,Google 自己的换算是 720p 每秒约 $0.10(每秒 5,792 token);1080p 和 4K 每秒 token 更多,折合约 $0.15 和 $0.30。没有免费层,而且要绑 Google Cloud 的付费账户。APIMODELS 对同一个模型按输出秒数收:720p $0.07、1080p $0.10、4K $0.20,每一档都至少低 30%,只需要一把 API key。
规格表上没有、生产里最要紧的数字我们跑了一遍:4 秒 720p 文生视频 57 秒出片,6 秒首尾帧 121 秒,4 秒 4K 176 秒;成片分辨率分别是 1280×720、1920×1080、3840×2160 —— 真 4K,H.264 带 AAC 音轨。只有成功出片才扣费。
两列都是每秒输出视频的价格。官方那一列 720p 是 Google 自己的 token→秒换算,1080p 和 4K 按同一 token 单价折算。视频输入那一行是唯一不总是我们更便宜的地方:输入是视频时,APIMODELS 按次一口价、不看长度,所以 720p 下源片短于 7 秒左右时,这里会比官方按秒算贵。
| 档位 | APIMODELS | 官方 Gemini API(≈) | 差价 |
|---|---|---|---|
| 720p,每秒 | $0.07 | $0.10 | 低 30% |
| 1080p,每秒 | $0.10 | $0.15 | 低 33% |
| 4K,每秒 | $0.20 | $0.30 | 低 33% |
| 视频输入(编辑),720p / 1080p | 每次一口价 $0.70 | $0.10–0.15 × 源片秒数 | 源片 ≥7 秒(720p)/ ≥5 秒(1080p)起更便宜 |
| 视频输入(编辑),4K | 每次一口价 $1.05 | $0.30 × 源片秒数 | 源片 ≥4 秒起更便宜 |
| 360p | 不提供(返回 400) | ≈ $0.03 | — |
| 任务 | APIMODELS | 官方(≈) |
|---|---|---|
| 8 秒文生视频,720p | $0.56 | $0.80 |
| 6 秒首尾帧,1080p | $0.60 | $0.90 |
| 10 秒参考图生视频,720p | $0.70 | $1.00 |
| 10 秒,4K | $2.00 | $3.00 |
| 编辑一段 6 秒源片,720p | $0.70(一口价) | $0.60 |
| 编辑一段 10 秒源片,1080p | $0.70(一口价) | $1.50 |
不用按名字选模式。发 model: "gemini-omni-1.1-flash",请求体自己决定:只有 prompt 就是文生视频;first_frame_url(可再加 last_frame_url)是首尾帧控制的图生视频;images(最多 7 个公网 URL,可选 audio_ids / character_ids)是参考图生视频;video_list 里放一段就是视频编辑,输出长度跟随源片、duration 会被忽略。之后用 task_id 轮询同一个端点,直到 state 变成 completed 或 failed。
| 模式 | 决定它的字段 | 时长 / 分辨率 | 计价方式 |
|---|---|---|---|
| 文生视频 | prompt | 4 / 6 / 8 / 10 秒 · 720p / 1080p / 4k · 16:9 或 9:16 | 按秒 |
| 首尾帧 | prompt + first_frame_url(+ last_frame_url) | 同上 | 按秒 |
| 参考图生视频 | prompt + images[](≤7)(+ audio_ids、character_ids) | 同上 | 按秒 |
| 视频编辑 | prompt + video_list[0] = {url, start, ends}(窗口 ≤10 秒,源片 ≤30 秒) | 输出跟随源片;duration 忽略 | 一口价 $0.70 / $1.05 |
下面这些在创建时就被拒,不进队列、不扣费:duration 不是 4 / 6 / 8 / 10;resolution 写 360p(Google 有这档,我们不转售,因为上游按 720p 收钱);只给 last_frame_url 不给 first_frame_url;首尾帧和参考图或视频同时传;参考图超过 7 张;video_list 里超过一段。被拒的请求不花钱。已经开始生成再失败的 —— 包括被 Google 内容策略拦下的 —— 自动退款。
上线当天(2026-09-04)走公开 API 跑的六次生产调用,不是实验室环境。4K 大约是 720p 的三倍时长;每 10 秒轮询一次就够,别狂刷。
| 任务 | 耗时 | 成片 |
|---|---|---|
| 文生视频,4 秒,720p | 57 秒 | 1280×720,H.264 + AAC |
| 首尾帧,6 秒,720p | 121 秒 | 1280×720;第 2 秒画面就是传入的首帧 |
| 参考图生视频,2 张图,4 秒,9:16 720p | 67 秒 | 720×1280 |
| 文生视频,4 秒,1080p | 77 秒 | 1920×1080 |
| 文生视频,4 秒,4K | 176 秒 | 3840×2160 |
| 编辑一段 6 秒源片,720p | 99 秒 | 输出 6.0 秒,跟随源片 |
用常见邮箱注册、建一把 API key、按下面的示例调就行 —— 同一把 key 也能调目录里其它模型(Seedance、Kling、GPT Image、Claude、Gemini 文本)。支持 Stripe、PayPal、支付宝,中国大陆可直连。注册送 $0.10,不够出一条完整的片子(最小的一单是 4 秒 720p,$0.28),真要测请按 $10 充值来规划。
cURL
# Text-to-video. Same endpoint for every mode; the body decides.
curl -X POST https://api.apimodels.app/v1/video/generations \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni-1.1-flash",
"prompt": "a paper boat drifting down a rain-filled gutter, low angle, soft morning light",
"duration": "8",
"resolution": "720p",
"aspect_ratio": "16:9"
}'
# -> { "data": { "taskId": "..." } } 8 s x $0.07 = $0.56, charged only on success
# First/last frame: add first_frame_url (+ last_frame_url); nothing else changes.
# "first_frame_url": "https://example.com/first.jpg",
# "last_frame_url": "https://example.com/last.jpg"
# Poll until state is "completed" or "failed"
curl "https://api.apimodels.app/v1/video/generations?task_id=TASK_ID" \
-H "Authorization: Bearer YOUR_API_KEY"Python
import requests, time
H = {"Authorization": "Bearer YOUR_API_KEY", "Content-Type": "application/json"}
ENDPOINT = "https://api.apimodels.app/v1/video/generations"
# First/last-frame image-to-video: the clip starts on first_frame_url and
# lands on last_frame_url. 6 s x 1080p x $0.10 = $0.60.
task_id = requests.post(ENDPOINT, headers=H, json={
"model": "gemini-omni-1.1-flash",
"prompt": "the camera slowly pushes in as the clouds roll over the ridge",
"first_frame_url": "https://example.com/first.jpg",
"last_frame_url": "https://example.com/last.jpg",
"duration": "6", # "4" / "6" / "8" / "10" -- anything else is a 400
"resolution": "1080p", # "720p" / "1080p" / "4k" -- 360p is a 400
}).json()["data"]["taskId"]
while True:
data = requests.get(ENDPOINT, headers=H, params={"task_id": task_id}).json()["data"]
if data["state"] == "completed":
print(data["resultUrls"][0]); break
if data["state"] == "failed":
print(data["failMsg"]); break # failed jobs are refunded
time.sleep(10)APIMODELS 上 720p 每秒 $0.07、1080p $0.10、4K $0.20,按你请求的输出时长(4 / 6 / 8 / 10 秒)计;8 秒 720p 是 $0.56。带视频输入的任务一口价 $0.70(720p/1080p)或 $1.05(4K)。Google 官方 Gemini API 按视频输出 token 收 $17.50 / 百万,Google 自己换算 720p 约每秒 $0.10,1080p 约 $0.15、4K 约 $0.30,没有免费层。这里只有成功出片才扣费。
模型 ID 是 gemini-omni-1.1-flash。向 https://api.apimodels.app/v1/video/generations 发 POST,带 Authorization: Bearer 头和 JSON 请求体,返回 data.taskId;然后 GET https://api.apimodels.app/v1/video/generations?task_id=… 轮询,直到 data.state 为 completed(data.resultUrls[0] 就是 mp4)或 failed(data.failMsg 写明原因,费用退回)。四种模式用同一个 ID 和端点。
传 first_frame_url(公网可访问的图片 URL),可选再传 last_frame_url;片子从首图开始、落在尾图上,prompt 描述中间的运动。只传 last_frame_url 会被拒(400),首尾帧也不能和 images 或 video_list 同时出现在一个请求里。我们实测一条 6 秒 720p 的首尾帧任务 121 秒出片,第 2 秒的画面就是传入的首图。
可以。在 video_list 里放一段 {url, start, ends},窗口最长 10 秒、源文件最长 30 秒,prompt 写要改什么(我们实测「让它下雪」保留了原来的地形、机位和光线)。输出长度跟随源片,duration 会被忽略。每次一口价 720p/1080p $0.70、4K $1.05,所以 720p 源片约 7 秒以上比官方按秒算便宜,更短则更贵。
不支持 360p 草稿档(Google 卖约 $0.03/秒,我们的上游按 720p 收,所以直接 400、不悄悄给你升档);不支持 4/6/8/10 以外的时长;参考图不能超过 7 张;源片不能超过一段;也不做超过 10 秒窗口的场景延长。需要 30 秒单次成片或续写,请用 Seedance 2.5。
是 Google 的 gemini-omni-1.1-flash,经合作渠道提供,所以成片分辨率、首尾帧行为和音轨都与官方 API 一致;Google 的不可见 SynthID 水印是模型自带的,这里同样存在。不需要 Google 账号、Cloud 项目或计费设置 —— 一把 APIMODELS 的 API key 就够,可以用 Stripe、PayPal 或支付宝付款。