下列所有模型通过统一 API、一个 key 即可调用。点击模型查看完整 playground 与文档。
| 模型 | model 参数 | 价格 | 说明 |
|---|---|---|---|
| GPT Image 2.5 Flare | gpt-image-2.5-flare | $0.008 - $0.3 | 【Flare 档】走量用的快档:2.5 的全部能力,延迟约为 GPT Image 2 的一半、同一条提示词下约为 Sunburst 的两倍速,默认 medium 画质。1K、2K 同画质档与 Sunburst 同价,选它图的是速度;到了 4K,Flare 的价格更低。价格按「分辨率 × 画质」分十五格(1K $0.008–$0.08 / 2K $0.020–$0.15 / 4K $0.02–$0.3),只为你要的细节付钱。GPT Image 2.5 是 OpenAI 最新的图像模型。它相比 GPT Image 2 的进步,主要不在「第一张图生成得多好」,而在「改图」这件事上。 过去让 AI 改一个局部,常常牵一发动全身:改服装把脸改了,调背景把整体风格带跑了。2.5 可以指定画面里你不满意的位置,只改那一处,主体、构图和风格保持不动。更关键的是多轮:同一个角色或产品经过很多轮编辑仍然是同一个,不再改几轮就开始走形 —— 这意味着为了稳定而往提示语里塞的那些结构化约束、固定视角、固定光照,大部分可以不写了。 还有一个能立刻验证的差别:2.5 原生支持透明底 PNG,而 GPT Image 2 只能给你一个纯色背景、需要自己抠。所以判断手上跑的是哪一代,最简单的办法就是要一张透明背景的图。 出图更清晰、生成更快,1:1、3:4、4:3、9:16、16:9、21:9 六种画幅都能精确控制。 API 上是两个型号:gpt-image-2.5-flare 是默认档,画质与 2.5 一致而延迟约为 GPT Image 2 的一半,适合社媒内容、电商视觉这类走量场景;gpt-image-2.5-sunburst 用更长的时间换更高的精度。 ⚠️ 手绘 Sketch(在画布上涂抹给模型当参考)、创作模板、在图上直接评论改图,这三项目前只在 ChatGPT 里,API 不提供 —— 按这些能力做集成之前请先确认。 |
| GPT Image 2.5 Sunburst | gpt-image-2.5-sunburst | $0.008 - $0.47 | 【Sunburst 档】放大看的精度档:每张比 Flare 多花约一倍时间,换来皮肤织物纹理、密集排版、金属反光面这些经得起放大的细节,默认 high 画质。1K、2K 同画质档与 Flare 同价,多付的只是时间;4K 单独定价、比 Flare 高。价格按「分辨率 × 画质」分十五格(1K $0.008–$0.08 / 2K $0.020–$0.15 / 4K $0.02–$0.47),只为你要的细节付钱。GPT Image 2.5 是 OpenAI 最新的图像模型。它相比 GPT Image 2 的进步,主要不在「第一张图生成得多好」,而在「改图」这件事上。 过去让 AI 改一个局部,常常牵一发动全身:改服装把脸改了,调背景把整体风格带跑了。2.5 可以指定画面里你不满意的位置,只改那一处,主体、构图和风格保持不动。更关键的是多轮:同一个角色或产品经过很多轮编辑仍然是同一个,不再改几轮就开始走形 —— 这意味着为了稳定而往提示语里塞的那些结构化约束、固定视角、固定光照,大部分可以不写了。 还有一个能立刻验证的差别:2.5 原生支持透明底 PNG,而 GPT Image 2 只能给你一个纯色背景、需要自己抠。所以判断手上跑的是哪一代,最简单的办法就是要一张透明背景的图。 出图更清晰、生成更快,1:1、3:4、4:3、9:16、16:9、21:9 六种画幅都能精确控制。 API 上是两个型号:gpt-image-2.5-flare 是默认档,画质与 2.5 一致而延迟约为 GPT Image 2 的一半,适合社媒内容、电商视觉这类走量场景;gpt-image-2.5-sunburst 用更长的时间换更高的精度。 ⚠️ 手绘 Sketch(在画布上涂抹给模型当参考)、创作模板、在图上直接评论改图,这三项目前只在 ChatGPT 里,API 不提供 —— 按这些能力做集成之前请先确认。 |
| Gemini 2.5 Flash Image | gemini-2.5-flash-image | $0.02 | Gemini 2.5 Flash Image 是 Google 的快速图像模型,在我们这儿是一口价 $0.02 一张 —— 没有分辨率档、没有画质档,不管你怎么传,一次请求就是这个价,也就没有「该填哪一档」这个需要决策的字段。它同时支持文生图和参考图编辑:不传图就是从提示词生成,传了图就是照着改。这种「单价最低 + 计价最简单」的组合适合走量:批量铺图、快速试稿、把单位成本压到最低的自动化管线,这些地方每张省下的那一分钱,比多出来的那几个百分点画质更要紧。反过来,它的定位也决定了不该拿它当交付档 —— 要更高的画质上限和更稳的图内文字渲染,请用 Nano Banana Pro(Gemini 3 Pro Image);要新一代 Flash 的画质和分辨率分档,看 Nano Banana 2(Gemini 3.1 Flash Image)。这几个模型在我们这儿共用同一个端点和同一把 API Key,换用只改 model 这一个字符串,代码结构不用动。不需要 Google Cloud 项目、不需要给 Google 绑卡、不需要配置区域,注册即可调用,国内可直连,失败不扣费,结果保留 30 天。 |
| GPT Image 2 | gpt-image-2 | $0.025+ | GPT Image 2 是 OpenAI 的图像生成模型,文本排版精确、像素级编辑稳定、prompt 遵从度高。在 APIMODELS 上文生图与图生图都支持(同一 endpoint 按是否携带参考图自动路由),单次最多 16 张参考图做多图融合/编辑,原生 1K / 2K / 4K 分辨率、分档计价 $0.025 / $0.03 / $0.05 每张,可用 aspect ratio(1:1、2:3、3:2、16:9、9:16 等)控制画幅。 这条是「省事」的通道:画质固定跑 medium 档,请求里传 quality 不会生效,所以价格只跟分辨率走、少一个要决策的字段。更便宜的纯 API 通道 gpt-image-2-lite(只有 1K 一档,一口价 $0.01)同理:quality 参数会被忽略。如果你需要自己挑画质,请用同一个底层模型的 gpt-image-2-all —— 它把完整的「分辨率 × 质量」矩阵开放出来(1K/2K/4K × low/medium/high,外加 auto),1K low 低到 $0.01,要极限细节的 high 档也调得到;而且它是 OpenAI SDK 兼容的同步通道,Codex / Cursor 改个 base_url 就能直接调。本页底部「相关模型」里有它的入口。 还有一个差别值得先知道:这条通道的内容审核相对宽松。近 30 天实测,这里 0.93% 的请求被上游安全系统拒绝,而 gpt-image-2-all 是 8.0% —— 底层是同一个模型,只是审核口径不同。如果同一段提示词在那边反复被拒,可以先来这条试。被拒的请求不扣费。 一个 API Key 覆盖全部模型,国内可直连,无需 OpenAI 组织认证,失败不扣费,结果托管在 R2、保留 30 天。 |
| Qwen Image 3.0 | qwen3-image | $0.035 | Qwen Image 3.0 是阿里巴巴的图像生成模型,最见功力的地方是「图里的字」。10px 的小字它能渲染得清晰可辨,12 国语言、20+ 字体原生支持,所以报纸版式、餐厅菜单、试卷、信息图、网页与 UI 稿这类「文字密集又要讲版面」的活,它能一次生成到位,不必事后再往图上贴文字。指令理解也扎实:最长 4.5k token 的提示词它读得完、照着做,复杂图文指令不会做一半丢一半。 在 APIMODELS 上,文生图和图像编辑是同一个模型、同一个端点,靠有没有传参考图自动切换 —— 不传就是文生图,传了(最多 3 张)就是按图编辑或多图融合。输出 1K 或 2K,8 种画幅(1:1、3:2、2:3、4:3、3:4、16:9、9:16、21:9)或 auto 跟随输入图,PNG 格式。异步任务:POST 创建后 GET 轮询,也可以传 callback_url 让我们回调你。 价格 1K 与 2K 同价 $0.035/张,图像编辑时每张参考图另加 $0.004,失败不扣费。出图按我们自己的生产数据:中位 73 秒、九成在 96 秒内,最快见过 36 秒;轮询窗口留 3 分钟足够,别按几十秒就掐。结果文件在我们的存储上保留 30 天,需要长期留存请自行转存。一个 API Key 同时可调图片、视频、大模型与语音,国内可直连。 |
| Qwen Image 3.0 Pro | qwen3-image-pro | $0.037+ | Qwen Image 3.0 Pro 是 Qwen Image 3.0 更高保真的一档。标准版已经把「图里的字」做得很稳,Pro 在此之上把画质推到照片级:微表情、毛孔、发丝这些细节逼近真实摄影,主图、人像、以及那些「细节一糊就露怯」的密集排版,交给它更稳妥。内容承载力同样在线 —— 最长 4.5k token 提示词、12 国语言与多种字体原生渲染,主流网页、游戏、直播界面的仿真也做得出来。 用法与标准版完全一致:同一个端点,不传参考图就是文生图,传了(最多 3 张)就是编辑或多图融合;输出 1K 或 2K、8 种画幅或 auto,PNG;异步创建后轮询或走 callback_url。想省成本就用 qwen3-image,想要照片级细节或要拿去印刷再换 qwen3-image-pro,切换只改 model 一个字段。 价格按分辨率分档:1K $0.037/张、2K $0.075/张,每张参考图另加 $0.004,失败不扣费。Pro 明显更慢而且尾巴长:我们自己的数据是中位 121 秒,但一成会超过 324 秒、最慢见过 359 秒。轮询窗口至少留 8 分钟 —— 按中位数去设窗口正是「任务卡住」的最常见原因。结果文件保留 30 天。一个 API Key 通调全站模型,国内可直连。 |
| Real-ESRGAN Upscaler | real-esrgan | $0.004 | Real-ESRGAN 是专门为插画、二次元和手绘 / 绘画作品调过的 AI 放大器。它最高能放到 10 倍,足以顶到 4K、8K 乃至 10K 的打印级分辨率,而线条保持锐利、平涂保持干净 —— 这恰恰是扩散式放大器最容易翻车的地方:那一类模型本质是「重绘」,会把线稿画软、在平涂上添出本来没有的笔触和纹理。需要的话可以同时打开 GFPGAN 人脸增强,在放大的同一遍里把脸部细节一起修清楚。适用范围我们说在前面,免得你按错的预期去用:对真人照片,它主要就是「放大」,不去模糊、不修老照片破损、也不降噪 —— 请把它当成「把画作放大到能印、能上高 DPI 屏幕」的工具,而不是照片修复工具;指望它救一张糊掉的旧照片,结果只会是一张更大的糊照片。scale 取 1 到 10,计费是一口价 $0.004 一张,放大倍数和人脸增强都不额外加钱,只对成功的请求扣费。一个 API Key 同时还能调站内的图片、视频、语音与大模型,国内可直连,结果文件保留 30 天,请及时下载或转存。 |
| FLUX.2 Klein 4B | flux-2-klein-4b | $0.006 | FLUX.2 Klein 4B 是 Black Forest Labs 的极速照片级图片模型,大约 1-2 秒出图——适合要量、要快、要写实的场景:草稿迭代、批量出素材、电商与社媒配图。文生图和图生图用同一个模型名:不带参考图就是纯文生,最多带 3 张参考图做图生图(每张会自动压缩到约 1MP),aspect_ratio 传 match_input_image 可跟随参考图比例。输出固定约 2MP,12 种画幅可选,支持 jpg / png / webp。计价是一口价:每张 $0.006,另加每张参考图 $0.0015(最多 3 张)——是平台上最便宜的照片级通道之一。统一图片端点、失败不扣费,详细参数和三语言代码示例见文档页。 |
| GPT Image 2 All | gpt-image-2-all | $0.01+ | GPT Image 2(All)是 OpenAI 兼容的图片 API:把 OpenAI SDK、Codex、Cursor 的 base_url 指向 https://api.apimodels.app/v1,model 填 gpt-image-2-all,images.generate() 与 images.edit() 原样就能跑,不用改代码结构。同步返回、无需轮询 taskId,支持文生图与多图编辑(单次最多 16 张参考图),并支持 mask 局部重绘。 它和 gpt-image-2 底层是同一个模型,区别只有两点:接入方式(这条是 OpenAI 兼容的同步通道,那条是异步 taskId 通道),以及画质要不要你自己挑。这条把完整的「分辨率 × 质量」矩阵开放出来 —— 1K/2K/4K 搭配 low / medium / high,另有 auto(按 medium 计费):1K low $0.01、1K medium $0.025、1K high $0.07;2K 依次 $0.025 / $0.03 / $0.10;4K 依次 $0.05 / $0.05 / $0.23。想压成本就用 1K low,要极限细节就上 high。生成速度 low 约 40 秒、medium 约 60-90 秒、high 约 2 分钟。 反过来,如果你不想纠结画质该填什么,用 gpt-image-2 更省事:它固定跑 medium 档,价格只按分辨率分三档($0.025 / $0.03 / $0.05),少一个要决策的字段。本页底部「相关模型」里有它的入口。 再补一个实测差别:这条通道的内容审核较严格。近 30 天,这里 8.0% 的请求被上游安全系统拒绝,而 gpt-image-2 只有 0.93%。两者底层同一个模型,差的是这条通道的审核阈值 —— 做商业素材通常没问题,但涉及人物肖像、品牌标识、证件类版面时更容易被拦。被拒的请求不扣费,换到 gpt-image-2 往往能过。 一个 API Key,国内可直连,无需 OpenAI 组织认证,失败不扣费。 |
| Nanobananapro-gemini | nanobananapro-gemini | $0.03 | nanobananapro-gemini 是 Gemini 3 Pro Image 的经济渠道版本,$0.03/张,支持文生图与编辑、1K/2K/4K,主打专业素材创作与高保真文字渲染。引擎与 Nano Banana Pro 相同(Gemini 3 Pro),走更便宜的渠道,适合对成本敏感的高量专业出图;要主渠道约 99% 成功率与稳定性,选 nanobananapro。 |
| Nanobanana2-gemini | nanobanana2-gemini | $0.025 | nanobanana2-gemini 是 Gemini 3.1 Flash Image 的经济渠道版本,$0.025/张,为速度与大批量优化,支持文生图与编辑、1K/2K/4K。引擎与 Nano Banana 2 相同(Gemini 3.1 Flash),走更便宜的渠道,适合海量、低成本的快速出图;要主渠道稳定性选 nanobanana2。 |
| SparkPix Image | sparkpix-image | $0.008 | SparkPix Image 是 SparkPix 面向生产场景的文生图模型,主打亚秒级出图(通常 1 秒内)与极低单价($0.008/张),兼顾画质、提示词遵从与出色的图内文字渲染,并支持 LoRA 定制风格。是平台上最快、最便宜的图片档之一,适合社媒视觉、电商铺图、A/B 创意、快速原型等需要海量出图与快速迭代的场景。要编辑 / 融合已有图片,可搭配 SparkPix Image Edit。 |
| SparkPix Image Edit | sparkpix-image-edit | $0.013 | SparkPix Image Edit 是 SparkPix 的多图编辑模型,亚秒级(1 秒内)完成、单价低($0.013/张)。它擅长精准提示词控制、出色的图内文字渲染,并支持多图编辑与融合,可嵌进高频生产管线:换背景、商品合成、版式与文字调整、批量改图。从零生成用 SparkPix Image,改图 / 多图融合用 SparkPix Image Edit。 |
| Kling V3 Image | kling-v3-image | $0.05 | Kling V3 Image 是可灵 V3 的图像生成模型,支持文生图,以及「单图参考」的图生图(image_reference,用于锁定主体或人脸),1K / 2K 分辨率,$0.05/张。适合要保持某个主体 / 人脸一致的出图。需要多图参考与融合、元素一致性与组图输出,选 Kling V3 Omni Image。 |
| Kling V3 Omni | kling-v2-new | $0.05+ | Kling V3 Omni Image 通过 omni-image 接口提供可灵 V3 的全能图像能力:多图参考与融合(image_list)、元素一致性(element_list,让角色 / 商品 / 道具在多图间保持一致)、单图或组图(series)输出,支持 1K / 2K / 4K(1K/2K $0.05、4K $0.10)。适合复杂的多素材合成与成系列出图——产品系列、分镜、套图。只需单主体一致,用更轻的 Kling V3 Image 即可。 |
| Kling Omni-Image | kling-image-o1 | $0.05 | Kling Omni-Image(kling-image-o1)是可灵(Kling)的图像生成与编辑模型,支持 1K / 2K 分辨率,并支持多图输入做创意编辑与合成,$0.05/张。可同时传入多张图做参考与融合,用于创意合成、元素组合、风格借鉴,比单图编辑更灵活,适合在已有素材上做组合与再创作。 |
| Doubao Seedream 5.0 Lite (Official) | doubao-seedream-5-0-260128 | $0.055 | Doubao Seedream 5.0 Lite 是字节跳动豆包的图像模型,通过官方火山方舟(Volcano Ark)接口接入,稳定且为第一方画质。一个接口同时覆盖文生图(不传 image)与图生图 / 多图融合编辑(传一张或多张 image),按是否带参考图自动路由。输出 2K 或 4K 的 PNG、无水印,可直接用于电商与设计生产。注意:图生图若产出仍含真实人物身份,会被火山内容审核拒绝(防深伪),请使用合成脸或非真人素材。约 $0.055/张,远低于官方。 |
| Doubao Seedream 5.0 Pro | doubao-seedream-5-0-pro | $0.03 / $0.06 | Doubao Seedream 5.0 Pro 是字节跳动豆包的旗舰图像模型,做的是「可控生产」而不是「一发入魂」。最有代表性的能力是交互式编辑:你可以用坐标、框选、箭头,或者干脆在图上手绘一个标记,告诉它要改的就是这一块,它就只动那一处,画面其余部分的构图、光影和风格原样保留。图内文字这一项提升很大,14 种以上语言(中、英、日、韩、俄、阿拉伯、泰、土耳其、西、葡、法、德、越南、印尼等)都能排得准,海报、杂志封面、信息图这类活儿它接得住;提示词写得短它也能读出意图,不必堆一长串约束。一个端点覆盖三种用法:不传 image 就是文生图,传一张是单图编辑,传 2 到 10 张就是多图融合。输出是单张 1K 或 2K、无水印,价格 1K $0.03、2K $0.06 每张;想更省就用同门的 Seedream 5.0 Lite,换档只改 model 一个字段。一个限制要先知道,免得白跑:图生图如果产出仍然带着真实人物的身份,会被内容审核拒掉 —— 这是防深伪的既定规则,我们不绕过,做人像请改用合成脸或非真人素材。 |
| Doubao Seedream 5.0 Flash | doubao-seedream-5-0-flash | $0.03 | Doubao Seedream 5.0 Flash 是字节跳动豆包 Seedream 5.0 系列里主打速度与成本的一档,这里走的是火山方舟官方通道。它面向高频、大批量的出图场景,在出图速度和单价比画质上限更重要的地方最合适:我们实测 2K 约 13–15 秒、1K 约 10 秒出一张。文生图和图生图共用一个端点,最多可传 10 张参考图做融合编辑。它还能编辑本身就是透明背景的图并保住透明:传一张带透明通道的 PNG,把 background 设为 transparent,返回的仍是带透明通道的 PNG,可以直接放进 banner 或商品模板。输出为 1K 或 2K(这个模型没有 4K),比例从 21:9 到 9:16,每张 $0.03,无水印。它还能把一张图拆成 1 张底图加最多 16 个透明 PNG 图层(文字、主体、道具等),每层都带名称、描述、叠放顺序和在原图中的坐标框;底图是抬走图层后补全的画面,图层 PNG 会比它的坐标框大。图层拆分按输出张数计费,每张 $0.03,比如拆成底图加 11 层就是 $0.36。 |
| Doubao Seedream 4.5 | doubao-seedream-4-5-251128 | $0.05 | Doubao Seedream 4.5 是字节跳动豆包的高质量图像模型,支持文生图与图片编辑,2K / 4K 分辨率,并支持多图输入,$0.05/张,适合电商与设计的高质量出图与改图。Seedream 5.0 Lite 更新(官方火山方舟、无水印 PNG);4.5 为前一代,2K/4K 生成与编辑依旧扎实,是稳妥的高质量备选。 |
| Grok 4.2 Image | grok-4.2-image | $0.0075 | Grok 4.2 Image 是 apimodels.app 上 Grok 图片生成的便宜档:$0.0075/张,是标准档 Grok Imagine Image($0.03)的四分之一,跑的是同一个模型、同一个端点,生产实测中位 19 秒出图。支持文生图和单参考图编辑(把图片地址放进 image_url、用提示词描述改动 —— 字段名写成 image 会被静默丢掉),画幅 10 个值:1:1、16:9、9:16、4:3、3:4、3:2、2:3、2:1、1:2、auto。分辨率传 resolution 取 1k 或 2k,不传默认 2k,而且两档同价 —— 2K 方图实测 2048×2048、16:9 为 2816×1584,一分钱不多收(对比 grok-imagine-image-pro 的 2K 要 $0.12)。三件事它做不到:四个超宽比例(19.5:9 / 9:19.5 / 20:9 / 9:20,要超宽用 grok-imagine-image)、蒙版修复、多图融合(要多图用 gpt-image-2 的 16 张或 grok-imagine-image-pro 的 3 张)。走量试稿选它,通用出图选 Grok Imagine Image,要 2K 照片级细节上 Pro 档,换档只改 model 一个字段。 |
| Grok Imagine Image | grok-imagine-image | $0.03 | Grok Imagine Image 是 xAI Grok 的图像模型,主打快速出图(约 4 秒)的文生图与图片编辑,图内文字渲染较强,并提供非常宽的宽高比集合(方图、常规横竖屏到 20:9 超宽幅等十余种)。它是主打速度与成本的标准档;需要更高精度与细节、要多轮精修时,可上 Grok Imagine Image Pro。常见做法是标准档跑量、关键图用 Pro 精修。 |
| Grok Imagine Image Pro | grok-imagine-image-pro | from $0.08 | Grok Imagine Image Pro 是 xAI Grok 图像模型的升级档,语义理解更强、细节生成更精细,出图精度更高,并支持多轮优化。适合品牌主视觉、产品精修图、对细节与文字质感要求高的营销素材,以及需要反复打磨的关键画面。只需快速、低成本批量出图时,标准版 Grok Imagine Image 更划算;两者同一接口,可先跑量再精修。 |
| Grok Imagine Image 2.0 | grok-imagine-image-2 | $0.03 起 | Grok Imagine Image 2.0 是 xAI 的图像模型,目标只有一个:做出能直接投入工作的图。它像设计师那样规划排版与版面 —— 我们用一张 2K 海报实测过:指定的标题、日期行和底部小字网址,三处全部逐字正确、清晰可读。它一次调用最多融合 3 张参考图,并且认得清哪个主体该放在哪儿(三个不同物体的融合实测下来,三个都各自可辨,不是照着文字重画的);第 4 张会被明确报错拒绝,而不是静默丢掉 —— 静默丢弃会让你误以为融合成功了。编辑时它保主体也保场景:一张红色茶壶要求改成藏青,壶型、木桌纹理、窗光、窗台植物、背景木椅全部留住,只有颜色变了。 一条实测得出、而非假设的提醒:它是在同一场景下重绘,不是在原图上逐像素修改,所以每次输出的机位、裁切和主体大小都会变。换色、换材质、加减物件、多图融合都很合适;如果你的要求是「只动这一处、其余像素一个都不许变」,那该用 GPT Image 2 或 Nano Banana Pro 那条线。另一条限制同样要说清楚:它做不了透明背景 —— 要求 alpha 通道时,它会把那种灰白棋盘格当成普通像素画出来,返回的 PNG 是 RGB、根本没有 alpha,缩略图上看着像抠好的图,其实不是(2K 编辑和 2K 文生图两条路径我们都试过,结果一样)。需要去背请另接一个专门的抠图步骤。 价格按分辨率 × 质量分四档:1K low $0.03、2K low $0.04、1K medium $0.045、2K medium $0.06(每张)。quality 只有 low 和 medium 两个值、省略即 medium —— 所以不显式传 quality 就是在买 medium 档。四档相对 xAI 官方标价都便宜 25%,其中 2K low 便宜 33%。参考图不额外收费(xAI 按每张输入图 $0.01 加收,我们不转嫁),所以图生图和文生图同价。画幅 14 种,含 19.5:9、9:19.5、20:9、9:20 四种超宽 —— 这四种是逐个实调验过的(19.5:9 实测出 1248×576),不是抄规格表,我们另一条 Grok 渠道恰恰就拒收它们。一个 API Key 直接调,无需单独的 xAI 账号,国内可直连,失败不扣费。 |
| Nanobanana2 | nanobanana2 | $0.05+ | Nano Banana 2 是基于 Google Gemini 3.1 Flash 的快速图像生成与编辑模型,主打出图快、单价低。支持文生图与基于参考图的编辑,覆盖 1K / 2K / 4K,是大批量、对成本敏感场景的首选——社媒视觉、快速迭代、批量创意。需要最高画质与最稳成功率时,可上 Nano Banana Pro(Gemini 3 Pro Image);两者共用同一接口,可自由切换。定价 1K/2K $0.05、4K $0.08。 |
| gemini-3.1-flash-image | gemini-3.1-flash-image | $0.04+ | gemini-3.1-flash-image 是 Google 这个高效图像模型的正式版(GA):画质稳、延迟低,是奔着高并发和快速迭代去的。文生图与对话式编辑走同一个端点、同一个价 —— 传一张参考图加一句「把背景换成傍晚的海边」就是编辑,不传就是从零生成,512 / 1K / 2K / 4K 四档都能编辑,不额外收费。价格按分辨率分档:512 $0.04、1K $0.06、2K $0.06、4K $0.10。这里最值得记住的一条是 2K:Google 官方牌价是 1K $0.067、2K $0.101、4K $0.151,所以我们 2K 这一档便宜 40%、4K 便宜 34%,而 1K 只便宜 10% —— 折扣必须看档位,笼统说一句「便宜四成」放到 1K 上就是虚标。更实用的事实是 1K 和 2K 在我们这儿同为 $0.06,升到 2K 一分钱不加,而在官方那儿 2K 比 1K 贵 50%。速度按我们自己的生产数据说:近 14 天 5,802 次成功调用,中位 14 秒、成功率 97.2%;平均值是 24.8 秒、p90 约 55 秒 —— 少数复杂请求会把均值拉高,所以拿中位数设预期、拿 p90 设超时才准,别按平均值去掐。用它不需要 Google Cloud 项目、不需要给 Google 绑卡、也不用选区域,注册拿一个 API Key 就能调,国内可直连,失败不扣费。要更高的画质上限和更强的图内文字渲染,同一个端点换成 gemini-3-pro-image($0.08 起)即可,改的只是 model 这一个字符串。 |
| gemini-3-pro-image | gemini-3-pro-image | $0.08+ | gemini-3-pro-image 是 Google 高端图像模型的正式版(GA),定位是「成品级」而不是「跑量」:画质上限和图内文字的高保真渲染是它的强项,又带高级推理,复杂的版面和图文指令它会先想明白再画,不容易做一半丢一半。文生图与图像编辑共用一个端点,1K / 2K / 4K 三档都可用。价格按分辨率分档:1K 与 2K 都是 $0.08、4K $0.13 —— 相对 Google 官方牌价,1K/2K 这两档便宜 40%,4K 便宜 46%。怎么在 Pro 和 Flash 之间选,其实一句话就够:要交付的成品、要图里的字一个都不能错,用 Pro;要低延迟、走量、成本敏感,用 gemini-3.1-flash-image(2K 每张 $0.06、中位 14 秒出图)。两者在我们这儿是同一个端点、同一把 API Key,切换只改 model 这一个字符串,代码结构不用动 —— 常见做法是日常高频跑 Flash,只有最终交付那一版才走 Pro,这样成本和质量都不浪费。不需要 Google Cloud 项目、不需要绑定结算账号、不需要配置区域,注册即可调用,国内可直连,失败不扣费,结果保留 30 天。 |
| Nanobanana-2-lite | nanobanana-2-lite | $0.025 | Nano Banana 2 Lite 是 Google Gemini 3.1 Flash Image 家族里最便宜的一档:统一 $0.025/张,没有分辨率档位要算。文生图与改图都支持——只给提示词即可出图,也可带最多 10 张参考图再描述要改成什么样。唯一取舍是分辨率,输出固定 1K;需要 2K/4K 请用 $0.05 的 Nano Banana 2。支持 15 种画面比例,含 21:9 电影宽幅与 8:1 横幅。 |
| Gemini 3 Pro Image (Pro) | nanobananapro | $0.068+ | Nano Banana Pro 是基于 Google Gemini 3 Pro 的高端图像生成与编辑模型,主打最高画质与可靠性,实测成功率约 99%。既能文生图,也能基于参考图做编辑,支持 1K / 2K / 4K 输出,适合对出图质量和稳定性要求高的生产场景——商品图、营销创意、设计系统等。需要更快、更低单价的量产场景,可搭配基于 Gemini 3.1 Flash 的 Nano Banana 2;两者在同一套接口下调用,可随时切换。定价 1K/2K $0.068、4K $0.13,远低于官方。 |
按张按模型:Nano Banana 约 $0.02 起,GPT Image 2 为 $0.025(1K)/$0.03(2K)/$0.05(4K),Nano Banana Pro $0.068/$0.13。仅成功扣费,注册送 $0.1。
调 POST /api/v1/images/generations,带 prompt + image(单张)或 images[](GPT Image 2 最多 16 张)。异步:GET ?task_id= 轮询到完成。本页有 cURL/Python/Node 示例。
可以。所有图片模型同一端点、同一把 Key,靠 model 参数切换,无需逐家注册,比各家官方 API 便宜。